智枢网关NEXUSGATE
功能特性

多轮对话

通过 messages 数组实现上下文连续的多轮对话

Chat Completions 接口本身是无状态的:服务端不会记住之前的对话。要实现多轮对话,需要在每次请求时把历史消息按顺序一并传入 messages。

适用模型

所有对话模型均支持。可在模型广场查看各模型的上下文长度。

示例

from openai import OpenAI

client = OpenAI(api_key="YOUR_API_KEY", base_url="https://netnexus.top/api/v1")

messages = [
    {"role": "system", "content": "你是一名资深的企业 IT 顾问。"},
    {"role": "user", "content": "我们公司想接入大模型做知识库问答,从哪里开始?"},
]
first = client.chat.completions.create(model="qwen3.7-plus", messages=messages)
messages.append({"role": "assistant", "content": first.choices[0].message.content})

# 第二轮:带上完整历史继续提问
messages.append({"role": "user", "content": "预算有限的话,模型怎么选?"})
second = client.chat.completions.create(model="qwen3.7-plus", messages=messages)
print(second.choices[0].message.content)

注意事项

  • 历史消息越长,输入 token 越多,费用也越高。对话很长时,可以只保留最近几轮或对早期内容做摘要。
  • 总长度不能超过模型的上下文长度,否则请求会报错。
  • 固定不变的系统提示词放在最前面,更容易命中上下文缓存。

本页目录

联系商务

为您的企业定制 AI 接入方案

微信同号,在微信中搜索手机号即可添加