功能特性
多轮对话
通过 messages 数组实现上下文连续的多轮对话
Chat Completions 接口本身是无状态的:服务端不会记住之前的对话。要实现多轮对话,需要在每次请求时把历史消息按顺序一并传入 messages。
适用模型
所有对话模型均支持。可在模型广场查看各模型的上下文长度。
示例
from openai import OpenAI
client = OpenAI(api_key="YOUR_API_KEY", base_url="https://netnexus.top/api/v1")
messages = [
{"role": "system", "content": "你是一名资深的企业 IT 顾问。"},
{"role": "user", "content": "我们公司想接入大模型做知识库问答,从哪里开始?"},
]
first = client.chat.completions.create(model="qwen3.7-plus", messages=messages)
messages.append({"role": "assistant", "content": first.choices[0].message.content})
# 第二轮:带上完整历史继续提问
messages.append({"role": "user", "content": "预算有限的话,模型怎么选?"})
second = client.chat.completions.create(model="qwen3.7-plus", messages=messages)
print(second.choices[0].message.content)注意事项
- 历史消息越长,输入 token 越多,费用也越高。对话很长时,可以只保留最近几轮或对早期内容做摘要。
- 总长度不能超过模型的上下文长度,否则请求会报错。
- 固定不变的系统提示词放在最前面,更容易命中上下文缓存。
