智枢网关NEXUSGATE
功能特性

视觉理解

让模型理解图片内容

支持视觉理解的模型可以同时接收文字与图片,用于图片问答、截图分析、票据识别、图表解读等场景。

适用模型

模型广场中带有 视觉理解 标签(即支持多模态输入)的模型均支持,例如 qwen3.7-plus、gpt-5.5、gemini-3.5-flash。

示例

把 content 写成数组,同时包含文字与图片:

from openai import OpenAI

client = OpenAI(api_key="YOUR_API_KEY", base_url="https://netnexus.top/api/v1")

resp = client.chat.completions.create(
    model="qwen3.7-plus",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "这张图片里有什么?"},
                {"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}},
            ],
        }
    ],
)
print(resp.choices[0].message.content)

本地图片可以转成 Base64,以 Data URL 形式传入:

import base64

with open("photo.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

image = {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}}

注意事项

  • 图片同样按 token 计费,分辨率越高消耗越多。
  • 图片 URL 需要能被公网访问;内网图片请使用 Base64 方式。

本页目录

联系商务

为您的企业定制 AI 接入方案

微信同号,在微信中搜索手机号即可添加