模型广场
一个 Key 调用全球主流大模型。点击模型查看能力、价格与上下文限制。
价格仅供参考,实际结算价格以合同为准。数据更新于 2026-08-01。
gpt-5.6-luna
OpenAI
该模型是5.6 系列中一款快速且高性价比的模型。它适用于大批量、延迟敏感的任务,例如聊天、分类和轻量级代理工作流,在其定价级别下提供了能力可观的推理性能。
- 上下文
- 1.05M
- 输入
- ¥7 起
- 输出
- ¥42 起
元 / 百万 tokens
gpt-5.6-terra
OpenAI
该模型是5.6 系列中一款均衡型模型,定位介于旗舰级 Sol 层级与高性价比 Luna 层级之间。它适用于日常编程、推理和代理任务,在这些任务中需要在能力与成本之间取得平衡,以大约 Sol 一半的成本提供强劲的性能。
- 上下文
- 1.05M
- 输入
- ¥17.5 起
- 输出
- ¥105 起
元 / 百万 tokens
gpt-5.6-sol
OpenAI
该模型是5.6 系列中的旗舰模型。它适用于复杂推理、编程和代理工作流,尤其在命令行和多步骤编程任务以及长期问题解决方面表现尤为突出。
- 上下文
- 1.05M
- 输入
- ¥35 起
- 输出
- ¥210 起
元 / 百万 tokens
gpt-5.5
OpenAI
GPT-5.5 是一个在推理、代码和长上下文处理上更强、更稳定的通用大模型,适合复杂工程与分析任务。
- 上下文
- 1.05M
- 输入
- $5
- 输出
- $30
美元 / 百万 tokens
gpt-5.4-mini
OpenAI
GPT-5.4 mini 是 GPT-5.4 的轻量高效版本,主打更低延迟和更低成本,适合高并发、大规模生产场景。它支持文本和图像输入,在推理、编程和工具调用方面表现稳定,能够在能力与效率之间取得平衡。整体上,这个模型特别适用于聊天应用、代码助手和大规模 Agent 工作流,具备可靠的指令遵循能力、不错的多步推理能力,以及跨任务的一致表现。
- 上下文
- 400K
- 输入
- $0.75
- 输出
- $4.5
美元 / 百万 tokens
gpt-5.4-pro
OpenAI
GPT-5.4 Pro 在 GPT-5.4 统一架构的基础上,针对复杂、高风险任务强化了推理能力。该模型同样具备超 100 万 tokens 的上下文窗口(92.2 万输入、12.8 万输出),支持文本与图像输入。 GPT-5.4 Pro 针对分步推理、指令遵循与结果准确性做了专项优化,在智能代码生成、长上下文工作流及多步骤问题求解方面表现尤为出色。
- 上下文
- 1.05M
- 输入
- $30
- 输出
- $180
美元 / 百万 tokens
gpt-5.4
OpenAI
GPT-5.4 将 Codex 代码模型与 GPT 系列模型整合为统一系统。该模型支持超 100 万 tokens 上下文窗口(92.2 万输入、12.8 万输出),可同时处理文本与图像输入,能在同一工作流中完成高上下文推理、代码编写与多模态分析。 该模型在代码能力、文档理解、工具调用与指令遵循方面均实现性能提升。它被定位为通用任务与软件工程的强力默认模型,可生成生产级代码、整合多源信息,并以更少迭代次数、更高 token 效率执行复杂的多步骤工作流。
- 上下文
- 1.05M
- 输入
- $2.5
- 输出
- $15
美元 / 百万 tokens
gpt-5.3-codex
OpenAI
GPT-5.3-Codex 是 OpenAI 先进的智能体编程模型,它融合了 GPT-5.2-Codex 顶尖的软件工程能力,以及 GPT-5.2 更全面的推理与专业知识能力。 该模型在 SWE-Bench Pro 上取得了当前最优效果,在 Terminal-Bench 2.0 和 OSWorld-Verified 上也表现强劲,体现出其在多语言编程、终端操作熟练度与真实场景计算机使用能力上的提升。 模型针对长时间运行、工具调用类工作流进行了优化,并支持执行过程中的交互式调控,适用于复杂开发任务、调试、部署以及产品迭代工作。
- 上下文
- 400K
- 输入
- $1.75
- 输出
- $14
美元 / 百万 tokens
gpt-5.2-search
OpenAI
GPT-5.2 在 GPT-5.1 的基础上进一步增强了推理能力、多轮对话一致性和复杂指令理解能力,特别适合需要一定逻辑深度的场景,如技术方案分析、复杂业务流程梳理、Agent 调度和多工具协作。它在“智能密度”和“单位 Token 价值”之间取得了较好平衡,是偏高阶应用的常用选择。
- 上下文
- —
- 输入
- $1.75
- 输出
- $14
美元 / 百万 tokens
gpt-5.2
OpenAI
GPT-5.2 在 GPT-5.1 的基础上进一步增强了推理能力、多轮对话一致性和复杂指令理解能力,特别适合需要一定逻辑深度的场景,如技术方案分析、复杂业务流程梳理、Agent 调度和多工具协作。它在“智能密度”和“单位 Token 价值”之间取得了较好平衡,是偏高阶应用的常用选择。
- 上下文
- 400K
- 输入
- $1.75
- 输出
- $14
美元 / 百万 tokens
gpt-5.1
OpenAI
GPT-5.1 是一款通用型大语言模型,强调稳定性与性价比,适合大多数文本理解与生成场景,比如对话问答、代码辅助、文档总结和基础推理。它在响应速度、上下文理解和工具调用上表现均衡,通常作为生产环境中的“默认主力模型”,适合高频调用、对成本敏感但仍需要较好智能水平的业务。
- 上下文
- 400K
- 输入
- $1.25
- 输出
- $10
美元 / 百万 tokens
gpt-5-codex
OpenAI
该模型针对软件开发场景深度优化,在代码生成、代码理解、调试和重构等方面表现突出,适合用于智能编程助手、代码审查和自动化开发流程。
- 上下文
- 400K
- 输入
- $1.25
- 输出
- $10
美元 / 百万 tokens
gpt-5-pro
OpenAI
GPT-5 Pro 是 GPT-5 系列中的高端版本,专注于更强的复杂推理、多步骤分析和专业级内容生成能力,适合高价值业务、复杂决策支持和高级智能应用场景。
- 上下文
- 400K
- 输入
- $15
- 输出
- $120
美元 / 百万 tokens
gpt-5-chat-latest
OpenAI
该模型始终指向当前最新的 GPT-5 对话优化版本,专为交互式聊天场景设计,能够提供更自然、更连贯的对话体验,适合对用户交互质量要求较高的应用,但不保证长期版本一致性。
- 上下文
- 125K
- 输入
- $1.25
- 输出
- $10
美元 / 百万 tokens
gpt-5-nano-2025-08-07
OpenAI
这是 GPT-5 Nano 的稳定版本,专注于极低成本与高吞吐能力,适合标准化、重复性较高的文本处理任务,是大规模自动化场景中的理想选择。
- 上下文
- 1M
- 输入
- $0.05
- 输出
- $0.4
美元 / 百万 tokens
gpt-5-mini-2025-08-07
OpenAI
该模型是 GPT-5 Mini 在指定日期的稳定版本,在轻量化和性价比优势的基础上,提供更强的版本一致性,适合需要长期维护和可预测输出的生产级应用。
- 上下文
- 1M
- 输入
- $0.25
- 输出
- $2
美元 / 百万 tokens
gpt-5-nano
OpenAI
GPT-5 Nano 是面向极致性能和最低成本优化的超轻量模型,适合简单问答、规则化文本生成和嵌入式或边缘场景,在资源受限或超大规模调用环境中具有明显优势。
- 上下文
- 400K
- 输入
- $0.05
- 输出
- $0.4
美元 / 百万 tokens
gpt-5-mini
OpenAI
GPT-5 Mini 是 GPT-5 系列中的轻量化版本,在保持良好语言理解与生成能力的同时,显著降低了调用成本和延迟,适合高并发场景、实时对话和对成本敏感的业务应用。
- 上下文
- 400K
- 输入
- $0.25
- 输出
- $2
美元 / 百万 tokens
gpt-5-2025-08-07
OpenAI
该模型是 GPT-5 在 2025-08-07 时间点的稳定版本,提供一致可复现的模型行为和输出效果,适合对版本稳定性和结果可控性要求较高的生产环境和长期业务系统。
- 上下文
- 400K
- 输入
- $1.25
- 输出
- $10
美元 / 百万 tokens
gpt-5
OpenAI
GPT-5 是 OpenAI 推出的新一代通用大模型,具备全面提升的语言理解、复杂推理和内容生成能力,能够在多种业务场景下提供高质量、稳定的智能输出,适合作为企业级 AI 应用的核心基础模型。
- 上下文
- 400K
- 输入
- $1.25
- 输出
- $10
美元 / 百万 tokens
o3-deep-research
OpenAI
专为深度调研设计的 Agent 模型,能自主执行多步联网搜索、阅读数百个网页并生成分析报告,通过 Responses API 调用。
- 上下文
- 200K
- 输入
- $10
- 输出
- $40
美元 / 百万 tokens
gpt-4.1-nano-2025-04-14
OpenAI
GPT-4.1 nano 的首发版本快照,为对延迟极其敏感的应用提供稳定的基准性能。
- 上下文
- 1,047,576
- 输入
- $0.1
- 输出
- $0.4
美元 / 百万 tokens
o3-pro
OpenAI
2025年6月发布的旗舰推理模型(o3 增强版),专为需要长时间深度思考(Think Harder)和极高可靠性的复杂任务设计。
- 上下文
- 200K
- 输入
- $20
- 输出
- $80
美元 / 百万 tokens
gpt-4.1-mini-2025-04-14
OpenAI
GPT-4.1 mini 的首发版本快照,用于在生产环境中确保高性价比任务的稳定性。
- 上下文
- 1,047,576
- 输入
- $0.4
- 输出
- $1.6
美元 / 百万 tokens
gpt-4.1-2025-04-14
OpenAI
GPT-4.1 系列的首发稳定版本快照,锁定了该模型发布时的 1M 上下文窗口和长文本理解能力。
- 上下文
- 1,047,576
- 输入
- $2
- 输出
- $8
美元 / 百万 tokens
gpt-4.1-nano
OpenAI
极轻量级模型,专为极低延迟和边缘计算场景设计,性能超越 GPT-3.5 但体积更小,适合高频简单任务。
- 上下文
- 1,047,576
- 输入
- $0.1
- 输出
- $0.4
美元 / 百万 tokens
gpt-4.1-mini
OpenAI
2025年4月14日发布的轻量级全能模型,在保持 GPT-4o mini 速度优势的同时,大幅增强了指令跟随和代码生成能力。
- 上下文
- 1,047,576
- 输入
- $0.4
- 输出
- $1.6
美元 / 百万 tokens
gpt-4.1
OpenAI
GPT-4.1是一款旗舰级大语言模型,专为高级指令遵循、现实世界软件工程和长上下文推理优化。它支持100万token的上下文窗口,在编码(54.6% SWE-bench验证通过率)、指令遵从性(87.4% IFEval评分)和多模态理解基准测试中均优于GPT-4o和GPT-4.5。该模型针对精确代码差异比对、智能体可靠性及大文档上下文中的高召回率进行了调优,是智能体、集成开发环境工具链和企业知识检索的理想选择。
- 上下文
- 1,047,576
- 输入
- $2
- 输出
- $8
美元 / 百万 tokens
o3-2025-04-16
OpenAI
o3 模型的首发版本快照,代表了该模型发布时的原始性能基准。
- 上下文
- 200K
- 输入
- $2
- 输出
- $8
美元 / 百万 tokens
o3-mini-2025-01-31
OpenAI
o3-mini 的特定版本快照,用于在生产环境中获得稳定的高性能推理能力。
- 上下文
- 200K
- 输入
- $1.1
- 输出
- $4.4
美元 / 百万 tokens
o1-2024-12-17
OpenAI
o1 正式版的特定日期快照,代表了2024年底时该模型在复杂推理任务上的最佳水平。
- 上下文
- 200K
- 输入
- $15
- 输出
- $60
美元 / 百万 tokens
o1
OpenAI
OpenAI 首个正式版“推理”大模型(原草莓项目),通过强化学习学会“慢思考”,擅长解决复杂的科学和数学难题。
- 上下文
- 200K
- 输入
- $15
- 输出
- $60
美元 / 百万 tokens
text-embedding-ada-002
OpenAI
经典的上一代通用嵌入模型,兼容性好,广泛用于早期的 RAG(检索增强生成)应用。
- 上下文
- 8,191
- 输入
- $0.1
- 输出
- $0.1
美元 / 百万 tokens
text-embedding-3-small
OpenAI
高效版文本嵌入模型,性能超越旧版 ada-002 且价格更低,适合大规模数据索引。
- 上下文
- 8,191
- 输入
- $0.02
- 输出
- $0.02
美元 / 百万 tokens
text-embedding-3-large
OpenAI
OpenAI 最强的文本嵌入模型,生成维度高达3072维,适合对检索精度要求极高的场景。
- 上下文
- 8,191
- 输入
- $0.13
- 输出
- $0.13
美元 / 百万 tokens
gpt-4o-2024-11-20
OpenAI
GPT-4o 的最新优化版本,进一步提升了创意写作能力和对复杂指令的理解深度。
- 上下文
- 125K
- 输入
- $2.5
- 输出
- $10
美元 / 百万 tokens
gpt-4o-2024-08-06
OpenAI
支持“结构化输出”(Structured Outputs)的增强版 GPT-4o,能以100%准确率生成符合JSON Schema的数据。
- 上下文
- 125K
- 输入
- $2.5
- 输出
- $10
美元 / 百万 tokens
gpt-4o-mini-2024-07-18
OpenAI
gpt-4o-mini 的首发稳定版本快照,用于锁定模型行为,避免自动升级带来的不确定性。
- 上下文
- 125K
- 输入
- $0.15
- 输出
- $0.6
美元 / 百万 tokens
gpt-4o-mini
OpenAI
取代GPT-3.5的高性价比小模型,比GPT-3.5更聪明、更便宜,适合大批量简单任务。
- 上下文
- 125K
- 输入
- $0.15
- 输出
- $0.6
美元 / 百万 tokens
gpt-4o
OpenAI
2024年发布的旗舰“全能”模型(Omni),原生支持文本、音频和视觉实时交互,速度极快且价格减半。
- 上下文
- 125K
- 输入
- $2.5
- 输出
- $10
美元 / 百万 tokens
gpt-4-turbo-2024-04-09
OpenAI
GPT-4 Turbo 的正式发布版本(具备视觉能力),标志着该系列的成熟与稳定。
- 上下文
- 125K
- 输入
- $10
- 输出
- $30
美元 / 百万 tokens
gpt-4-turbo
OpenAI
比经典GPT-4更强、更快、更便宜的升级版,拥有128k超长上下文和截至2023年12月的知识库。
- 上下文
- 125K
- 输入
- $10
- 输出
- $30
美元 / 百万 tokens
gpt-4-0125-preview
OpenAI
修复了旧版GPT-4“变懒”问题的预览版本,大幅提升了代码生成和复杂任务的完成度。
- 上下文
- 125K
- 输入
- $10
- 输出
- $30
美元 / 百万 tokens
gpt-4
OpenAI
OpenAI 首个里程碑式的多模态大模型,逻辑推理能力强大,是后续所有GPT-4系列的基石。
- 上下文
- 8K
- 输入
- $2
- 输出
- $8
美元 / 百万 tokens
gpt-3.5-turbo-1106
OpenAI
2023年底更新的GPT-3.5版本,支持16k上下文和更精准的指令跟随能力,性价比极高。
- 上下文
- 16,385
- 输入
- $1
- 输出
- $2
美元 / 百万 tokens
gpt-3.5-turbo-0125
OpenAI
此版本在响应请求格式方面具有更高的准确率,并修复了导致非英语语言函数调用出现文本编码问题的错误。
- 上下文
- 16,385
- 输入
- $0.5
- 输出
- $1.5
美元 / 百万 tokens
gpt-3.5-turbo
OpenAI
GPT-3.5 Turbo 是 OpenAI 速度最快的模型。它可以理解和生成自然语言或代码,并针对聊天和传统填空任务进行了优化。
- 上下文
- 16,385
- 输入
- $0.5
- 输出
- $1.5
美元 / 百万 tokens
claude-sonnet-5
Anthropic
当前模型在代码编写、智能代理、专业办公场景均具备前沿水准。该模型支持自适应思考,可自主选择推理强度档位(低、中、高、超高级、最高),上下文窗口达 1M tokens,同时兼容文本、图片与文件多类输入格式。
- 上下文
- 1M
- 输入
- ¥14
- 输出
- ¥70
元 / 百万 tokens
claude-opus-4-8
Anthropic
支持文本、图片、文件输入与文本输出,搭载百万 token 超长上下文及强推理能力。深耕复杂推理、大型开发与项目统筹,兼顾长文档编撰、数据分析等各类知识作业。
- 上下文
- 1M
- 输入
- $5
- 输出
- $25
美元 / 百万 tokens
claude-opus-4-7
Anthropic
Claude Opus 4.7 是 Anthropic 推出的最新旗舰大语言模型,在推理、编程、数学和多语言理解等方面表现卓越,相比 Opus 4.6 进一步提升了指令遵循能力和复杂任务处理水平。
- 上下文
- 1M
- 输入
- $5
- 输出
- $25
美元 / 百万 tokens
claude-opus-4-6
Anthropic
Opus 4.6 是 Anthropic 在编程和长周期专业任务方面最强的模型。它面向能够覆盖完整工作流(而非只处理单次提示)的智能体而构建,因此在大型代码库、复杂重构以及随时间推进的多步调试方面尤其有效。与上一代模型相比,它在上下文理解上更深入、问题拆解能力更强,并且在高难度工程任务上的可靠性更高。 除编程之外,Opus 4.6 也擅长持续性的知识工作。它能在一次生成中产出接近可直接用于生产的文档、计划和分析,并在超长输出和长时间会话中保持连贯一致。这使它成为需要持续投入、判断力和执行闭环的任务的强力默认选择,例如技术方案设计、迁移规划以及端到端的项目落地执行。
- 上下文
- 1M
- 输入
- $5
- 输出
- $25
美元 / 百万 tokens
claude-sonnet-4-6
Anthropic
Sonnet 4.6 是 Anthropic 迄今能力最强的 Sonnet 系列模型,在代码编写、智能体与专业工作领域均达到前沿水准。 它擅长迭代式开发、复杂代码库浏览、带记忆能力的端到端项目管理、高质量文档生成,还能可靠地完成网页问答与工作流自动化等计算机操作任务。
- 上下文
- 1M
- 输入
- $3
- 输出
- $15
美元 / 百万 tokens
claude-sonnet-4-5-20250929-thinking
Anthropic
Claude Sonnet 4.5是Anthropic迄今最先进的Sonnet模型,针对现实场景智能体与编码工作流进行了深度优化。该模型在SWE-bench Verified等编程基准测试中展现出顶尖性能,并在系统设计、代码安全性和规范遵循方面实现全面提升。该模型专为持久自主运行设计,能保持跨会话的任务连续性,并提供基于事实的进度追踪。 Sonnet 4.5还增强了智能体能力,包括改进的工具编排、推测性并行执行,以及更高效的上下文与内存管理。凭借强化的上下文追踪能力和对工具调用间token消耗的精确感知,该模型特别适合多上下文场景和长时工作流。其应用场景涵盖软件工程、网络安全、金融分析、研究型智能体及其他需要持续推理与工具调用的专业领域。
- 上下文
- 1M
- 输入
- $3
- 输出
- $15
美元 / 百万 tokens
claude-haiku-4.5
Anthropic
最快的 Claude 4.5 轻量版,低延迟低成本,支持可控推理、强编码与工具使用,适合实时与高并发场景。
- 上下文
- 200K
- 输入
- $1
- 输出
- $5
美元 / 百万 tokens
claude-haiku-4-5-20251001
Anthropic
最快的 Claude 4.5 轻量版,低延迟低成本,支持可控推理、强编码与工具使用,适合实时与高并发场景。
- 上下文
- 200K
- 输入
- $1
- 输出
- $5
美元 / 百万 tokens
claude-opus-4.5
Anthropic
Claude Opus 4.5 是 Anthropic 推出的前沿推理模型,专为复杂软件工程、智能体工作流(agentic workflows)以及长期计算机操作任务而优化。该模型具备强大的多模态能力,在真实场景下的编程与推理基准测试中表现卓越。
- 上下文
- 200K
- 输入
- $5
- 输出
- $25
美元 / 百万 tokens
claude-opus-4-5-20251101
Anthropic
Claude Opus 4.5 是 Anthropic 推出的前沿推理模型,专为复杂软件工程、智能体工作流(agentic workflows)以及长期计算机操作任务而优化。该模型具备强大的多模态能力,在真实场景下的编程与推理基准测试中表现卓越。
- 上下文
- 200K
- 输入
- $5
- 输出
- $25
美元 / 百万 tokens
claude-sonnet-4.5
Anthropic
Claude Sonnet 4.5是Anthropic迄今最先进的Sonnet模型,针对现实场景智能体与编码工作流进行了深度优化。该模型在SWE-bench Verified等编程基准测试中展现出顶尖性能,并在系统设计、代码安全性和规范遵循方面实现全面提升。该模型专为持久自主运行设计,能保持跨会话的任务连续性,并提供基于事实的进度追踪。 Sonnet 4.5还增强了智能体能力,包括改进的工具编排、推测性并行执行,以及更高效的上下文与内存管理。凭借强化的上下文追踪能力和对工具调用间token消耗的精确感知,该模型特别适合多上下文场景和长时工作流。其应用场景涵盖软件工程、网络安全、金融分析、研究型智能体及其他需要持续推理与工具调用的专业领域。
- 上下文
- 1M
- 输入
- $3
- 输出
- $15
美元 / 百万 tokens
claude-sonnet-4-5-20250929
Anthropic
Claude Sonnet 4.5是Anthropic迄今最先进的Sonnet模型,针对现实场景智能体与编码工作流进行了深度优化。该模型在SWE-bench Verified等编程基准测试中展现出顶尖性能,并在系统设计、代码安全性和规范遵循方面实现全面提升。该模型专为持久自主运行设计,能保持跨会话的任务连续性,并提供基于事实的进度追踪。 Sonnet 4.5还增强了智能体能力,包括改进的工具编排、推测性并行执行,以及更高效的上下文与内存管理。凭借强化的上下文追踪能力和对工具调用间token消耗的精确感知,该模型特别适合多上下文场景和长时工作流。其应用场景涵盖软件工程、网络安全、金融分析、研究型智能体及其他需要持续推理与工具调用的专业领域。
- 上下文
- 1M
- 输入
- $3
- 输出
- $15
美元 / 百万 tokens
gemini-3.5-flash
Gemini 3.5 Flash 是 Google 推出的高效多模态模型,以 Flash 级别的成本和速度提供接近 Pro 级别的编程与推理能力。该模型针对代码能力和并行 Agent 执行循环进行了深度优化,支持文本、图像、视频、音频和 PDF 多种输入格式。
- 上下文
- 1M
- 输入
- $1.5
- 输出
- $9
美元 / 百万 tokens
gemini-3.1-pro-preview-search
Gemini 3.1 Pro 是一款具备超长上下文理解力和原生多模态能力的顶级 AI 模型,擅长处理从百万级 Token 文档到音视频、代码库的各类复杂逻辑任务。
- 上下文
- 1M
- 输入
- $2
- 输出
- $12
美元 / 百万 tokens
gemini-3.1-pro-preview
Gemini 3.1 Pro 是一款具备超长上下文理解力和原生多模态能力的顶级 AI 模型,擅长处理从百万级 Token 文档到音视频、代码库的各类复杂逻辑任务。
- 上下文
- 1M
- 输入
- $2
- 输出
- $12
美元 / 百万 tokens
gemini-3-flash-preview
Gemini-3-Flash-Preview 主打“高响应速度 + 较强多模态能力”,适合对实时性要求高的应用,如智能客服、实时搜索增强、交互式助手等,在保证较好智能水平的同时,显著降低了延迟和调用成本。
- 上下文
- 1M
- 输入
- $0.5
- 输出
- $3
美元 / 百万 tokens
gemini-2.5-flash-lite
该模型是 Flash 系列的轻量化版本,进一步降低资源消耗和调用成本,适合简单文本生成、基础问答和大规模批量处理场景。
- 上下文
- 1M
- 输入
- $0.1
- 输出
- $0.4
美元 / 百万 tokens
gemini-2.5-flash
该模型主打高速度和低延迟,在保持良好理解与生成质量的同时,能够快速响应用户请求,适合实时交互、高并发调用和对响应速度要求较高的业务场景。
- 上下文
- 1M
- 输入
- $0.3
- 输出
- $2.5
美元 / 百万 tokens
gemini-2.5-pro
Gemini 2.5 Pro 是 Google 推出的高端多模态模型,具备强大的文本理解、逻辑推理和多模态处理能力,能够胜任复杂问答、技术分析以及图文结合的应用场景。
- 上下文
- 1M
- 输入
- $1.25
- 输出
- $10
美元 / 百万 tokens
grok-4.5
xAI
该模型在编程、知识工作和 STEM(科学、技术、工程、数学)领域具备前沿性能。
- 上下文
- 200K
- 输入
- ¥14
- 输出
- ¥42
元 / 百万 tokens
grok-4.20-0309-non-reasoning
xAI
xAI 的 Grok 4.20 是一款推理模型,具备业界领先的速度和 Agent 工具调用能力。它结合了市场上最低的幻觉率与严格的提示词遵循能力,能够持续输出精准且真实的回答。
- 上下文
- 1M
- 输入
- $1.25
- 输出
- $2.5
美元 / 百万 tokens
grok-4.20-0309-reasoning
xAI
xAI 的 Grok 4.20 是一款推理模型,具备业界领先的速度和 Agent 工具调用能力。它结合了市场上最低的幻觉率与严格的提示词遵循能力,能够持续输出精准且真实的回答。
- 上下文
- 1M
- 输入
- $1.25
- 输出
- $2.5
美元 / 百万 tokens
grok-4-1-fast-non-reasoning
xAI
Grok 4.1 Fast 是 xAI 旗下表现最优的工具调用型智能体模型,在客服支持、深度研究等真实场景中表现出色。支持 200 万上下文窗口。
- 上下文
- 250K
- 输入
- $0.2
- 输出
- $0.5
美元 / 百万 tokens
grok-4-1-fast-reasoning
xAI
Grok 4.1 Fast 是 xAI 旗下表现最优的工具调用型智能体模型,在客服支持、深度研究等真实场景中表现出色。支持 200 万上下文窗口。
- 上下文
- 250K
- 输入
- $0.2
- 输出
- $0.5
美元 / 百万 tokens
grok-code-fast-1
xAI
Grok Code Fast 1 是一款速度快、性价比高的推理模型,在智能体式编程(agentic coding)方面表现出色。 其响应中可展示推理过程,使开发者能够更好地引导 Grok Code,从而构建高质量的工作流。
- 上下文
- 250K
- 输入
- $0.2
- 输出
- $1.5
美元 / 百万 tokens
deepseek-v4-flash
DeepSeek
高效轻量化MoE模型,总参284B,激活13B,原生支持百万超长上下文能力。推理速度快、延迟低、调用成本低廉,综合能力均衡,主打高并发、轻量化任务,适合日常对话、内容创作、基础 RAG、批量文案处理等普惠刚需场景。
- 上下文
- 1M
- 输入
- ¥1
- 输出
- ¥2
元 / 百万 tokens
deepseek-v4-pro
DeepSeek
旗舰级 MoE 大模型,总参1.6T、激活 49B,原生支持百万级超长上下文。依托海量高质量训练数据,具备顶尖数学逻辑、复杂推理、专业代码与长文本深度解析能力,适配高阶科研、复杂办公、深度智能代理等高难度场景。
- 上下文
- 1M
- 输入
- ¥12
- 输出
- ¥24
元 / 百万 tokens
deepseek-v3.2
DeepSeek
DeepSeek-V3.2 的目标是平衡推理能力与输出长度,适合日常使用,例如问答场景和通用 Agent 任务场景。在公开的推理类 Benchmark 测试中,DeepSeek-V3.2 达到了 GPT-5 的水平,仅略低于 Gemini-3.0-Pro;相比 Kimi-K2-Thinking,V3.2 的输出长度大幅降低,显著减少了计算开销与用户等待时间。
- 上下文
- 8K
- 输入
- ¥2
- 输出
- ¥3
元 / 百万 tokens
qwen3-rerank
通义千问
基于Qwen LLM底座训练的文本排序模型,对输入的Query和候选Docs进行相关性排序,支持100+语种和长文本输入,适用于文本检索、RAG等场景,效果对齐开源Qwen3-Rerank系列模型
- 上下文
- 30K
- 输入
- ¥0.5
元 / 百万 tokens
qwen3.7-plus
通义千问
Qwen3.7系列中高性价比Plus模型,在强大文本能力的基础上全面升级了视觉-语言能力,同时保持了在编码、工具使用和生产力工作流方面的完整智能体能力。其核心特色为多模态交互混合智能体能力,能够感知真实世界场景、读取屏幕并操作 GUI、基于视觉参考生成代码、端到端导航移动应用。
- 上下文
- 1M
- 输入
- ¥2 起
- 输出
- ¥8 起
元 / 百万 tokens
qwen3.7-max
通义千问
Qwen3.7系列中规模最大、综合能力最强的Max模型,当前开放纯文本模型能力供体验。Qwen3.7是面向智能体时代的新一代旗舰模型,核心优势在于智能体能力的广度与深度:在编程、办公与生产力、长周期自主执行方面均能出色胜任各项任务。
- 上下文
- 1M
- 输入
- ¥12
- 输出
- ¥36
元 / 百万 tokens
qwen3.5-flash
通义千问
Qwen3.5原生视觉语言系列Flash模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。模型效果在纯文本与多模态方面相较3系列均实现飞跃式进步;响应速度快,兼具推理速度和性能。
- 上下文
- 1M
- 输入
- ¥0.8
- 输出
- ¥8
元 / 百万 tokens
qwen3.6-flash
通义千问
Qwen3.6原生视觉语言系列Flash模型,模型效果相较3.5-Flash显著提升。本模型重点提升agentic coding能力(在多项代码智能体基准上大幅超越前代)、数学推理和代码推理能力;视觉方面在空间智能能力上显著增强,物体定位与目标检测提升尤为突出。
- 上下文
- 1M
- 输入
- ¥1.2
- 输出
- ¥7.2
元 / 百万 tokens
qwen3.6-max-preview
通义千问
Qwen3.6系列中规模最大、综合能力最强的Max模型Preview版本,当前开放纯文本模型能力供体验。相较于此前发布的Qwen3-Max和Qwen3.6-Plus,本模型在vibe coding能力上进一步提升、coding agent执行更加高效、前端编程开发能力显著提升;长尾知识能力进一步升级。
- 上下文
- 250K
- 输入
- ¥9
- 输出
- ¥54
元 / 百万 tokens
qwen3.6-plus
通义千问
Qwen3.6原生视觉语言系列Plus模型,展现出与当前顶尖前沿模型相媲美的卓越性能,模型效果相较3.5系列显著提升。模型在Agentic coding、前端编程、Vibe coding等代码能力、多模态万物识别、OCR、物体定位等能力上显著增强。
- 上下文
- 1M
- 输入
- ¥2
- 输出
- ¥12
元 / 百万 tokens
ZHIPU/GLM-5V-Turbo
智谱
GLM-5V-Turbo 是智谱首个多模态 Coding 基座模型,面向视觉编程任务打造。能够原生处理图片、视频、文本等多模态输入,同时擅长长程规划、复杂编程和动作执行;深度适配 Agent 工作流,能够与 Claude Code、OpenClaw 等 Agent 深度协同,完成”看懂环境→规划动作→执行任务”的完整闭环。
- 上下文
- 200K
- 输入
- ¥5 起
- 输出
- ¥22 起
元 / 百万 tokens
glm-5.1
智谱
GLM-5.1 是智谱最新旗舰模型,代码能力大大增强,长程任务显著提升,能够在单次任务中持续、自主地工作长达 8 小时,完成从规划、执行到迭代优化的完整闭环,交付工程级成果。
- 上下文
- 200K
- 输入
- ¥8
- 输出
- ¥28
元 / 百万 tokens
glm-4.7
智谱
智谱最新旗舰,具备更强的编程能力与更稳定的多步骤推理/执行能力。总参数355B,支持长程任务规划、编码、工具协同,问答自然、写作沉浸、创意角色扮演能力强。
- 上下文
- 200K
- 输入
- ¥3
- 输出
- ¥14
元 / 百万 tokens
Kimi/kimi-k3
Kimi
Kimi K3 是 Kimi 迄今能力最强的旗舰模型,拥有 2.8 万亿参数,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。
- 上下文
- 1M
- 输入
- ¥20
- 输出
- ¥100
元 / 百万 tokens
kimi-k2.5
Kimi
Kimi k2.5 是一款具备超强代码和 Agent 能力的 MoE 架构基础模型
- 上下文
- 256K
- 输入
- ¥4
- 输出
- ¥21
元 / 百万 tokens
kimi-k2.6
Kimi
Kimi K2.6 是 Kimi 最新最智能的模型,Kimi K2.6 的通用 Agent、代码、视觉理解等综合能力得到全面提升,其中在博士级难度的完整版人类最后的考试(Humanity’s Last Exam)、在考察模型真实软件工程能力的 SWE-Bench Pro、评估 Agent 深度检索能力的 DeepSearchQA 等基准测试中均取得行业领先的成绩,同时支持文本、图片与视频输入,思考与非思考模式,对话与 Agent 任务。
- 上下文
- 256K
- 输入
- ¥6.5
- 输出
- ¥27
元 / 百万 tokens
MiniMax/MiniMax-M3
MiniMax
MiniMax M3 凭借业界领先的 Coding 与 Agentic 能力、1M 超长上下文窗口以及原生多模态特性,可出色胜任企业级长文档理解、高质量内容生成、代码编写、Bug 修复及原生应用构建等任务;强大的 Agentic 能力端到端贯通工作流,原生多模态更带来流畅自然的图文混合交互体验。
- 上下文
- 1M
- 输入
- ¥4.2 起
- 输出
- ¥16.8 起
元 / 百万 tokens
MiniMax/MiniMax-M2.5
MiniMax
智能体世界的SOTA,专为智能体2.0设计,将编码扩展到现实世界包括工作空间、娱乐和个人助理。模型亮点:全球SOTA开源编码与智能体模型;SWE-bench Pro和SWE-bench Verified得分高于Opus 4.6;在Excel、搜索与研究以及文档摘要方面的全球SOTA;未来工作空间的完美主力模型;闪电般快速:优化思维效率,100+ TPS,实现比 Opus 快 3 倍的速度;极致性价比,以支持始终在线的智能体。
- 上下文
- 200K
- 输入
- ¥2.1
- 输出
- ¥8.4
元 / 百万 tokens
MiniMax/MiniMax-M2.7
MiniMax
M2.7 能够自行构建复杂 Agent Harness,并基于 Agent Teams、复杂 Skills、Tool Search tool 等能力,完成高度复杂的生产力任务。
- 上下文
- 200K
- 输入
- ¥2.1
- 输出
- ¥8.4
元 / 百万 tokens