API知识站学习、对比与使用指南

Reviews

AI API 测评对比

详细的 API 性能评测与使用体验分享,帮助你选择最适合的 AI 服务。

2026-07 信息更新

本页已按 2026-07 最新官方口径更新:OpenAI GPT-5.6 系列、Claude Opus 5 / Sonnet 5 / Fable 5、Gemini 3.6 Flash、Kimi K3、豆包 2.1、腾讯 Hy3(TokenHub)、Qwen3.8-Max-Preview / Qwen3.7-Plus、GLM-5.2、MiniMax M3 与 DeepSeek V4。注意:腾讯旧版混元模型已下线并迁移 TokenHub;DeepSeek 旧别名 deepseek-chat / deepseek-reasoner 已退役;GLM Coding Plan 已改版涨价。模型名、免费额度、套餐库存和价格变动很快,正式购买前仍以各家官方控制台为准。

结论先行(点开查看)

代码 / 推理 / 长程 Agent:性价比优先看 DeepSeek V4 Flash;开源推理与代码能力可重点看 DeepSeek V4 Pro;长上下文 Coding Agent 和复杂工程任务可重点评估 GLM-5.2、MiniMax M3;闭源旗舰能力可看 Claude Opus 5、OpenAI GPT-5.6。

通用对话 / 内容创作 / 写文案:中文写作、文案生成、知识整理优先看通义千问(Qwen)、Kimi、DeepSeek;需要更稳定的商业文案、复杂改写和英文内容时,可评估 Claude Opus 5、OpenAI GPT-5.6。

长文档 / 多模态:海外模型先看 Gemini 3.6 Flash,再用 Gemini 3.1 Pro Preview 验证复杂任务;安全长文本看 Claude Opus 5。

国内生态:阿里云项目看 Qwen3.7-Max / Qwen3.7-Plus;火山方舟看豆包 2.1;腾讯云项目直接走 TokenHub(Hy3);需要国内可访问的长程 Coding Agent、代码库分析和复杂工程任务时,可重点试 GLM-5.2,但要注意 Coding Plan 套餐、额度和高峰期消耗规则。

海外闭源旗舰:OpenAI GPT-5.6、Claude Opus 5、Gemini 系列适合复杂专业工作、编码和工具型 Agent,但价格通常更高。

策略:所有价格、额度和模型名优先看官方控制台;MiniMax 需要特别区分 Token Plan Key、Credits 和 Pay-as-you-go API Key。

OpenAI GPT-5.5
OpenAI 最新旗舰为 GPT-5.6 系列(gpt-5.6-sol/terra/luna,2026-07-09 发布),适合复杂编码、Agent、长上下文检索和生产级助手;上一代 gpt-5.5(快照 2026-04-23)仍可用。GPT-5.6 Sol 标准价 $5 输入 / $30 输出每百万 token。
综合评分4.6
需代理付费GPT-5.6 已发布

省流版

推荐指数:4.6/5 | OpenAI 最新旗舰为 GPT-5.6 系列(gpt-5.6-sol/terra/luna,2026-07-09 发布),适合复杂编码、Agent、长上下文检索和生产级助手;上一代 gpt-5.5(快照 2026-04-23)仍可用。GPT-5.6 Sol 标准价 $5 输入 / $30 输出每百万 token。

质量4.9
4.9

官方定位为 newest frontier model,适合复杂专业工作、编码、推理和 Agent 工作流。

速度4.4
4.4

默认 reasoning.effort 为 medium,可按任务调低到 low 或 none 来平衡质量、延迟和成本。

性价比3.2
3.2

标准价 $5/$30 每百万 token,Batch/Flex 可降至 $2.5/$15;长上下文和 Pro 场景成本明显更高。

稳定性4.6
4.6

支持 Responses API、Chat Completions、Batch、工具调用和企业级数据驻留选项。

主要优点

  • 最新旗舰为 gpt-5.6-sol(系列含 gpt-5.6-terra、gpt-5.6-luna),2026-07-09 正式发布,知识截止 2026-02,1.05M 上下文、128K 输出
  • 上一代 gpt-5.5 仍可用、价格未变,当前快照为 gpt-5.5-2026-04-23;gpt-5.5-pro 为更高计算量版本
  • 支持 Responses API、Chat Completions、Batch、function calling、web search、file search、tool search、code interpreter、computer use、MCP 和结构化输出

需要注意

  • 价格较高:GPT-5.5 标准价 $5/$30 每百万 token,GPT-5.5 Pro 标准价 $30/$180 每百万 token
  • 国内访问需要代理
  • 需要国际信用卡支付
MMMiniMax M3
MiniMax M3 是 2026-06-01 发布的最新 M 系列模型,主打代码、Agent、1M 上下文和原生多模态;适合 AI Coding 工具、长上下文仓库分析和多步骤 Agent,但购买前要分清 Token Plan、Credits 与 Pay-as-you-go 的 Key 和计费体系。
综合评分4.3
M3最新Token Plan1M上下文

省流版

推荐指数:4.3/5 | MiniMax M3 是 2026-06-01 发布的最新 M 系列模型,主打代码、Agent、1M 上下文和原生多模态;适合 AI Coding 工具、长上下文仓库分析和多步骤 Agent,但购买前要分清 Token Plan、Credits 与 Pay-as-you-go 的 Key 和计费体系。

质量4.6
4.6

官方定位为 Coding & Agentic Frontier,在 SWE-Bench Pro、Terminal-Bench、MCP Atlas 等代码和 Agent 基准上给出较强成绩。

速度4.2
4.2

M3 支持 thinking 开关;关闭 thinking 更适合低延迟对话和补全,复杂 Agent 任务开启 thinking 但延迟会更高。

性价比4.4
4.4

官方 Token Plan 口径为 Plus $20/月、Max $50/月、Ultra $120/月;PAYG 标准通道当前显示 M3 ≤512K 为 ¥2.1/百万输入、¥8.4/百万输出。

稳定性4.0
4.0

M3 刚发布,API、Token Plan、Priority 通道和区域价格仍可能快速调整,生产接入前建议小流量压测。

主要优点

  • MiniMax-M3 支持 1,000,000 token 上下文,官方说明 512K 以内覆盖多数对话和编程场景
  • 原生多模态,支持文本、图像、视频、工具调用和 thinking block,适合复杂 Agent 工作流
  • Token Plan 适合个人开发者和小团队固定预算使用,文本、图像、语音、音乐资源共享额度池

需要注意

  • Token Plan Subscription Key、Credits 和 Pay-as-you-go API Key 是不同体系,初次接入容易填错 Key
  • M3 刚发布,价格、额度、Priority 开放状态和区域支付口径变化较快
  • 超过 512K 输入 token 会进入更高长上下文价格,仓库级分析和长视频任务需要提前预算
阿里云通义千问
国内用户和阿里云生态项目的稳妥选择。2026 年 7 月重点看 Qwen3.8-Max-Preview(仅 Token Plan)、Qwen3.7-Max 与 Qwen3.7-Plus;Qwen3.6-Plus 已被官方列为「旧版模型,不再作为首选推荐」。
综合评分4.8
无需代理免费额度Qwen3.7-Max / 3.8

省流版

推荐指数:4.8/5 | 国内用户和阿里云生态项目的稳妥选择。2026 年 7 月重点看 Qwen3.8-Max-Preview(仅 Token Plan)、Qwen3.7-Max 与 Qwen3.7-Plus;Qwen3.6-Plus 已被官方列为「旧版模型,不再作为首选推荐」。

质量4.8
4.8

Qwen3.7-Max 在复杂推理、代码工程、工具调用和多语言任务上明显增强,普通中文内容任务仍可用 Qwen3.6 控本。

速度4.8
4.8

国内部署,响应延迟低,高并发场景下也保持稳定速度。

性价比4.7
4.7

qwen3.7-max 国内百炼当前为 12 元/百万输入、36 元/百万输出;Qwen3.6-Flash / Plus 更适合日常控本。

稳定性4.7
4.7

阿里云基础设施保障,SLA 99.9%,企业级可用性。

主要优点

  • 免费额度、试用模型和价格经常调整,购买前以百炼控制台为准
  • 国内直接访问,无需代理,响应速度快
  • 中文场景深度优化,理解和生成质量优秀

需要注意

  • 复杂 Agent 任务建议优先测试 Qwen3.7-Max,同时对比 DeepSeek V4 Pro、Claude Opus 5 或 GPT-5.6
  • Qwen3.7-Max 成本高于 Qwen3.6-Plus / Flash,不适合所有轻量高频任务
  • 英文和跨语言场景表现不如原生英文模型
Anthropic Claude
长文本处理、安全性和代码协作能力突出。当前重点看 Claude Opus 5、Sonnet 5、Haiku 4.5,以及能力最强档 Fable 5;Opus/Sonnet 支持 1M 上下文,适合长文档和复杂代码任务。
综合评分4.6
需代理付费

省流版

推荐指数:4.6/5 | 长文本处理、安全性和代码协作能力突出。当前重点看 Claude Opus 5、Sonnet 5、Haiku 4.5,以及能力最强档 Fable 5;Opus/Sonnet 支持 1M 上下文,适合长文档和复杂代码任务。

质量4.8
4.8

文本理解和生成长文本方向顶尖,安全对齐做得最好的模型。

速度4.0
4.0

推理速度中规中矩,长文本处理时延迟有所增加。

性价比3.8
3.8

价格处在海外高端模型区间,适合高价值长文档和代码协作任务。

稳定性4.9
4.9

Anthropic 服务成熟,API 可用性极高,企业级可靠。

主要优点

  • Opus 5 / Sonnet 5 支持 1M 上下文,适合长文档分析、合同审查和代码仓库理解
  • 安全对齐做得最好,Constitutional AI 确保输出安全可靠
  • 代码能力强劲,Claude Code 是顶级 AI 编程助手

需要注意

  • 国内访问需要代理
  • 推理速度相对较慢
  • 价格较高,需要结合任务效果与 OpenAI GPT-5.6 分别实测
智谱AI GLM
GLM-5.2 主打 1M 上下文、128K 输出、长程 Coding Agent 和复杂工程任务,适合代码库分析、多文件重构、项目级开发、长文档处理和企业知识库底座。它的模型能力和性价比值得关注,但 Coding Plan 不是普通 API 套餐,购买、额度、高峰期消耗和工具支持规则都需要提前确认。
综合评分4.4
无需代理GLM-5.21M上下文Coding Plan

省流版

推荐指数:4.4/5 | GLM-5.2 主打 1M 上下文、128K 输出、长程 Coding Agent 和复杂工程任务,适合代码库分析、多文件重构、项目级开发、长文档处理和企业知识库底座。它的模型能力和性价比值得关注,但 Coding Plan 不是普通 API 套餐,购买、额度、高峰期消耗和工具支持规则都需要提前确认。

质量4.6
4.6

GLM-5.2 在长上下文、代码工程、工具调用和长程 Agent 任务上明显加强。官方文档显示它支持 1M 上下文和 128K 最大输出,更适合项目级工程上下文、复杂重构、代码库分析和多步骤开发任务。

速度4.3
4.3

国内访问延迟相对友好,普通任务响应体验不错;但 1M 上下文、max 推理和复杂 Agent 任务会显著增加耗时。实际速度取决于上下文长度、工具调用次数、项目规模和高峰期资源情况。

性价比4.5
4.5

GLM-5.2 的 API 标准价格相对国际闭源旗舰更低,Coding Plan 对开发者有吸引力。但套餐不是无限用,存在 5 小时限额、每周限额和高峰期倍率消耗;复杂项目中一次 Prompt 可能触发多次模型调用,实际消耗可能比新手预期更快。

稳定性4.1
4.1

模型能力提升明显,但产品体验仍要看具体接入方式。Coding Plan 仅适用于官方支持的编码工具,不等同于普通 API 套餐;套餐库存、额度统计、工具兼容和高峰期体验都可能影响实际使用稳定性。

主要优点

  • GLM-5.2 支持 1M 上下文和 128K 最大输出,更适合大型代码库、长文档、复杂项目和长程 Agent 任务
  • Coding Agent 能力是核心卖点,适合项目审查、多文件修改、工程重构、测试修复和前后端项目生成
  • 国内访问和中文场景更友好,对国内开发者、企业知识库和内部工具原型有较高吸引力

需要注意

  • GLM-5.2 不应再简单按"GLM-5 / 5.1 的 200K 长上下文模型"理解,它的重点已经转向 1M 上下文、长程 Coding Agent 和复杂工程任务
  • Coding Plan 不是普通 API 套餐,主要用于 Claude Code、Cline、OpenCode 等官方支持的编码工具;网站客服、企业知识库、SaaS 内置 AI 等场景仍应按标准 API 和实际调用成本评估
  • 套餐存在 5 小时限额、每周限额和高峰期倍率消耗,复杂项目中一次 Prompt 可能触发多次模型调用,不要只看表面套餐价格
月之暗面 Kimi
Kimi 适合长文档、资料问答、中文知识工作流和 Agent 原型。当前重点关注 Kimi K3(1M 上下文、原生视觉、长程编程)和 OpenAI 兼容接入;K3 价格较上一代 K2.6 整体涨超 3 倍。
综合评分4.5
无需代理长上下文免费额度Kimi K3

省流版

推荐指数:4.5/5 | Kimi 适合长文档、资料问答、中文知识工作流和 Agent 原型。当前重点关注 Kimi K3(1M 上下文、原生视觉、长程编程)和 OpenAI 兼容接入;K3 价格较上一代 K2.6 整体涨超 3 倍。

质量4.5
4.5

Kimi K3 在长程编程、复杂推理和视觉理解上明显加强(前端代码能力全球第一),适合长资料、复杂问答和中文知识工作流。

速度4.4
4.4

国内访问延迟友好,长上下文任务会随输入长度增加耗时。

性价比4.6
4.6

有免费额度,日常文档处理和中等规模应用成本较好控制。

稳定性4.5
4.5

开放平台接入体验成熟,仍需关注模型列表和额度调整。

主要优点

  • Kimi K3 支持 1M 上下文与原生视觉理解,适合合同、论文、资料库、报告和代码资料分析
  • 中文表达自然,摘要、改写、问答等常见任务完成度高
  • OpenAI 兼容接口迁移成本低,现有 SDK 项目容易接入

需要注意

  • 工具调用、复杂 Agent 和极高难度推理场景不一定是首选
  • 多模态和企业生态覆盖不如部分云厂商完整
  • Kimi K3 价格较高(输入 ¥20/百万、输出 ¥100/百万)且因算力原因 C 端新用户订阅暂停,成本和可用性需以 Moonshot 控制台为准
腾讯混元
腾讯混元更适合已经在腾讯云、微信生态或企业服务体系里的团队。旧版混元模型(hunyuan-lite / turbos / t1 等)已于 2026-06-22 下线,新能力已统一迁移到 TokenHub,最新旗舰为 Hy3。
综合评分4.5
无需代理腾讯云生态企业友好

省流版

推荐指数:4.5/5 | 腾讯混元更适合已经在腾讯云、微信生态或企业服务体系里的团队。旧版混元模型(hunyuan-lite / turbos / t1 等)已于 2026-06-22 下线,新能力已统一迁移到 TokenHub,最新旗舰为 Hy3。

质量4.4
4.4

通用中文任务表现可靠,多模型覆盖能满足大多数业务接入。

速度4.6
4.6

国内云服务延迟低,适合面向国内用户的在线应用。

性价比4.4
4.4

轻量模型和资源包适合规模化调用,具体成本取决于模型选择。

稳定性4.7
4.7

腾讯云基础设施成熟,企业级运维和权限体系较完整。

主要优点

  • 腾讯云账号体系、费用中心、权限管理和企业运维流程完整
  • 国内访问稳定,适合在线客服、办公系统和内部业务工具
  • 多模型路线覆盖文本、视觉、翻译等场景,最新旗舰 Hy3(256K 上下文,¥1 输入/¥4 输出每百万)已上架 TokenHub

需要注意

  • 控制台概念较多,新手需要理解地域、密钥、Endpoint 和模型名
  • 如果没有腾讯云使用基础,开通链路会比独立开放平台稍重
  • 最前沿推理和代码场景不一定优于国际旗舰或专项模型
字节豆包
豆包 API 适合高频中文对话、内容生成、Agent 原型和成本敏感应用。当前重点关注豆包 2.1 系列(Pro/Turbo)、Doubao-Seed-Evolving、Responses API 和火山方舟的模型编排能力。
综合评分4.5
无需代理高性价比免费额度

省流版

推荐指数:4.5/5 | 豆包 API 适合高频中文对话、内容生成、Agent 原型和成本敏感应用。当前重点关注豆包 2.1 系列(Pro/Turbo)、Doubao-Seed-Evolving、Responses API 和火山方舟的模型编排能力。

质量4.3
4.3

豆包 2.1 Pro 在 Coding / Agent / 视觉语言三大方向提升明显,复杂任务要按模型实测。

速度4.7
4.7

轻量模型响应快,适合聊天、客服和内容生产类高频调用。

性价比4.8
4.8

成本控制友好,适合从免费额度、小额测试逐步放量。

稳定性4.5
4.5

火山引擎云服务成熟,正式接入建议配置预算和告警。

主要优点

  • 高性价比,适合高频调用和成本敏感型产品
  • 国内直连,面向国内用户的延迟体验较好
  • 豆包 2.1 Pro / 2.1 Turbo、Seed-Evolving、视觉、语音、Embedding 等方向覆盖较全,适合在火山方舟里统一调度

需要注意

  • 火山方舟里的模型、Endpoint、地域概念对新手有一定学习成本
  • 复杂推理、严肃代码修复需要与 DeepSeek、Claude、OpenAI 等交叉测试
  • 豆包 2.1、Seed-Evolving、Responses API、免费额度和价格变化较快,正式购买前必须核对火山方舟控制台
DeepSeek V4 系列
DeepSeek V4 当前重点是 deepseek-v4-flash(已上线正式版公测,支持 Responses API)和 deepseek-v4-pro(仍为预览版):两者均支持 1M 上下文、最高 384K 输出、思考/非思考双模式、OpenAI/Anthropic 兼容接口。deepseek-chat 和 deepseek-reasoner 旧别名已于 2026-07-24 15:59 UTC 完全退役。
综合评分4.6
无需代理高性价比代码/推理开源可商用

省流版

推荐指数:4.6/5 | DeepSeek V4 当前重点是 deepseek-v4-flash(已上线正式版公测,支持 Responses API)和 deepseek-v4-pro(仍为预览版):两者均支持 1M 上下文、最高 384K 输出、思考/非思考双模式、OpenAI/Anthropic 兼容接口。deepseek-chat 和 deepseek-reasoner 旧别名已于 2026-07-24 15:59 UTC 完全退役。

质量4.8
4.8

官方定位 V4 Pro 为面向 Agent 编码、世界知识、数学/STEM/代码推理的旗舰开源模型;Flash 更偏快速和高性价比。

速度4.6
4.6

Flash 参数规模更小,适合实时对话和高频任务;Pro 更适合高难推理和长上下文任务。

性价比5.0
5.0

官方按人民币/百万 token 计费,V4 Flash 缓存命中 ¥0.02/百万输入、未命中 ¥1/百万输入、输出 ¥2/百万;V4 Pro 为 ¥0.025、¥3、¥6。

稳定性4.2
4.2

高峰期算力紧张,Pro 可能变慢或排队。建议做好重试和备用方案。

主要优点

  • 官方 V4 模型名为 deepseek-v4-flash 和 deepseek-v4-pro,新项目应优先使用这两个模型名
  • V4 Pro:1.6T 总参数、49B 激活参数,官方定位为性能接近世界顶级闭源模型
  • V4 Flash:284B 总参数、13B 激活参数,参数更小、响应更快、API 成本更低

需要注意

  • deepseek-chat / deepseek-reasoner 已于 2026-07-24 15:59 UTC 退役,未迁移的旧项目必须改用 deepseek-v4-flash / deepseek-v4-pro
  • 高峰期算力紧张:热门时段 Pro 响应可能变慢或需排队
  • 审美与前端偏弱:能写好逻辑代码,但生成的网页界面不美观,需人工润色
GGoogle Gemini
Gemini 的优势是多模态、长上下文和 Google 生态。当前重点看 Gemini 3.6 Flash(2026-07 GA)与 Gemini 3.1 Pro Preview;国内访问、账号、支付和区域限制仍是主要成本。
综合评分4.5
需代理多模态免费额度

省流版

推荐指数:4.5/5 | Gemini 的优势是多模态、长上下文和 Google 生态。当前重点看 Gemini 3.6 Flash(2026-07 GA)与 Gemini 3.1 Pro Preview;国内访问、账号、支付和区域限制仍是主要成本。

质量4.7
4.7

Gemini 3.6 Flash 强在多模态和速度,Gemini 3.1 Pro Preview 更适合长上下文与复杂任务测试。

速度4.6
4.6

海外网络环境下响应快,国内体验取决于代理质量和区域配置。

性价比4.4
4.4

AI Studio 免费额度适合试用,正式生产成本需按 Google Cloud 账单核算。

稳定性4.3
4.3

平台能力成熟,但国内网络和账号区域会影响稳定性。

主要优点

  • Gemini 3.6 Flash 适合多模态和低延迟场景(价格低于 3.5 Flash),Gemini 3.1 Pro Preview 更适合长上下文与复杂任务测试
  • 长上下文适合大文档、代码库和资料批量分析
  • AI Studio 上手快,适合快速创建测试 Key

需要注意

  • 国内访问通常需要稳定代理,网络质量会直接影响调用体验
  • 付费生产一般涉及 Google Cloud 账号、账单和国际支付
  • 配额、区域、模型命名、预览模型稳定性和 API 版本变化需要持续关注

购买前建议同时查看官网、购买教程和测评结论,再用自己的真实任务小规模测试。

常见问题

测评分数怎么用?

综合评分按 质量 45%、稳定性 25%、速度 20%、性价比 10% 计算,适合快速横向对比。但选 API 时建议重点看你最在意的单维度分数,比如编程场景重点看质量和稳定性。

测评数据多久更新一次?

模型更新或价格调整时会同步更新测评。建议购买前到官网确认最新的模型名称和定价。

测评结果和我自己测试不一样怎么办?

基准测试是通用场景,你的业务场景可能有差异。建议用自己的真实任务跑 3-5 个样本对比,记录响应质量、速度和成本。

下一步推荐

适合谁

  • • 想对比不同 API 的性能、价格和使用体验
  • • 需要根据具体场景(编程、翻译、创作)选 API
  • • 想了解各 API 的优缺点再做决定

不适合谁

  • • 已经确定 API,需要注册和购买指导(请看 购买教程
  • • 只想查官网入口和免费额度(请看 API 列表
  • • 想按编程、翻译等场景直接选 API(请看 场景推荐
权威基准与数据来源

本站测评数据参考以下权威基准和官方来源:

代码能力基准

  • • SWE-bench Verified:代码修复能力评测
  • • SWE-bench Pro:真实工程任务评测
  • • CursorBench:IDE 编码能力评测

综合能力基准

  • • GPQA Diamond:科学推理能力评测
  • • HLE:综合知识考试评测
  • • OSWorld:桌面自动化能力评测

数据来源说明

  • • 官方参数:来自各厂商官方文档(Anthropic、OpenAI、Google 等)
  • • 第三方基准:来自 DataLearnerAI、知乎、火山引擎等权威评测机构
  • • 更新时间:最后更新 2026-05-07