先看一张可直接用于选型的表

维度Claude Sonnet 5Gemini 3.6 FlashDeepSeek V4 Flash
输入上下文1M1,048,5761M
最大输出128K65,536最高384K
标准输入 / 1M$2(8月);9月起$3$1.50$0.14(缓存未命中)
标准输出 / 1M$10(8月);9月起$15$7.50$0.28
思考控制adaptive + effortthinking levelThinking / Non-Thinking
突出能力编码、Agent、指令执行多模态、搜索、内置工具低成本文本与高并发

表中价格均为 2026-08-08 查到的公开标准价,不含工具调用、搜索 grounding、缓存存储、优先推理和地区附加项,采购前应再次核对官方页面。

Claude Sonnet 5:适合高价值工程任务

Sonnet 5 的核心优势不是最低 token 单价,而是在代码、长任务、工具使用和复杂指令上的综合稳定性。它默认使用 adaptive thinking,并用 effort 在速度、成本与智能之间调节。官方规格与迁移注意事项见 What's new in Sonnet 5

  • 适合代码审查、跨文件实现、复杂客服决策和高价值 Agent。
  • 稳定系统提示和工具定义可用 Prompt Caching 降本。
  • 新 tokenizer 会改变旧预算,迁移时必须重新计数。

Gemini 3.6 Flash:多模态与工具集成更完整

Gemini 3.6 Flash 在 2026 年 7 月成为 GA 稳定模型,支持文本、图片、视频、音频和 PDF 输入,以及代码执行、Computer Use、File Search、函数调用、搜索和地图 grounding。官方模型页标注1M输入和65,536输出上限,见 Gemini 3.6 Flash

  • 适合多模态文档、网页研究、带搜索引用的问答和视觉 Agent。
  • 标准价为输入 $1.50、输出 $7.50 / MTok;Batch 与 Flex 为 $0.75 / $3.75。
  • 搜索和地图 grounding 可能单独计费,不能只按 token 估算。

DeepSeek V4 Flash:价格敏感场景的吞吐选择

V4 Flash 提供1M上下文、工具调用、JSON输出和思考/非思考模式。公开价格明显低于另外两款,适合先做分类、摘要、检索改写和子任务执行。规格与实时价格见 DeepSeek Models & Pricing

  • 适合高频文本客服、批量抽取、低成本预处理和路由判断。
  • 关键决策应以真实评测验证,不能把低价自动等同于高性价比。
  • 生产端要处理排队、超时、429和上游波动。

按场景选,而不是按榜单选

场景优先模型备选
复杂代码修改和最终审查Sonnet 5Gemini 3.6 Flash
视频/PDF/图片综合理解Gemini 3.6 FlashSonnet 5(按支持模态)
百万级短文本分类DeepSeek V4 FlashGemini Flash-Lite
带搜索 grounding 的回答Gemini 3.6 Flash自建搜索 + Sonnet 5
中文客服与摘要先 A/B 测试 V4 Flash / Sonnet 5按转人工率路由

推荐的三层路由架构

  1. 硬约束路由:先根据图片、视频、搜索、地区和数据合规排除不支持的模型。
  2. 价值与难度路由:低风险批量任务走低成本模型;复杂工程和关键回答走更强模型。
  3. 运行时降级:遇到超时、限流或结构校验失败时切备选模型,并保留请求追踪。

评测时至少比较一次成功率、P95延迟、每个成功任务的总成本、结构化输出合格率和人工返工率。只比较单次 token 价格,会忽略失败重试和答案质量。

最后结论

如果你的产品以复杂编程和 Agent 为主,先验证 Sonnet 5;以多模态和 Google 工具生态为主,先验证 Gemini 3.6 Flash;以大规模文本和成本为主,先验证 DeepSeek V4 Flash。模型更新很快,生产配置应使用可切换的模型路由,而不是把模型名散落在业务代码里。

需要进一步优化 Claude 成本,可继续阅读 Sonnet 5 Prompt Caching 与 Batch 指南