先看一张可直接用于选型的表
| 维度 | Claude Sonnet 5 | Gemini 3.6 Flash | DeepSeek V4 Flash |
|---|---|---|---|
| 输入上下文 | 1M | 1,048,576 | 1M |
| 最大输出 | 128K | 65,536 | 最高384K |
| 标准输入 / 1M | $2(8月);9月起$3 | $1.50 | $0.14(缓存未命中) |
| 标准输出 / 1M | $10(8月);9月起$15 | $7.50 | $0.28 |
| 思考控制 | adaptive + effort | thinking level | Thinking / Non-Thinking |
| 突出能力 | 编码、Agent、指令执行 | 多模态、搜索、内置工具 | 低成本文本与高并发 |
表中价格均为 2026-08-08 查到的公开标准价,不含工具调用、搜索 grounding、缓存存储、优先推理和地区附加项,采购前应再次核对官方页面。
Claude Sonnet 5:适合高价值工程任务
Sonnet 5 的核心优势不是最低 token 单价,而是在代码、长任务、工具使用和复杂指令上的综合稳定性。它默认使用 adaptive thinking,并用 effort 在速度、成本与智能之间调节。官方规格与迁移注意事项见 What's new in Sonnet 5。
- 适合代码审查、跨文件实现、复杂客服决策和高价值 Agent。
- 稳定系统提示和工具定义可用 Prompt Caching 降本。
- 新 tokenizer 会改变旧预算,迁移时必须重新计数。
Gemini 3.6 Flash:多模态与工具集成更完整
Gemini 3.6 Flash 在 2026 年 7 月成为 GA 稳定模型,支持文本、图片、视频、音频和 PDF 输入,以及代码执行、Computer Use、File Search、函数调用、搜索和地图 grounding。官方模型页标注1M输入和65,536输出上限,见 Gemini 3.6 Flash。
- 适合多模态文档、网页研究、带搜索引用的问答和视觉 Agent。
- 标准价为输入 $1.50、输出 $7.50 / MTok;Batch 与 Flex 为 $0.75 / $3.75。
- 搜索和地图 grounding 可能单独计费,不能只按 token 估算。
DeepSeek V4 Flash:价格敏感场景的吞吐选择
V4 Flash 提供1M上下文、工具调用、JSON输出和思考/非思考模式。公开价格明显低于另外两款,适合先做分类、摘要、检索改写和子任务执行。规格与实时价格见 DeepSeek Models & Pricing。
- 适合高频文本客服、批量抽取、低成本预处理和路由判断。
- 关键决策应以真实评测验证,不能把低价自动等同于高性价比。
- 生产端要处理排队、超时、429和上游波动。
按场景选,而不是按榜单选
| 场景 | 优先模型 | 备选 |
|---|---|---|
| 复杂代码修改和最终审查 | Sonnet 5 | Gemini 3.6 Flash |
| 视频/PDF/图片综合理解 | Gemini 3.6 Flash | Sonnet 5(按支持模态) |
| 百万级短文本分类 | DeepSeek V4 Flash | Gemini Flash-Lite |
| 带搜索 grounding 的回答 | Gemini 3.6 Flash | 自建搜索 + Sonnet 5 |
| 中文客服与摘要 | 先 A/B 测试 V4 Flash / Sonnet 5 | 按转人工率路由 |
推荐的三层路由架构
- 硬约束路由:先根据图片、视频、搜索、地区和数据合规排除不支持的模型。
- 价值与难度路由:低风险批量任务走低成本模型;复杂工程和关键回答走更强模型。
- 运行时降级:遇到超时、限流或结构校验失败时切备选模型,并保留请求追踪。
评测时至少比较一次成功率、P95延迟、每个成功任务的总成本、结构化输出合格率和人工返工率。只比较单次 token 价格,会忽略失败重试和答案质量。
最后结论
如果你的产品以复杂编程和 Agent 为主,先验证 Sonnet 5;以多模态和 Google 工具生态为主,先验证 Gemini 3.6 Flash;以大规模文本和成本为主,先验证 DeepSeek V4 Flash。模型更新很快,生产配置应使用可切换的模型路由,而不是把模型名散落在业务代码里。
需要进一步优化 Claude 成本,可继续阅读 Sonnet 5 Prompt Caching 与 Batch 指南。