先把价格表换掉
GPT-5.6 于 2026 年 7 月 9 日发布,7 月 30 日就降了一次价—— 距离发布只有三周。这种节奏很反常(通常降价发生在模型上线数月之后), 导致大量成本测算、内部报价单和第三方对照页至今仍在用发布时的价格。
| 模型 | 发布时 | 当前(7-30 起) | 变化 | 缓存输入 |
|---|---|---|---|---|
| Sol | $5 / $30 | $5 / $30 | 不变(新增 Fast mode) | — |
| Terra | $2.50 / $15 | $2.00 / $12 | −20% | $0.20 |
| Luna | $1 / $6 | $0.20 / $1.20 | −80% | $0.02 |
单位:每百万 token 的输入 / 输出价。来源为 OpenAI 官方页面 《Advancing the price-performance frontier with GPT-5.6》。
最要紧的一条:Luna 的输入价从 $1 降到 $0.20,正好是五分之一。如果你在 7 月做过选型测算并得出「Luna 省不了多少,还是用 Terra 吧」, 那个结论现在需要重算——Luna 的输入成本只有 Terra 的十分之一了。
降本的三个动作,按收益排序
动作一:把默认档从 Sol 换成 Terra(收益最大)
很多团队的默认配置是「上最好的」,于是所有请求都打 Sol。 但 OpenAI 自己把 Terra 定位为「性能对标上一代旗舰 GPT-5.5、成本更低」, 这本身就是在引导分层用法。
Sol 与 Terra 的输入价差是 2.5 倍($5 vs $2.00),输出价差同样 2.5 倍。 对绝大多数生产负载,这个差价换不来对应的质量提升。
还有一个隐蔽的坑:alias。API 里 gpt-5.6 指向 gpt-5.6-sol。 如果你只是把模型名从 gpt-5.5 改成 gpt-5.6, 以为自己「升级了一代」,实际是把全部流量切到了最贵的档。 生产环境永远写全名。
动作二:把高频简单调用下沉到 Luna
降价之后 Luna 的性价比出现了质变。而它的绝对能力并不弱—— 公开的 Terminal-Bench 2.1 数据里 Sol 88.8%、Luna 84.3%,只差 4.5 个百分点,价格却差 25 倍。
适合下沉到 Luna 的典型调用:
- 分类、打标、意图识别
- 字段抽取、格式转换、结构化清洗
- 短文本摘要、标题生成
- 简单问答、FAQ 匹配
- 批量但低风险的自动化步骤
判断标准还是那三问:难不难、多不多、错了代价大不大。量大且低风险 → Luna;日常主力 → Terra;失败代价高 → Sol。
动作三:配 prompt caching(对重复系统提示的应用收益极高)
GPT-5.6 的缓存机制比上一代可预测得多,规则是:
| 项目 | 规则 |
|---|---|
| 缓存写入 | 按未缓存输入价的 1.25 倍计费 |
| 缓存读取 | 享 90% 折扣 |
| 最短生命周期 | 30 分钟 |
| 断点 | 支持显式设置缓存断点 |
算一笔账:假设你的系统提示是 20K token,每次请求都带上,一天调用 1000 次。
- 不用缓存:20K × 1000 = 2000 万 token 输入,Terra 单价 $2.00/M → 约 $40/天
- 用缓存:首次写入 20K × 1.25 倍,其余 999 次按 10% 计 → 约 $4.4/天
为便于理解的粗算,实际会受缓存命中率、30 分钟生命周期与请求分布影响,仅示意量级。
这个量级的节省超过了换模型档位。所以如果你的应用有稳定的长系统提示,缓存该排在换档之前做。
关键是显式断点:把稳定不变的部分(系统提示、few-shot 范例、工具定义) 放在最前面并设断点,把每次都变的用户输入放在后面。 顺序反了,缓存等于没配。
一个可直接抄的分层配置
| 调用类型 | 模型 | 推理强度 | 缓存 |
|---|---|---|---|
| 分类 / 抽取 / 格式转换 | Luna | 低 | 系统提示设断点 |
| 日常生成 / 文档处理 / 普通 Agent | Terra(默认) | 中 | 系统提示 + 工具定义设断点 |
| 复杂推理 / 关键决策 / 难 bug | Sol | 高,必要时 max | 按需 |
不要在一个应用里只用一个档。全上 Sol 是浪费,全上 Luna 会在难任务上翻车。 分层的成本效益远高于在单一档位上抠提示词长度。
顺带提醒:两条时间线
- gpt-5.4 / gpt-5.4-mini 于 2026-08-31 在 Codex 退役,分别由 gpt-5.6-terra 与 gpt-5.6-luna 替代。写死了旧模型名的脚本现在就该改。
- Sora API 于 2026-09-24 停止服务。如果你的产品还在调用视频生成端点,需要尽快找替代方案。
一句话总结
先把价格表换成 7-30 之后的,再谈优化。然后按「默认档降到 Terra → 高频简单调用下沉 Luna → 配显式缓存断点」的顺序做, 收益依次递增。最后检查一遍代码里有没有裸写 gpt-5.6—— 那个 alias 会把你的账单悄悄拉到 Sol 的价位。