先承认一件事:它们比宣传里更像
大部分对比文章会把两者描述成两种哲学,但实际用下来,Codex 和 Claude Code 的相似度远高于差异度: 都是能读懂代码库、编辑文件、跑测试、开可审查 PR 的编程 Agent, 都能从终端发起长时间的自主会话。
真正的差异藏在细节里——上下文能装多少、并行怎么做、跑一次多少钱、 以及最微妙的那条:你用着爽 和 它写得好 并不是一回事。
基准成绩:各有胜负
| 基准 | Codex(GPT-5.5 / 5.6 侧) | Claude Code(Opus 4.8 侧) | 赢家 |
|---|---|---|---|
| Terminal-Bench 2.0 | 82.7% | 69.4% | Codex(大幅) |
| SWE-bench Verified | 88.7% | 88.6% | 基本打平 |
| SWE-bench Pro | 58.6% | 69.2% | Claude Code(大幅) |
| 上下文窗口(默认) | 272K | 1M | Claude Code |
| 上下文窗口(上限) | ~1.05M(需显式开启长上下文模式) | 1M | 基本相当 |
数据来自 2026 年 8 月前后的公开评测汇总。需要提醒:不同来源在模型版本上存在分歧 (有的报告称 Codex 跑 GPT-5.5、有的称已是 GPT-5.6 家族),早期报告还给出过 200K 的上下文数字; 且部分对比页面来自售卖相关产品的厂商。建议以 OpenAI 与 Anthropic 官方公布值为准。
怎么读这张表:Terminal-Bench 测的是终端环境里的实操能力, SWE-bench Verified 是相对标准化的修 bug 任务, 而 SWE-bench Pro 更接近真实工程中的复杂问题。 所以这三行的意思大致是:Codex 在「按部就班执行」上更强, Claude Code 在「面对乱七八糟的真实代码库」时更强。
并行子智能体:两种思路
两边都在 2026 年把多智能体做成了正式功能,但机制不同:
| Codex | Claude Code | |
|---|---|---|
| 并行机制 | 最多 8 个子智能体 | Agent Teams |
| 隔离方式 | 各自独立的云端沙箱 | 共享同一份任务列表 |
| 协作方式 | 互不干扰,并行执行 | 彼此可以发消息协同 |
| 长任务持久化 | /goal 支持多天持续 | Memory 跨会话上下文 |
一句话概括:Codex 的并行像「分包给 8 个互不认识的外包」, Claude Code 的并行像「一个会开会的小组」。 前者适合任务能干净切分的场景(比如给 200 个文件做同一种改造), 后者适合子任务之间有依赖、需要互相通气的场景。
成本:一个刺眼的案例
有一个被反复引用的对比:同一个 Express.js 重构任务,Codex 约花费 15 美元,Claude Code 约 155 美元——十倍差距。
差距主要来自 token 效率。GPT-5.6 这一代在「用更少 token 达到同等效果」上确实做了不少工作。 但要给这个数字打个折扣:这是单个案例, 任务类型不同,差距会有很大波动,不能当成通用倍率。
订阅层面两者都从 $20/月起步,但同样的钱能跑多久不一样: ChatGPT Plus 给的会话数更多,Claude 更容易先撞到上限。 OpenAI 在 2026 年 4 月重构定价后,$100 的 Pro 档还专门调高了 Codex 额度—— 细节见 套餐对比。
最有意思的一组矛盾数据
在一份 500 多名开发者参与的调查里:
- 65% 的人日常更偏好 Codex。
- 但在盲评中,67% 认为 Claude Code 产出的代码更干净。
这两个数字看起来打架,其实指向同一个结论:日常偏好衡量的是过程体验(快、能放手、便宜),盲评衡量的是产出质量。
换成人话:Codex 让你用着更爽,Claude Code 让你后面少返工。哪个更重要,取决于你的代码要活多久—— 写个一次性脚本,爽最重要;写要维护三年的核心模块,干净最重要。
怎么选:按场景
| 你的场景 | 建议 | 原因 |
|---|---|---|
| 终端脚本、运维任务、CI 修复 | Codex | Terminal-Bench 优势最明显 |
| 大批量、可切分的机械改造 | Codex | 8 个隔离沙箱并行,成本低 |
| 整仓库理解、跨模块重构 | Claude Code | 1M 上下文 + SWE-bench Pro 优势 |
| 核心模块、需要长期维护的代码 | Claude Code | 盲评代码质量更高,返工成本低 |
| 预算敏感、任务量大 | Codex | token 效率优势显著 |
| 专业全职开发 | 两个都订 | $20 + $20 远低于一次严重返工的成本 |
一个务实的搭配方案
如果你决定两个都用,我们观察到比较有效的分工是:
- 用 Codex 做探索和草稿:快速试方案、跑实验、写一次性脚本。
- 用 Claude Code 做落地和审查:正式实现、跨文件重构、最终 review。
- 大规模机械迁移交给 Codex 的并行沙箱,改完再让 Claude Code 通读一遍。
这套分工的逻辑就是上面那组矛盾数据的直接应用:让快的去试错,让稳的去定稿。
需要提醒的一点
这个领域的领先地位每次模型发布都会翻转一次。 本文的数据截至 2026 年 8 月初,而 GPT-5.6 才发布一个月、Opus 4.8 发布两个多月。 与其纠结此刻谁领先 2 个百分点,不如按「哪个更契合你现有的模型和厂商栈」来选—— 这个因素的稳定性比 benchmark 高得多。
更宽视野的工具对比见Claude Code vs Cursor vs GitHub Copilot。
一句话总结
Codex 快、省、能放手;Claude Code 稳、干净、看得懂大仓库。选一个的话,按你的代码要活多久来定; 如果你靠写代码吃饭,$40 一个月两个都订,大概率是这份工作里性价比最高的一笔开销。