Codex 和 Claude Code 对比:先说一个没人提的事实——六成人两个都装
Codex 单用户月均消耗是 Claude Code 的 1.6 倍,账单大概 32 对 19 美元。但看完 Vibe Usage 上 593 个人的真实数据,我觉得「二选一」本身就是个伪命题——这篇把消耗结构、缓存、账单一项项摆开。
搜「Codex 和 Claude Code 对比」的人,大多想要一个二选一的答案。我先给数据:Codex 单用户月均烧 2.55 亿 token,Claude Code 是 1.6 亿,前者是后者的 1.6 倍;折算账单大约 32 美元对 19 美元。但 Vibe Usage 的聚合数据里有个更有意思的事实——用这两个工具的人,加起来 593 人次,而全部用户一共只有 368 个。
也就是说,至少六成的人,两个都在用。
对比文的正确问法不是「选哪个」,是「哪个干哪种活」。
这俩根本不是同一种工具
看会话数据就明白了:
| Codex CLI | Claude Code | |
|---|---|---|
| 平均会话时长 | 170 分钟 | 81 分钟 |
| 平均消息数 | 544 条 | 63 条 |
| p50 消息数 | 104 条 | 10 条 |
| 单用户月均消耗 | 2.55 亿 | 1.6 亿 |
一次会话 544 条消息是什么概念?你把任务丢给 Codex,它自己规划、读代码、改、跑测试、修,每一步都是一次完整的模型调用。你人可以走开。
Claude Code 的 63 条对应的是另一种节奏:你说一句它做一步,你看一眼再说下一句。说白了,Codex 是你雇的外包,Claude Code 是坐你旁边的同事。
别被平均数骗了,看 p50 更狠:一半以上的 Codex 会话超过 104 条消息,是上百步的自主循环;而 Claude Code 的典型会话就是十来个来回。这不是两个「差不多的 CLI 工具」,是两种工作方式恰好都长成了命令行的样子。
消耗差 1.6 倍,不是谁「效率低」,是干活方式不同。外包按工作量吃 token,同事按你的耐心吃。
账单差距为什么没被缓存拉平
有人会想:Codex 消耗高,但缓存命中率也高,账单是不是就差不多了?
没有。两家的缓存都很好——Codex 92%,Claude Code 91%,几乎打平。所以缓存救不了谁,1.6 倍的消耗差距几乎原样传导到账单上:32 对 19 美元。输出占比也差不多(4% 对 6%),改变不了大局。
这两家真正甩开别人的地方,是和缓存命中率只有五六成的工具比——那笔账我们在六个工具的缓存命中率实测里算过。在 Codex 和 Claude Code 之间,缓存不是变量。
真正的变量是你让 agent 跑多野。我见过 Codex 用户一天跑出普通人一个月的量——为什么 Codex 单用户消耗这么猛,我们单独写过一篇。
那怎么选
我的建议很不中立:别选。
长任务、明确目标、不想盯着——丢给 Codex。改几行、要来回讨论、代码你要逐段看——Claude Code。这也是数据里六成人两个都装的原因,他们不是选择困难,是真的两个都要用。
举两个典型场景。批量迁移、修一仓库的 lint、按 issue 清单扫尾,这种「目标清楚、过程无聊」的活给 Codex,它跑一百步你喝咖啡。设计新接口、重构核心模块这种每一步 diff 你都想过目的活,Claude Code 的十来个回合刚刚好——你要的不是全自动,是有人陪你想。
如果非要给一个先装哪个的答案:看你付钱的方式。Claude Code 有订阅档位兜底(怎么选档位见Claude Code 计费拆解),Codex 重度跑起来是实打实的 API 账单。预算敏感先 Claude Code,时间敏感先 Codex。
装完别凭感觉判断谁更烧——把两个工具放进同一个面板看消耗,一个月后你自己的数据会替你做「Codex 和 Claude Code 对比」这道题,比任何文章都准。