
上周四,我买了 Claude Max。要知道,我之前的时间几乎被 GPT-5 淹没,GPT-5 比 Claude Max 便宜足足 12 倍。
接着,我用 Claude Code 疯狂地对比了几个模型:Horizon Beta、Qwen3-Coder、GPT-OSS,当然还有 GPT-5。
结果让我发现了一个大多数人忽略的点:Claude Code 有一条“隐藏护城河”,哪怕 GPT-5 再聪明、再便宜,也跨不过去。

下面就是我这场测试全记录。
我测试了不同模型接入 Claude Code 的表现。试了各种路由方案和 OpenRouter 集成,跑过的配置包括:
结果非常统一:
非 Anthropic 系列的回答普遍就是——“修 bug”“加错误处理”“优化函数”……一句话糊弄过去。
而 Claude 给的却是:可直接跑的生产级代码 + 详细解释。这才是开发者真正需要的。
硬数据也说明了一切:Claude Opus 4.1 在 SWE-bench(真实世界代码任务基准)上的表现稳压全场。
这个差距,放到现实开发里,就是几个小时的调 bug,和一个能不能上线的分水岭。
当然,GPT-5 也不是没有亮点。正如 Simon Willison 说的,它的价格几乎是“屠杀级”:
1.25刀/百万输入 token,而 Claude Opus 4.1 要 15刀。
便宜 12 倍,这谁看了不心动?
但坑也在这里。Artificial Analysis 的数据揭示:GPT-5 的表现取决于你被分配到哪个模型。具体看:

说白了,你买的是一张“彩票”。如果运气好,能拿到“思考模式”,答案很不错;但一旦掉到低配通道,产出甚至还不如旧一代。
这种波动让 GPT-5 在关键生产任务里很难放心。
对比之下,Claude 的稳定性就是它的底气。没有随机降级,没有抽奖。
重点来了。
为什么 Claude Code 能这么稳?
秘诀不在模型本身,而在于 针对 Claude 架构深度调优的提示工程。
Yifan 的分析把核心扒了出来:
你可以把这比作赛车。GPT-5 是豪华 SUV:均衡、便宜、跑得也不慢。Claude Code 就是 F1 赛车:为一条赛道彻底优化。
贵,但要赢比赛,它就是唯一选项。
在 Claude 的提示设计里能看到一堆“小花活”:
对开发者来说,这意味着:
想自己测试?很简单:
我们正在进入一个“模型商品化+价格战”的时代,但最后赢的不是最便宜的,而是最懂特定场景的产品。
这就是为什么,最终,哪怕贵 12 倍,我还是选了 Claude Max。