
你好,我是曹犟,欢迎关注我的公众号。
前两天,在群里和几个朋友闲聊,讨论 Fable 5、GPT 5.6 这一代模型的能力。一位做了很多年程序员的朋友有一个很直接的感觉:这一代模型看似变强了,但解决的问题域没有变化,所以他怀疑,这一波 AI 泡沫是不是快到头了。
另一位一直在做投资的朋友,给出的判断则更具体。他认为,以 LLM 这种技术范式为基石的应用里,Coding 是目前最成功的一个,但过去半年 Coding 的高速增长可能已经接近阶段性天花板;而视频模型虽然已经开始变现,但总体需求规模还有限;再往后,真正有机会把市场边界往外推的,应该还是具身智能。
我当时回了一句话:最近这一波模型密集发布,厂商的营销声势也很大,但 automatic GDP 的范围没有变大,只是在这个范围内做得更好了。这里说的 automatic GDP,不是指 AI 偶尔帮人写一段话、画一张图,而是指一项经济活动能够在多大程度上由 AI 独立完成交付,并对最终结果负责。简单来说,AI 是只给了一个建议,还是已经能真正把活干完。
需要补充的是,就在我们讨论前后,GLM 5.2、Kimi K3、Qwen 3.8 接连发布。GLM 5.2 和 K3 把开放模型推进到了接近最强闭源模型的位置;而另一边,OpenAI 不停给 Codex 用户赠送 reset,Anthropic 也改变了 Fable 5 的订阅政策,把原来准备单独收费的最强模型重新放回部分 Coding Plan。从这个角度看,似乎有一点“模型能力到头了,厂商开始打价格战”的味道。
今天这篇文章就顺着“AI 到头了吗”的讨论,展开讲讲我的观点。
模型能力、智能价格和 automatic GDP
在类似的讨论中,有一个容易混淆的地方:大家口中的“到头”,说的是不是同一件事?
我总结了一下,上面讨论中的“到头了”分别对应下面三个问题:
第一,模型能力是不是到头了,也就是现有范式下,Scaling 是否还在继续产生更聪明的模型。
第二,最强模型的商业溢价是不是到头了,也就是模型厂商还能不能长期依靠几个月的领先收取高额溢价。
第三,AI 能真正闭环交付的问题范围,也就是 automatic GDP 的范围,是不是接近了天花板。
这三件事并不等价。我个人目前的判断是,模型能力还没有到头,最强模型的商业溢价已经开始被竞争压缩,而 automatic GDP 的范围虽然仍在扩大,但扩大的速度明显慢于模型能力的增长。
这也是为什么我们会同时看到这样的现象:每一代模型的 benchmark 还在涨,最强模型的价格和订阅门槛却在下降,重度用户拿到新模型之后,又经常觉得“还是在做原来那些事,只是做得更好了”。
模型能力还在进步,但前沿能力也在快速扩散
先看模型能力本身。Fable 5 受益于更大的参数规模,相比 Opus 4.8,在能力上取得了相当明显的提升。OpenAI 自己公布的结果则显示,GPT 5.6 Sol 在 Coding、专业知识工作、Computer Use、科学和网络安全等领域都有提升,基本接近 Fable 5 的水平。
与此同时,开放模型也在加速追赶。
6 月 16 日,智谱发布了 GLM 5.2。它支持 100 万 token 上下文,并采用 MIT 开源许可证。从公开评测和周围人的使用体验来看,它的能力已经接近、甚至达到了 Opus 4.8 的水平。
一个月后发布的 K3,则拥有 2.8 万亿参数,原生支持多模态和 100 万 token 上下文,引起了更大的轰动。从很多公开评测和 KOL 的使用体验来看,它已经超过了 Opus 4.8,仅次于 Fable 5 和 GPT 5.6 Sol。
这两个模型的发布,让以中国为主阵地的开放模型第一次在能力上逼近最强闭源模型,而且这种接近已经到了普通用户也能明显感知的程度。如果再考虑价格因素,从性价比来看,领先的开源模型已经是妥妥的第一梯队了。
Fable 5 和 GPT 5.6 说明,模型能力还在随着参数和数据规模的提升继续进步;GLM 5.2 和 K3 则说明,这些前沿能力正在更快地扩散。昨天只有最昂贵的闭源模型能做的事情,今天一个更便宜、甚至开放完整权重的模型也能做。
最强智能,正在从稀缺品变成促销品
开源模型的进步,必然会给闭源模型带来巨大的竞争压力。
先看 Anthropic 最近一段时间的动作。6 月,它推出了激活促销,每个首次激活 Claude Code 或 Cowork 的用户可以获得 1000 美元 Credits,单个组织最高可以达到 1000 万美元。与此同时,Fable 5 的免费体验窗口被多次延长,Claude Code 的周使用额度也增加了 50%。
Anthropic 之前还试图让用户为“最强能力”单独付费。Fable 5 最初计划在体验期结束后移出订阅额度,如果用户要继续使用,就需要单独购买 Usage Credits。但面对激烈的竞争压力,确实如我之前所判断的那样,Anthropic 自己打了自己的脸:不仅多次延长体验窗口,最终还让 100 美元和 200 美元订阅套餐的用户在 Coding Plan 中用上了 Fable 5。
GPT 5.6 说明另一个闭源厂商可以在部分关键任务上超过 Fable 5,并且做到更低的价格;GLM 5.2 和 K3 则说明,开放模型的追赶速度比很多人预期得更快。用户突然有了更多选择,Anthropic 就很难再把 Fable 5 当作一种长期稀缺、可以稳定单独收费的能力。
从这个角度来说,Anthropic 高估的可能不是 Fable 5 当时的绝对能力,而是自己的领先优势能够维持多久。它原本按照一个较长的领先窗口设计收费策略,但 GPT 5.6、GLM 5.2 和 K3 把这个窗口迅速压短了。Fable 5 当然仍然是第一梯队的模型,只不过,进入第一梯队已经不再意味着用户只有一个选择。
对用户来说,结果也很直接:原来需要单独买的最强能力,现在重新变成了订阅的一部分。
OpenAI 则走得更远。Codex 隔三差五就会赠送一次 reset,OpenAI 甚至把 reset 变成了一种正式的产品机制:既可以存进账户,也可以通过邀请获得。你在 X 上发个帖,讲讲自己怎么使用 Codex,OpenAI 都会送你一大笔 Credits。
这些动作背后反映出一个新的变化:厂商争夺的已经不只是 benchmark 第一,而是用户愿意把多少真实工作放进自己的 Agent。
当模型之间的能力差距从一年缩短到几个月,甚至几个星期,领先者就很难只靠“我最聪明”长期收取高额溢价。最强智能正在从稀缺品变成订阅权益,模型厂商的竞争也会从单纯拼能力,逐渐转向拼价格、算力供给、Agent 产品和用户工作流。
以往那种恐慌式的饥饿营销也收敛了很多。什么下一代 GPT 的能力像核弹一样、奥特曼瘫倒在地上、Anthropic 发现 AI 试图逃逸,或者 AI 能力太强、太危险,所以不能发布之类的段子,虽然“四大顶刊”等自媒体还在写,但朋友圈转发这类文章的人已经少了很多。甚至连 Anthropic 对中国用户的封号都没那么严格了。
所以,如果说有什么接近到头了,我觉得首先是模型厂商的第一波红利,也就是依靠几个月的能力领先,长期收取高额溢价。
模型能力本身还在继续向前,但这种红利正在被竞争逐渐消耗。
至于应用厂商依靠通用模型升级自然获得产品增长的红利,是不是也接近到头了,则要看第三条曲线:automatic GDP 的范围有没有同步扩大。
为什么 Coding 走得这么快?
我个人觉得,要回答这个问题,需要先看 Coding 为什么会成为第一个跑通的领域。它的特殊性一直被低估了:训练数据多只是一个方面,更重要的是,它天然具备一套非常适合 AI 的工作环境。
第一,输入和输出都在数字世界里,Agent 可以直接读代码、改代码,不需要通过人转述。
第二,对错相对容易验证。代码能不能编译、测试能不能通过、页面能不能运行,AI 都可以自己得到反馈。
第三,错误大多可以回滚。改坏了有 Git,测试环境出问题可以重来,AI 有机会通过反复尝试完成自我修正。
第四,工具接口已经高度标准化。终端、编辑器、浏览器、数据库和各种 API,原本就是给软件调用的,AI 接入之后很容易形成完整闭环。
这四个条件叠加在一起,才让 Coding 成为第一个真正进入 automatic GDP 的知识工作。
写作看起来比编程简单,但文章写得好不好,没有一条命令可以直接验证。我已经用 AI 辅助写作很长时间,但至今仍然认为,AI 在编程上可以接近 L4,人只检查最终结果;在写作上则更多还停留在 L2,人需要负责创意、观点、判断和最后的润色。
数据分析也是一样。SQL 能运行,并不代表“成交”“客户”“活跃用户”这些业务口径理解对了。广告投放则更麻烦,AI 可以看到数据、提出建议、甚至修改预算,但结果可能几天之后才出现,期间还会受到素材、竞争、季节和用户需求变化的影响。反馈越慢、越难归因,AI 就越不好用。
所以,Coding 的成功并不能简单证明 LLM 可以用同样的速度接管所有知识工作。它证明的是,只要一个领域能给 AI 建立清晰、及时、可回滚的反馈闭环,AI 的渗透速度可以非常快。
Anthropic 2026 年 3 月发布的 Economic Index 也提供了一个侧面证据。在其样本中,计算机和数学类任务仍然占对话的 35%;大约 49% 的职业,至少有四分之一的任务曾经出现过 Claude 的使用,但这个累计覆盖比例相比上一轮几乎没有变化,任务类型也没有明显扩展。
这份数据可能说明,在一个领域内,当前使用深度的增长确实快于任务宽度的增长。
容易做的已经做了,剩下的要靠应用厂商慢慢啃
不过,回头看,开头那句“automatic GDP 的范围没有变大”说得有些绝对。
Claude Code 和 Codex 的名字里虽然都有 Code,但我用它们写文章、做调研、处理文档、分析数据的时间,并不比真正写代码少。
Anthropic 自己的数据也显示,从 2025 年 10 月到 2026 年 4 月,用于修复代码的会话占比从 33% 降到 19%,而数据分析和文档写作合计从大约 10% 上升到 20%。在整个样本中,已经有 13% 的会话最终产出的是分析或者文字,而不是代码。
从这个角度看,Coding Agent 这个名字可能会产生误导。它真正的价值,不只是服务程序员,而是提供一套让 AI 能够读文件、调用工具、执行操作、观察结果的数字工作环境。代码只是这套环境里最早跑通、也最容易验收的一种任务。
换句话说,Coding Agent 正在从编程工具变成数字工作的通用操作系统。它会从写代码慢慢扩展到数据分析、文档、设计、营销和企业软件操作,但每扩展到一个新领域,都需要补上这个领域的 Context、评测集、权限和反馈机制。
这说明,automatic GDP 还在扩大,但目前主要是沿着数字世界向外扩张,扩张的速度远远赶不上模型跑分和价格下降的速度。
但这条扩张路径有一个很关键的变化:只靠模型的通用能力就能直接改善的场景,基本已经被市场迅速做过一遍了。写代码、生成内容、翻译、总结文档、通用问答,这些相对容易标准化的事情,现在已经有了很多成熟产品。剩下的场景,往往都带着非常具体的行业知识、业务口径和责任边界。
在做 Omni-Growth 的过程中,我们对这件事体会很深。模型能够分析广告数据,只是一个起点。我们还需要接入 Meta 等真实系统,整理每个组织、每个账户的业务背景和投放规则,让每条建议可以追溯,设置人工确认和回滚机制,再把执行后的结果反馈回来。这里面真正困难的部分,已经不是让模型再聪明一点,而是让它在一个具体的工作环境里形成闭环,并且逐步承担责任。
所以,不考虑具身智能,单看 LLM,容易做的事情已经做得差不多了。automatic GDP 想继续扩大,接下来更多要靠各个应用厂商把一个个行业场景做成 Agent,一块一块地啃下来。
这对应用厂商反而是一个机会。当 K3、GPT 5.6、Fable 5 的能力差距越来越小,大家都能调用相近的模型,真正能够形成差异的,更多是行业 Context、评测集、系统权限、反馈数据,以及对业务结果负责的能力。模型厂商当然还会继续做出更强的通用模型,但 automatic GDP 能不能继续扩大,可能更多取决于成千上万个应用厂商能不能慢慢把各自熟悉的那部分 GDP 变成 automatic GDP。
应用厂商可以继续在数字世界里扩大 automatic GDP,但要进入那些原本根本没有被数字系统覆盖的劳动领域,就需要另一条技术路径。
具身智能,可能进一步扩大 automatic GDP 的宽度
一旦机器人能够在真实环境里稳定完成任务,它所进入的就是家务、物流、制造、零售、养老等大量物理世界的劳动。相关的进展和 demo,在中美两国都有非常多的报道。
但从演示走到可靠交付,中间还有非常长的距离。朋友在讨论中举了一个很具体的例子:吃完饭之后,让机器人把桌子收拾干净,把盘子放进洗碗机。这件事对人来说可能只需要几分钟,对机器人却非常难。盘子里有残羹剩饭怎么处理?碗里有汤,怎么保证端起来不会洒?桌上突然多了一个塑料袋,它是垃圾还是需要保留的东西?家里有老人和孩子的时候,机械臂应该用多大的速度和力度?
代码写错了可以回滚,汤洒到地毯上不能按一下 Git Reset;测试没通过可以再跑一次,机器人把盘子摔到孩子脚边,不能把它当成一次普通的重试。
所以朋友开玩笑说,如果 Coding 的难度是 1,这类家务场景的难度可能就是 1000。这个数字当然只是比喻,但背后的差异是真实的:数字世界主要解决信息和逻辑问题,物理世界还要同时处理感知、控制、安全、成本和责任。
而且,具身智能的底层技术也不只是把一个 LLM 塞进机器人。LLM 可以负责理解指令、拆解任务,或者说充当一部分“大脑”;真正完成家务,还需要视觉、空间理解、世界模型、运动控制,以及大量来自真实环境的训练和反馈。
但也正因为难,一旦这条路走通,它带来的不是在原有 automatic GDP 里面多写一些代码、多生成一些视频,而是把原来完全在范围之外的物理劳动纳入进来。Coding 让 AI 在数字 GDP 里不断挖深,具身智能则有机会把 automatic GDP 的边界推向物理世界。
写在最后
所以,我不认为 AI 到头了。
模型厂商会继续把通用智能做得更强、更便宜;应用厂商需要把一个个数字场景做成能够闭环交付的 Agent;具身智能则可能把边界从数字世界推向物理世界。这三条路径都在继续,只是推进的速度和难度完全不同。
真正接近到头的,可能是这样的红利:只要模型的 benchmark 每提升几分,新的产业应用就会自动长出来;只要跑分能够领先几个月,就可以在商业模式上为所欲为,教用户做人。
容易做的事情已经做得差不多了,下一阶段的 automatic GDP 不会自动扩大,只能靠各个行业一块一块地啃出来。
最后也想问问大家:过去半年,你交给 AI 的新任务,究竟只是把原来的事情做得更好了,还是第一次解决了一个过去完全解决不了的问题?欢迎在评论区聊聊。
本文作者曹犟正在和团队打造 Omni-Growth Agent,一套 AI 海外增长引擎,你决定交出多少控制权:想把海外营销整个交出去的,我们全托管、按增长结果付费;想自己掌舵的投手,配一个 7×24 盯盘和诊断的 AI Copilot,判断权还在你手上。
更多信息可以看这里:https://omni-growth.ai