它把"脚手架"焊进了模型,对老手只涨了 5% 的能力,账单却翻了 10 倍—— 而 OpenAI 喊的"AGI 时代",更像一张显卡促销单
9 月 3 号那天,朋友圈被 GPT-6 Astra 刷屏了。OpenAI 总裁布洛克曼在发布会结尾丢下一句:"欢迎来到 AGI 时代。"
我当天就把日常的工作流切了过去,连着用了三周。今天想说点不像通稿的话——它确实强,但和 AGI 没半毛钱关系;它对一部分人是神,对另一部分人只是个更贵的工具。
同一个 GPT-6,两种体感:没玩过 harness 的人觉得它封神;天天自己搭 Agent 脚手架的人,只觉得——贵了。
GPT-6 强在哪?它把脚手架焊进了模型
先解释一个词:harness。圈外人听不懂,圈内人天天和它打架。简单说,就是套在模型外面的那一整套"运行环境"——上下文怎么喂、工具怎么调、代码在哪跑、出错怎么收。OpenAI 自己的 Codex 就是个典型:底下是模型,中间一层 API(负责把超长上下文"压缩"后接着跑),最外面是沙箱执行环境。2026 年初他们有个内部实验,一个小团队用 Codex 干出约 100 万行代码,一行人工写的源码都没有。活儿是模型干的,但让它干成的,是那套 harness。
以前这套东西得你自己攒。会用的人,早就把"查资料—写代码—跑测试—改错"串成了一条自动化流水线,模型只是里面的一块齿轮。不会用的人,每次都得手把手点。
GPT-6 干的事,就是把 harness 里最值钱的那几块——自主操作电脑、异步调工具、中途改指令、越界自动刹车——直接焊进了模型本身。官方话说得漂亮:"computer use""async tool calling""mid-turn steering"。翻译过来就是:你以前要自己搭的脚手架,现在出厂自带了。
所以你看出了反差的根源:对从没搭过脚手架的人,GPT-6 像开了天眼;对早把脚手架玩透的人,它只是把你给它的东西,原样还了回来。
给天天调 Agent 的人:提升可能只有 5%–10%
说个扎心的。OpenAI 自己放出来的基准里,GPT-6 在硬核编程 DeepSWE 上拿 74.1 分,上一代 5.6 Sol 是 72.7——差 1.4 分。在计算机操作 OSWorld 2.0 上从 65.7 涨到 72.6,看着不错,但那恰恰是把"操作电脑"焊进模型后最该涨的项。
更尴尬的是,写作和评测类基准它反而退步了。第三方 Artificial Analysis 实测,GPT-6 在 GDPval-AA v2 上掉了约 80 个 Elo;在 Artificial Analysis 智力指数上,它 61.2,被 Anthropic 的 Claude Fable 5.1 的 65.7 压了一头;连"带工具的人类最后考试"(HLE) 都从 65.0 掉到 57.2。
我的判断(这块没有统一口径,凭经验说,你酌情信):对已经把 5.6 + 一套成熟 harness 榨干的人,GPT-6 的真实体验提升,大概率就在 5% 到 10% 之间,是边际改善,不是质变。那些惊呼"飞跃"的,多半是第一次用上"会自己动手"的模型——这个飞跃,老手去年就靠自己搭的脚手架拿到了。
说句不中听的:模型代际差,会被你的系统吃掉。
代价是,账单翻了 10 倍
标价先摆这:GPT-6 每百万输入 token 10 美元、输出 50 美元。上一代 5.6 Sol 促销价是输入 4 美元、输出 20 美元。也就是说,光看单价,贵了 2.5 倍(数据来自 BT 财经、TokenRate、Yotta Labs 多家对齐)。
但单价只是地板。真实账单有三个放大器:一是你大概率会开 max 推理强度;二是 Agent 一长循环,上下文反复重发;三是个隐藏陷阱——单次输入超过 27.2 万 token,整条请求的输入费翻倍、输出费涨 1.5 倍。再加上 OpenAI 自己承认,为了"让能力被监督地使用",越界监控吃掉了"显著的算力成本"。
把这些都算上,重度 Agent 工作负载的真实 token 消耗,我自己的体感是翻了约 10 倍。2.5 倍是你看到的价签,10 倍是你月底收到的账单。性价比这件事,对用户来说,是被稀释了的。
大模型、token、Agent,本质上是一门口按字收费的生意,不是通往 AGI 的正确道路。
—— 这是我自己的判断,不是 OpenAI 的话
那"AGI 时代"到底是个啥
回到布洛克曼那句话。配合它一起出现的,是一条完整的产业链叙事:得州"星际之门"超算、10 万张 H100、20 亿美元训练投入、算力硬件 / B 端软件 / 网络安全整条需求扩张。每一条,最后都指向一件事——买更多卡。
我越看越觉得,那句"AGI 时代"像一张显卡促销单。不是贬义,是商业逻辑:模型越大,卖得越贵;叙事越宏大,卖得越多。数据堆叠这条路,本身就是一门越滚越大的生意。
一个旁证:GPT-6 去攻千禧年数学难题纳维–斯托克斯,动用了约 1 万个 Agent、并行 88 小时、发出 2.7 亿条消息、吃掉 1300 亿输出 token,烧掉数百万美元——而真正"写"证明的,是另一个还在训练的内部模型,GPT-6 只是负责把证明形式化、查漏洞。换句话说,它炫的那一下,靠的是堆量堆出来的,不是"懂"出来的。
给猴子堆数据,它能变成 AGI 吗?
这就要说回最根本的问题了。我常拿一句话怼那种"GPT-6 已经接近 AGI"的论调:你给一只猴子拼命堆数据,它的智商能堆成 AGI 吗?显然不能。
人也是一样。你不会因为拼命学习,就变成 AGI。学习让你在某个领域更熟练,但"智商变成另一种东西"这件事,不发生。大模型同理——它本质是在复现训练数据里的统计规律,堆数据提升的是"见过的模式复现率",不是"理解世界的能力"。
杨立昆(Yann LeCun)说过一句很刺耳但到点上的话:文本只是现实的压缩残影,模型在讨论物理,却并不懂物理。这话我把味儿调一下给你听——GPT-6 能跟你聊纳维–斯托克斯方程,但它不是"理解"了流体,它是"背"下了对流体的描述。
真正的路,还不知道在哪
我必须诚实:我不知道 AGI 怎么来。但有几条线,明显比"继续堆数据"更被严肃对待。
世界模型是其中之一。杨立昆离开 Meta 创立 AMI Labs,2026 年初拿了 10.3 亿美元种子轮,做的 JEPA 架构,不在像素或 token 空间做预测,而在抽象表征空间推演未来状态。DeepMind 的哈萨比斯也公开说过,光靠扩大语言模型参数不够,世界模型是 AGI 的必要条件。这俩人加本吉奥,罕见地在一个判断上一致。
类脑 / 神经形态是另一条。生物脑的数据和能耗效率,比今天这些吞电的模型高出去不止一个量级——今天这条路线,从根上就极其浪费。
但别急着站队。连世界模型派自己都打架:哈萨比斯的 AlphaGo Zero、AlphaStar 压根没用显式世界模型,照样超人。所以"必由之路"这四个字,目前谁都不配说。我只能说:当下不存在一条已被验证的通往 AGI 的道路,尤其是"堆叠数据"这一条。
你问我该咋办
用 GPT-6。它好用,该用就用。但别被"AGI 时代"几个字裹挟着去换显卡、升顶配订阅。
给从业者一句:把精力花在你设计的系统(harness)上。模型的代际差,会被你的系统吃掉——5.6 被你调明白了,和 6 裸用,差距没你想的大。
给围观的人一句:下次再有人拿"AGI 要来了"吓你,先看他卖不卖卡。
真正的智能革命,可能不在下一次 scaling,而在某个人哪天想清楚"世界到底该怎么建模"的那个下午。那个下午,GPT-6 不会帮你到来。