
2026 年 6 月 25 日,OpenAI 抛出了一份极具行业杀伤力的经济研究论文。
这组最新披露的内部数据堪称疯狂:在 OpenAI 内部员工每周产生的输出 Token 中,Codex 智能体占比高达 99.8%。而在仅仅一年前,这个数字还不到 10%。
更具颠覆性的是,非开发者群体(如法务、财务、招聘)的组织采用量同比暴增 189 倍。而内部的重度用户,日均运行的智能体任务时长竟然达到了 71 小时。
一个人一天只有 24 小时,71 小时意味着什么?意味着人类正在把自己变成一个高并发的任务调度中心。
很多人的认知还停留在“Codex 只是个写代码的插件”。这是一个致命的误判。
ChatGPT 的核心交互是“你问我答”,人类需要自己去拼凑和组装工作成果。而 Codex 采用的是委托模式(Delegation):你把一个完整的任务目标扔给它,它会自动去调用工具、读取本地文件、执行终端命令、自我迭代,并在几小时后交出一份可验证的产物。
为了更清晰地展示这种降维打击,我们可以看下两者的底层差异:
维度 | ChatGPT (聊天模式) | Codex (智能体委托模式) |
|---|---|---|
交互单位 | 单次问答 (Prompt & Response) | 完整工作包 (Task Outsourcing) |
执行逻辑 | 纯文本生成 | 自动调用工具、读写文件、执行命令 |
外部工具调用率 | 21.9% | 60.3% |
核心适用场景 | 寻找灵感、文本润色、快速解惑 | 替代需人类专注 8 小时以上的复杂长线任务 |
交互单位的变迁,标志着 AI 正在从“效率工具”正式跨入“数字员工”的阶段。
如果 Codex 只是工程师的极客玩具,这份论文不值得如此重视。真正的行业地震在于非技术人群的爆发。
根据论文的时间线,这种替代是呈摧枯拉朽之势的:
自 2025 年 8 月以来,组织账户中的非开发者用户数暴增了 189 倍。
论文揭示了一个极其反直觉的现象:非技术部门产出的 Codex 任务中,超过 25% 实际上是硬核的技术活(如写自动化脚本、数据清洗转换、工具搭建)。
法务不懂 Python,但可以通过 Codex 写脚本批量审查合同;财务不懂 SQL,但可以让 Codex 自动拉取跨部门数据并建立复杂财务模型。
“做技术的事必须找工程师”这一职场铁律正在瓦解。 能够精准定义业务需求、判断输出质量、并为最终商业结果负责的人,其价值正在远远超越只会写代码的“码农”。
数据指出,OpenAI 内部前 1% 的重度用户,日均运行约 71 小时的智能体工作。
这显然突破了物理时间的限制。唯一的解释是:并行计算(Parallelism)。
一个人同时在后台管理 3 到 5 个 Codex Agent。这已经不是在使用工具,而是在指挥一支“智能体舰队”。超过 26.6% 的用户使用了高度模块化的 Skills(可共享的指令集与配置文件),将“如何用好 Agent”直接沉淀为了固化的组织资产。
当机器揽下了所有脏活累活,人类的工作重心不可逆转地上移了:定义任务边界 \rightarrow 设定容错约束 \rightarrow 审查边缘案例 \rightarrow 承担结果责任。
当然,业内对这份漂亮的数据并非全盘买账。
知名科技媒体《The Register》直接开火,指出所有数据均为 OpenAI “自说自话”,且未回应内部是否存在将 Codex 使用率与 KPI 挂钩的强制推行手段。
此外,这篇论文发布的同时,推特上正爆发着激烈的 #BringBack4o 抗议活动。大量付费用户愤怒地指责 OpenAI 强推 Codex 而剥夺了传统的对话体验。这引出了一个尖锐的拷问:内部 99.8% 的采用率,究竟是因为 Codex 真的无可替代,还是因为官方在物理层面上掐断了其他选项?
OpenAI 员工的特殊属性(拥有无限的内部算力、最高级别的 Agent 调教水平)确实让这份数据带有极强的“幸存者偏差”。但不可否认的是,外部非开发者 189 倍的真实增长,依然证明了 Agent 模式的强大渗透力。
在 99.8% 的震撼输出面前,最懂行的人,眼睛反而死死盯住了那剩下的 0.2%。
这 0.2% 是人类工程师亲手敲下的 Token,它们代表着最后的“验证(Verification)”。
这决定了那 99.8% 的机器代码到底是能顺利 Ship(发布)到生产环境,还是被无情地 Revert(回滚)。当生成工作的边际成本趋近于零时,“审查 Agent 的 Diff(差异)”、“检测复杂幻觉”以及“业务逻辑一致性判定”,正在成为全行业最稀缺的硬核技能。
OpenAI 用自家的内部运转做了一场残酷的活体实验。它向所有人宣告:未来的职场竞争,早已不在于谁的 Prompt 写得更花哨,而在于谁能构建最严密的 Agent 舰队,并拥有为那关键的 0.2% 拍板定音的顶级判断力。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。