今天的 AI 圈有两件事同时发生,方向完全相反。
一件事在降价:DeepSeek 把百万 token 上下文的缓存成本压到每 token 890 字节。另一件事在拆信任:两位数学家先后公开指控 OpenAI 的数学突破用了他们没发表的研究,逼出了那句「不能排除去标识化数据参与了训练」。
我的第一反应跟很多人一样:又来卷价格了。真正让我觉得这事大了的,是另一句话。
「去标识」去得掉名字,去不掉思想
争议的根源是个模糊地带。数学家问 OpenAI:我和 ChatGPT 的对话,进了你们的训练数据吗?官方回答只说「没有直接检索你的对话」,却对「是否进入训练池」避而不答,原话是「可能性很低,但无法排除」。
去标识化去得掉名字,去不掉数学思想的内容。
一位叫 Andreas Thom 的数学家还发现,OpenAI 上月宣布的十项数学成果里,他自己方向的那篇没引用他和合作者的工作,被质疑后才悄悄改了稿子。HN 上同一天还冒出一条指控:OpenAI 会反复重新打开 allow training 开关。
对我们意味着什么?你跟商业 AI 工具聊的每一个未公开方案,都可能变成别人的筹码,尤其当厂商既是你的工具供应商、又是你的竞争对手。「用竞品工具处理核心研究等于无泄露」这个默认假设,今天正式作废。企业采购 agent 平台时,数据回流条款、零保留承诺、审计权,得写进合同,不能靠界面上的开关。
890 字节,长上下文重新定价
DeepSeek 9 月 10 日发布 V4.1-Flash,技术报告的副标题就叫「把 KV Cache 压缩推到极限」。552B 参数的 MoE 模型,切成 20 层编码器加 20 层解码器,prefill 只激活 8B 参数,每 token 缓存只要 890 字节,是上一代的四分之一。百万 token 的上下文,缓存不到 1GB。
长上下文的成本瓶颈不在算力,在缓存的字节数。
为什么这对 agent 尤其重要?因为读代码仓库、翻工具调用记录、啃长文档,agent 的负载是输入密集型的,每一步都在为输入付钱。DeepSeek 把整份报告的卖点从「更聪明」换成了「更便宜」,这个叙事切换本身就是信号。
⚠️ 反面教训藏在运营动作里:9 月 14 日中午起,所有 V4 Pro 的请求会被强制路由到 Flash 按新价计费。模型名没变,底座完全换了,不是微调。生产环境里按模型名路由的团队,迁移风险就藏在名字不变的那天。9 月 14 日之前,拿自己的评测集跑一遍 deepseek-flash,这步不能省。
还有个细节值得表扬:报告主动标注了自家短板,Terminal-Bench 4.0 只有 31.2 分,对手是 51.8。分是自报的、未独立复现,但肯亮短板比藏着的可信。
开源底座加自研 RL,第一次打出对标成绩
同一天 Cognition 发布编码模型 SWE-2,底座是月之暗面开源的 Kimi K3,2.8 万亿参数。他们自己做了强化学习后训练,成绩离 Claude Fable 5.1 只差不到 1 分,价格便宜 64%,只有 GPT-6 Astra 的四分之一。
开源底座加自研强化学习,第一次把前沿能力拉到了四分之一价格。
更妙的是训练方法:一次强化学习同时练出所有推理档位,把推理成本直接写进奖励函数,模型自己学会少走弯路,平均步数从 127 步降到 53 步。手里有海量任务数据的团队,「买底座、自己练」这条路线第一次有了可参照的价格坐标。
顺带一提,Cognition 同日还公布了一个硬核副产品:一群 Devin 花三周、40 万美元 GPU 成本,分解了 260 位的 RSA 数,破了公开纪录,因子提交 FactorDB 任何人可验证。作者在文末坦白:全程没算法创新,纯性能工程,而且做完之后他自己对这个领域的理解反而变浅了。这句自我怀疑,比成绩更值得记。
三大工具同周发版,修的全是边界
OpenAI 给 Codex 加了 ExternalMessage 原语,外部内容可以加入正在进行的任务、能动工具,但代替不了用户审批;Claude Code 加了网关公网访问告警和计费对齐;OpenClaw 的 LTS 收官版把不可信响应体绑死在边界内,昂贵操作前先拒绝超大输入。
agent 治理的默认项,正在从能力开关变成权限分级。
一周之内三家头部工具都在做同一件事,这不是巧合,是行业把「边界与权限」当成了地基。我们自己的 agent 系统里,通知注入能不能动工具、审批权归谁,这些问题最好现在就回答。
数据说明:DeepSeek 与 Cognition 的分数均为厂商自报、未独立复现;OpenAI 数学争议双方各执一词、无既定事实认定;RSA-260 分解已经 FactorDB 独立验证。