首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >白宫急了,高管炮轰Kimi K3蒸馏偷技术

白宫急了,高管炮轰Kimi K3蒸馏偷技术

作者头像
陈序员大康
发布2026-07-24 16:05:09
发布2026-07-24 16:05:09
4310
举报

7月22日,白宫科技政策主管Michael Kratsios在X上发了一条帖子。措辞罕见地强硬。

「我们有情报显示,Moonshot AI蒸馏了Anthropic的Fable来开发K3模型。大规模、隐蔽的工业蒸馏,旨在窃取美国专有技术。这不是创新,这是偷。」

紧跟着,财政部长Bessent加了一句,「开源不等于对美国知识产权的开放季节。」他正在考虑把Moonshot列入贸易黑名单,实施制裁。

我看到这条消息的时候,第一反应是,完了,我之前写的K3那两篇文章要被打脸了。前一篇写的是「K3靠算法创新追上美国」,后一篇写的是「三大件全换」。如果白宫说的是真的,K3不是自己创新的,是从Anthropic偷来的,那我写的东西不就是在给一个小偷唱赞歌吗?

我花了一整天翻资料,想搞清楚一个问题。K3到底是自己做的,还是偷的?

01 / 先搞懂「蒸馏」是什么

这个词听起来像炼油,但用在AI里,意思其实很简单。你有一个很厉害的AI模型(比如Anthropic的Claude Fable),它什么都会。你还有一个小一点的模型,什么都不会。你让小模型去跟大模型对话,把大模型的回答全记下来,然后用这些回答来训练小模型。

相当于什么?相当于一个差生上课录音,把学霸的笔记全抄了,回家反复背。考试的时候,他看起来跟学霸一样厉害。但他真的理解了吗?不一定。他只是学会了模仿学霸的答题方式。

AI蒸馏概念
AI蒸馏概念

AI蒸馏:小模型从大模型的回答中学习

在AI行业,蒸馏不是什么见不得人的事。OpenAI蒸馏过,Google蒸馏过,Meta蒸馏过。大家多多少少都干过。问题是,有一个前提,你得在对方允许的范围内做。Anthropic的用户协议里写得清清楚楚,不许用Claude的输出来训练别的模型,也不许在中国使用。

但Anthropic今年2月发了一篇博客,说自己抓到了三家中国AI公司在偷。DeepSeek、Moonshot、MiniMax,这三家用了大约2.4万个假账号,跟Claude对话了1600万次,把回答全存下来拿去训练自己的模型。

2.4万假账号 · 1600万次对话

Anthropic称DeepSeek/Moonshot/MiniMax用「九头蛇集群」大规模蒸馏Claude

Anthropic管这个叫「九头蛇集群」。什么意思?你封一个账号,它马上冒出一个新的。一个代理网络同时管着2万多个假账号,把蒸馏的流量混在正常用户的请求里,让你根本分不清哪个是真人哪个是机器。

这事儿当时闹了一波,后来淡了。但K3一发布,从第18名跳到第1名,白宫坐不住了。

02 / 但时间线对不上

Kratsios的指控里还有一条更狠的。他说Moonshot在泰国搞到了Nvidia的GB300服务器,用来训练AI模型。GB300是Nvidia最新一代的黑威尔架构芯片,美国明确禁止卖给中国公司。如果这条属实,那就不是蒸馏的问题了,是违反出口管制的问题。

但事情到这里,我开始觉得不对劲。

⏰ 时间线对不上

Anthropic的Fable模型7月1日才公开发布。K3是7月16日发布的。中间只隔了15天。你要说Moonshot在15天里用Fable蒸馏出了一个能登顶全球第一的模型,技术上几乎不可能。

蒸馏需要大量的高质量对话数据,需要训练时间,需要反复调优。15天,连数据清洗都不一定够。

MIT和Google DeepMind的研究员Michiel Bakker说了,「这些结果不可能仅靠蒸馏来解释。」他称K3为「好得疯狂」。

AI研究者Nathan Lambert的解释更技术一些。他说,蒸馏确实在用,但主要是在SFT阶段(监督微调),相当于让模型学一个基本的答题模板。这只是一个起点,后面还有大量的架构设计、训练策略、对齐调优要做。蒸馏给你一张参考卷,但考试还是得你自己考。

这跟我们之前写的K3的「三大件全换」是对得上的。MuonClip优化器、KDA注意力机制、AttnRes残差连接,这些是架构层面的创新,不是靠抄别人答案能抄来的。你抄得了学霸的解题步骤,但你抄不了学霸重新发明一套学习方法。

03 / 我的判断

Moonshot大概率确实用了蒸馏。2.4万个假账号的事Anthropic已经实锤了,Moonshot也没否认过。在SFT阶段用Fable的输出来「打底」,这事估计干了。

但K3的核心竞争力不是偷来的。它的算法创新是真的,架构设计是真的,对H800算力的极致优化也是真的。蒸馏只是帮它在某些领域(比如前端代码)更快地接近了前沿水平,但追上和超越的部分,靠的是自己的硬功夫。

我跟朋友聊这件事,他问我,那白宫为什么这么大反应?我说,因为K3真的把美国人打疼了。

你想想看,Anthropic花了多少亿美金训练Fable,用了最贵的H100集群。Moonshot用着被制裁的H800,加上一些说不清来源的GB300,搞出了一个能跟Fable打平甚至在某些领域超过的模型。如果这个模型还有「偷」的成分,那美国的算力封锁还有什么意义?美国的知识产权保护还有什么用?

这不是一个技术问题,是一个面子问题。更是一个战略问题。

AI技术vs政治博弈
AI技术vs政治博弈

AI技术在左,政治博弈在右,走钢丝的是K3

白宫这次的指控,与其说是在说「你偷了」,不如说是在给全世界打预防针。开源不等于免费午餐,中国的开源模型可能带着原罪。这个信号比指控本身重要得多。

04 / 说句心里话

但话说回来,我作为一个写AI的人,看到这件事心情挺复杂的。

一方面,蒸馏这件事确实越界了。用假账号、绕过地域限制、大规模窃取别人的模型输出,这不是正常的学术借鉴,这是有组织的数据窃取。该罚就罚,规矩就是规矩。

另一方面,蒸馏这件事真只有中国公司在干吗?

今年5月28日,Anthropic发布了Claude Opus 4.8。发布几小时后,有人用中文问它「你是什么模型」,Claude的回答让人瞠目结舌。它说自己是通义千问。就是阿里的Qwen。这件事在X、Hacker News、Reddit上炸了锅,有人说Anthropic蒸馏了Qwen。Anthropic没官方回应,专家们的解释是「训练数据污染」,Qwen的输出在网上太多了,Claude训练的时候沾上了。

🤔 你信哪个解释都行

当美国自己的公司都说不清自己有没有蒸馏别人的模型,转头就指着中国的鼻子骂「你偷了」,你不觉得有点双标吗?

说到底,蒸馏在AI行业就是个公开的秘密。大家都在用别人的模型输出做训练数据,区别只在于你用的是官方API还是偷偷搞的假账号。用官方API的叫「参考学习」,用假账号的叫「工业窃取」。同样的行为,换个入口,性质就不一样了。

这才是美国真正在干的事。不是在维护什么知识产权的纯洁性,是在找一个合法的接口来打压竞争对手。你不是因为偷才被罚,是因为你赢了才被查。

另一方面,如果美国把所有中国AI公司的成就都归结为「偷」,那就是在自我麻痹。DeepSeek也好,Kimi也好,它们在算法层面的创新是实打实的。你可以说它们起步的时候抄了作业,但你不能说它们现在还在抄。一个只会抄作业的学生,不可能发明新的学习方法。

最让我担心的是,这件事最后可能不会以技术辩论收场。它可能变成一场政治审判。制裁、黑名单、出口管制加码。技术归技术,政治归政治,但在这个领域,两者已经分不开了。

7月27日 · K3计划开源全部权重

如果制裁在开源前落地,K3可能变成一个「非法模型」

7月27日,K3计划开源全部权重。如果你是Moonshot,你现在最怕的不是技术上被质疑,而是白宫在你开源之前把你拉进黑名单。一旦制裁落地,K3可能变成一个「非法模型」,全球的开发者都要掂量掂量敢不敢用。

这才是这场风波真正值得关注的走向。

觉得不错,随手点个在看转发三连吧

谢谢你看我的文章,我们,下次再见 ✨

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-23,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档