
我是大树,一个差点开始放弃折腾的AGI学习与实践者。 最近在探索和从事的事儿:
你有没有注意过一个细节?
你用 ChatGPT、Claude、Gemini 的时候,它们回答问题的方式是一个字一个字往外蹦的。像打字机一样,一个 Token 接一个 Token,从左到右,顺序生成。
这个模式从 GPT-2 时代一直沿用到现在,快 7 年了。
大家早就习惯了。甚至觉得"AI 就该是这样的"。
但就在昨天,Google DeepMind 发布了一个实验性模型,直接打破了这个范式。
它一次生成 256 个 Token。
不是 256 个字,是 256 个 Token——大致相当于 150-200 个中文字,或者 180-200 个英文单词。
一次。

这个模型叫 DiffusionGemma,26B MoE 架构,量化后 18GB 显存就能跑。
它的核心卖点是:速度提升 4 倍。
H100 上 1000+ tokens/s,RTX 5090 上 700+ tokens/s。
但——整体输出质量低于标准 Gemma 4。
“这不是"GPT 要被颠覆了"的故事,而是"AI 开始分化了"的故事。”
有些任务需要质量,有些任务需要速度。DiffusionGemma 赌的是后者。
可能会有朋友要问了:一次生成 256 个 Token,这怎么做到的?
打个比方你就懂了。

传统自回归模型(GPT、Claude)的工作方式像打字机——一个字一个字敲,敲完一个字才知道下一个字该是什么。优点是上下文连贯,缺点是慢。因为 GPU 大部分时间在等,等"下一个字"算出来。
DiffusionGemma 的工作方式像印刷机——直接给一整张白纸(256 个随机占位符),然后反复涂改、修正,最终印出完整的一段话。优点是快,因为 GPU 一直在干活,没有等待。缺点是……你懂的,印刷出来的东西可能不如打字机敲出来的精细。
具体原理是这样的:
这就是"文本扩散"——类似 AI 画图从噪声中逐步生成清晰图像的过程,只不过这次是文本。 stableDiffusion 大家都晓得吧,一样的逻辑。
写到这儿,你可能会想:这有什么用?
老实说,DiffusionGemma 的定位很明确——速度优先,质量其次。

它适合这些场景:
它不适合这些场景:
可能会有朋友要问了:听起来不错,但我的电脑跑得动吗?
答案是:如果你有一张 RTX 4090 或 5090,跑得动。
DiffusionGemma 的参数量是 26B,但它采用 MoE(Mixture of Experts,混合专家)架构——总共 384 个"专家",每次推理只激活 3.8 个。
打个比方:医院有 384 个科室,但你每次看病只需要 3-4 个科室会诊。整体规模很大,但实际占用的资源很小。
量化之后,整个模型只需要 18GB 显存。RTX 4090 有 24GB,RTX 5090 有 32GB,都能装下。
而且它开源了,Apache 2.0 许可证,你可以随便用。
说实话,看到这个消息的时候,我第一反应是:这不就是个"快但糙"的模型吗?有什么好兴奋的?
但仔细想了想,事情没那么简单。
这背后有一个更大的趋势:AI 正在从"单一最优解"走向"场景化最优解"。
过去我们选模型,逻辑是"哪个最强用哪个"——GPT-4 强就用 GPT-4,Claude 强就用 Claude。但现在,模型开始分化:
这意味着什么?
意味着你以后选模型,不再是"哪个最强",而是"这个任务需要什么"。
写重要文档?用最强的。 做实时交互?用最快的。 批量处理?用最便宜的。
“未来的 AI 使用者,不是比谁的模型最强,而是比谁更会"对症下药"。”
如果你感兴趣,可以试试:
1. 下载体验
模型权重已经发布在 Hugging Face,Apache 2.0 许可证,可以直接下载:
2. 用工具部署
支持主流部署工具:
3. 量化部署
如果你的显卡显存不够,可以用量化版本。18GB 显存就能跑。
写完这篇文章,我又想了想。
DiffusionGemma 本身可能只是一个实验性项目,Google 自己也说"整体输出质量低于标准 Gemma 4"。它大概率不会成为主流。
但它代表的方向很值得思考:AI 不再是"一个模型打天下"的时代了。
未来你会看到越来越多的"专用模型"——有的负责质量,有的负责速度,有的负责成本,有的负责隐私。它们不是互相替代的关系,而是互补的关系。
就像你不会用锤子拧螺丝,也不会用螺丝刀钉钉子。工具的价值在于匹配场景。
“问题不再是"AI 能不能做到",而是"我该用哪个 AI 来做"。”
这可能才是 DiffusionGemma 给我们最大的启发。
如果这篇文章对你有一点启发:
你的每次互动,都是我继续写实战内容的动力。