过去一周,算力侧的消息密度比模型侧还高。华为在全联接大会上把超节点的规模又推了一个量级,智谱在同一场会上拿出了"用国产卡造模型"的成果,DeepSeek 被曝出要部署十六万颗国产加速器,英伟达那边的回应也很直接。把这些事串起来看,会发现竞争的坐标已经换了。 一、三个数字:4096、Hi-ONE、提前三个季度 昇腾 960 超节点正式发布,最容易被记住的是这三个点: · 单节点算力卡从上一代的 1024 卡升级到 4096 卡; · 首次采用 NPO(近封装光学)关键技术,落地为 Hi-ONE 光引擎,是首款量产的光引擎; · 官方称可匹配 10 万亿参数模型的训练推理需求。 时间线上还有一个信号:960DT 计划 2027 年一季度就绪,比原计划提前三个季度。路线图往前挪,说明供应链和工程实现上有了确定性把握,这比单纯的参数升级更能说明问题。 二、Peerium:让百万级处理器像一台计算机 与超节点同步发布的还有 Peerium 计算架构,官方给出的目标是让百万级处理器协同工作,如同一台计算机。 这句话听起来像宣传语,但它指向的是一个非常具体的工程问题:当单个节点的卡数从千级升到四千级,系统瓶颈早就不是单卡的算力峰值,而是互联带宽、拓扑调度和故障收敛速度。4096 卡放进一个节点,意味着训练任务里任何一次通信抖动都会被放大;此时"像一台计算机"不是修辞,而是对软件栈的硬要求。 换句话说,国产算力这一轮的创新重心,正从"芯片做多强"转向"系统做多稳"。 三、模型厂商开始反过来用国产算力造模型 同一场大会上,智谱发布了首个 RSI(自训练体系)成果:实现了在 10 万张国产卡集群上用 GLM 模型再造 GLM 模型,覆盖大规模训练与推理、国产芯片适配和推理优化。 这件事的意义不在"跑通了",而在闭环。此前国产卡更多扮演推理替代的角色——模型在外面训好,拿进来跑。而"用 GLM 造 GLM"意味着训练侧的核心环节也在国产集群上完成,全栈自训练能力落地。 对做应用的团队来说,这一条会慢慢变成选型时的一个隐性变量:如果上游的训练和推理都在同一套国产栈上迭代,模型与硬件的适配优化就有机会做得更深,成本曲线也可能不一样。 四、推理侧的大单,比训练侧更值得看 另一条消息是 DeepSeek 计划在内蒙古乌兰察布建设的吉瓦级数据中心部署至少 16 万颗华为昇腾 950DT AI 加速芯片,且全部用于模型推理。如果落地,将是已知规模最大的国产 AI 芯片集群之一。 "全部用于推理"这五个字很关键。训练集群的规模是新闻,推理集群的规模才是生意——它直接对应真实调用量和单位成本。同一批消息里还提到马来西亚在考虑采用华为方案建设主权 AI,说明这套方案正在往海外市场走。 五、英伟达怎么回应 黄仁勋在苏格兰 AI 峰会上给出了自己的判断:预计 2027 年芯片销量达到 2026 年的约两倍,并强调当前瓶颈在芯片产能而不在需求。消息公布后,美股 AI 硬件板块全线拉升。 他把"产能"放在"需求"前面,等于承认需求端已经没有悬念——这从侧面印证了整条算力链条仍在扩张期,国产方案的窗口期还没有关上。 六、云端之外:座舱是离用户最近的那一环 算力之外,产品端的进展同样值得记一笔。豆包与火山引擎联合打造的 AI 原生车载助手发布,已与上汽集团达成合作:首款搭载车型荣威家越 07 率先搭载,9 月 21 日开启预售。 官方描述里有一个细节:座舱助手参与"感知—决策—执行"的完整链路,可感知数百种车辆信号,联动车控、导航与辅助驾驶。这是把大模型从对话框搬进物理设备的一步,也是"端侧 Agent"最现实的一个落点。 七、这些数字该怎么读 需要保持一点冷静:上面所有数字都是发布口径,不是交付口径。4096 卡是单节点设计规模,10 万亿参数是"可匹配"的场景描述,16 万颗芯片目前仍是"计划部署"。它们成立的前提,是集群在一段时间里稳定跑起来、跑出可复现的利用率。 所以对工程团队来说,真正该跟踪的指标不是节点卡数,而是三件事: 1、光互联与集群软件成熟度——4096 卡节点里,互联是决定有效算力的那一环; 2、推理侧的稳定单位成本——16 万颗卡的价值最终要落在每次调用多少钱上; 3、适配层的维护成本——国产栈的迁移工作量,是不是比省下来的钱更少。 节点规模翻四倍是新闻,系统稳定性提升才是能进选型文档的东西。这一轮国产算力真正的看点,也正在这里。 参考链接 · AI 热点日报(2026-09-18):华为昇腾960超节点发布,OpenAI 首次公开模型失准报告:https://juejin.cn/post/7686588753230364708
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。