IT时代网8月27日消息,智谱在8月26日晚宣布上线并开源GLM-5.3-Flash(320B-A18B),同时确认它就是过去一周在海外开发者社区刷屏的匿名模型Ox-Alpha,中文社区称之为"牛来"。
该模型是GLM-5系列首个原生多模态模型,总参数320B、激活参数仅18B,以MIT协议开放权重,上线即登陆Hugging Face。8月20日,Ox-Alpha以"隐身模型"身份悄然上线OpenRouter,首日调用量登顶并创下历史纪录,终结了DeepSeek在OpenCode长达56天的霸榜,单日处理Token达62T。
能力端直接对标国际旗舰。GLM-5.3-Flash在Artificial Analysis Intelligence Index中拿到57分,与Claude Opus 4.8持平,高于GLM-5.2的53分与DeepSeek V4 Pro的53分。价格端则大幅下探,定价为GLM-5.3的十分之一,限时折扣期低至二十分之一,仅为Opus 4.8的四十分之一,每百万Token输入0.8元、输出2.8元。
更受关注的是算力底座。智谱披露,"牛来"测试期全部线上流量及GLM-5.3-Flash发布后的线上服务,均由10万张国产芯片承载,这是国产算力芯片首次大规模直接服务全球真实负载。技术架构上,该模型基于30T Token多模态语料预训练,首次引入稀疏注意力与线性注意力混合架构,并采用流形约束超连接,使注意力计算量较上一代下降约3倍、KV缓存缩小4.4倍,支撑1M上下文窗口的经济化部署。
注:本文中包含AI辅助创作的内容。