【GLM-5.3真实生产流量落地,国产GPU跨越规模商业化拐点】
摩尔线程与趋境科技基于MTT S5000及MUSA软件平台落地国产P/D异构推理方案,目前已投入生产并承接智谱GLM-5.3真实业务Token流量。生产运行中实现平均超过50 TPS生成速度、超90% KV Cache命中率及99.9%稳定性。区别于此前国产GPU更多停留在参数发布、模型适配及Benchmark测试,本次S5000已经进入真实采购、集群部署和持续Token生产,我们认为标志着国产GPU正从“模型适配”真正走向规模商业化。
【同成本用户承载量提升3倍,Token性价比优势得到真实业务验证】
联合方案采用P/D异构架构,由MTT S5000承担Prefill阶段输入计算及KV Cache生成,与Decode侧高带宽GPU协同,通过针对不同负载进行资源优化提升整体Token生产效率。实际生产环境中,方案实现同等成本下支持用户量扩大3倍、性价比提升1倍;4—5台S5000组成Prefill资源池后,输入Token处理性价比相比国际先进算力方案提升一倍,商业价值进一步得到验证。
【持续联合AI Infra厂商,率先跑通“国产模型×国产芯片”商业闭环】
此次与趋境科技合作并非摩尔线程首次联合AI Infra厂商推进国产GPU推理落地。8月摩尔线程已与硅基流动联合发布P/D分离异构算力混部白皮书,此次进一步在GLM-5.3真实生产流量中实现商业化落地,体现摩尔线程持续通过与头部AI Infra厂商协同,强化推理软件栈、资源调度及系统级优化能力。摩尔线程已率先跑通头部国产模型真实流量的商业闭环,而不仅停留于纸面参数和适配验证,有望率先受益于国产模型需求持续增长及国产算力渗透率提升的产业趋势。