AMD公布了Kimi K3的部署方案。
K3虽然每次只激活约104B参数,但完整模型权重仍然超过 1.56TB。AMD验证的最低配置是:
8张MI355X,每张288GB显存,总显存2.3TB。
这套配置能够把模型完整加载起来,也能够进行正常推理。但它更接近“能用”的最低门槛,而不是成熟的商业服务。
按目前的硬件价格估算,一套8卡服务器可能需要 170万—240万元。而且8张卡仅GPU功耗就超过11kW,还要考虑服务器、散热、机房和运维。
真正做商用API,要求完全不同:
多用户同时访问
百万上下文并发
稳定的首字延迟
备用机器和故障切换
服务器长期保持高利用率
Kimi官方甚至建议生产环境采用 64张以上加速卡。按照同类硬件估算,商业级集群的硬件投入可能达到 1400万—1900万元。
所以K3的部署成本可以分成两档:
约200万元:模型能跑起来。
约1500万元:才开始接近商用级别。
开源降低的是模型获取门槛,没有降低显存、互联和机房的门槛。