之前我是用 RadixArk 的 NVFP4 权重,配上打过补丁的优化版 SGLANG 来跑的。
现在换成了 wtdcode 的 AWQ W4A16 权重,再加上 primitive-ai 的 INT4 PLE 量化,推理引擎也换成了打过补丁的 vLLM。这么搞主要是想让权重和 n-gram PLE 都以 4bit 量化加载,不管在我 sm89 还是 sm120 的设备上都能跑。
速度确实慢了不少,毕竟我用的是低并发场景。但效果是真的好太多了,这个差距让我挺意外的。
现在中等和超高推理强度下都跑到了 98 分,之前只有 91。感觉比起其他模型是个很大的提升,分数最高,效率也最高。
接下来我想再深挖一下,看看差异到底是来自引擎和它的补丁,还是量化本身的问题,顺便把 vLLM 的方案针对我的环境再优化优化。