首页
学习
活动
专区
圈层
工具
发布

换了套基于 vLLM 的 Qwen 3.8 Flash Next 方案,跑分从 91 涨到 98 了

之前我是用 RadixArk 的 NVFP4 权重,配上打过补丁的优化版 SGLANG 来跑的。

现在换成了 wtdcode 的 AWQ W4A16 权重,再加上 primitive-ai 的 INT4 PLE 量化,推理引擎也换成了打过补丁的 vLLM。这么搞主要是想让权重和 n-gram PLE 都以 4bit 量化加载,不管在我 sm89 还是 sm120 的设备上都能跑。

速度确实慢了不少,毕竟我用的是低并发场景。但效果是真的好太多了,这个差距让我挺意外的。

现在中等和超高推理强度下都跑到了 98 分,之前只有 91。感觉比起其他模型是个很大的提升,分数最高,效率也最高。

接下来我想再深挖一下,看看差异到底是来自引擎和它的补丁,还是量化本身的问题,顺便把 vLLM 的方案针对我的环境再优化优化。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OdCujr0_fwhM9CF64Dd3vCaQ0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券