首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >在租来的 RTX 4090 上实测 LLM 量化能耗:NF4 过了 3B 才省电,INT8 全军覆没

在租来的 RTX 4090 上实测 LLM 量化能耗:NF4 过了 3B 才省电,INT8 全军覆没

原创
作者头像
四王爷
发布于 2026-09-10 20:00:18
发布于 2026-09-10 20:00:18
1590
举报

量化能省显存,但省不省电?为了回答这个问题,我们租了一张 RTX 4090(24GB),用自己写的开源测量容器跑了一下午:5 个模型(0.5B–7B)× 3 种精度,15 个配置全部由 NVML 10Hz 直接采样得到实测值。协议:batch 1、贪心解码、每次 256 个输出 token、2 次预热 + 10 轮解码,能耗按同卡同会话的 FP16 基线算相对差。

NF4:交叉点真实存在,这张卡上略高于 3B。 相对 FP16 的能耗变化:0.5B +35.6%、1.1B +16.3%、1.5B +15.1%、3B +0.8%、7B −28.5%。小模型上反量化开销超过带宽节省,量化反而更费电;3B 附近盈亏平衡,7B 明确节能。机制是纯粹的带宽账:权重变小省下的访存,要足够抵消每次解码额外的反量化计算。

INT8:无一尺寸节能,输在时间而非功率。 bitsandbytes 的 LLM.int8() 在全部五个尺寸上是 +49.5% 到 +241.9% 的能耗惩罚。有意思的是机制:INT8 瞬时功率其实更低(73–95W,FP16 为 88–269W),但解码吞吐从 39–62 tok/s 崩到 9–19 tok/s。能耗 = 功率 × 时间——跑得慢三到五倍,功率省了也白搭。

这些数字的边界: 每个配置只跑了一次(n=1);8 月在另一张同型卡上复测其中一个格子,+137.9% 对 7 月的 +146.1%,相差 8.2 个百分点——跨会话噪声就是这么真实,所以别拿绝对焦耳跨天比较;NVML 只测 GPU 封装功率,不含整机;结论只属于"这个后端 + 这张卡",GPTQ、AWQ、TensorRT-LLM 是另一些没做过的测量。

一句话总结:消费级卡上,3B 以下的小模型别碰权重量化;7B 以上 NF4 可以放心用;INT8 在 batch 1 单流解码下别指望省电。量化前先测,别假设。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档