首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >ΔE:能耗数字为什么看差值,不看绝对值

ΔE:能耗数字为什么看差值,不看绝对值

原创
作者头像
四王爷
发布于 2026-10-02 15:06:51
发布于 2026-10-02 15:06:51
210
举报

先给定义。ΔE%,量化模型相对 FP16 基线的能量变化:(E_量化 − E_基线) ÷ E_基线 × 100%。正数更费电,负数省电,贴近零算持平。我的 GPU 推理能耗数据集,覆盖矩阵每一格填的主值就是它。

为什么不直接报"每 token 多少焦耳"?因为绝对值是整个测量体系里最不稳的量。同一台机器、连续两天,绝对能耗漂低了 12–17%,FP16、INT8 一起漂;归一化之后的 ΔE%,只动了几个点。漂移是会话级的,基线和被测对象在同一次会话里一起漂,一相除就约掉了。绝对值会漂、增量稳——这是 ΔE 存在的全部理由。

ΔE 给出的第一个反直觉结论:量化不一定省电。同一张 RTX 4090 上,NF4 的 ΔE 是 +36%(0.5B)→ +0.8%(3B)→ −28%(7B):3B 附近是盈亏平衡点,比它小的模型,量化反而更费电;INT8 在 1.1B 小模型上可以贵出 +146%,换个会话再测是 +307%。所以"量化省电"这句话,不带模型尺寸没有意义。

ΔE 自己也有使用纪律,三条:一、同卡同栈才可比——换一张卡、换一个 bitsandbytes 版本,就是新的组合,不混池;二、不跨天比绝对值,要比就比同会话的 ΔE;三、引用时带上测量窗口和输出长度——同一份数据换个窗口重新积分,64-token 的数字能挪 12.5 个百分点。

它还会自我修正。3B 那个 +0.8% 的锚点,后来在两张物理卡上复测,均值 +1.6%;历史上一度读出的 −15.1% 没有复现,作为分歧观测保留在案。数字被更新不是丢人,是测量在干活。

窗口之外无事实。这句话对能耗成立,对你见过的每一个"×倍提升",一样成立。

(口径与数据:作者维护的 GPU 推理能耗公开数据集,Zenodo 10.5281/zenodo.19647289)

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档