暂无搜索历史
先给定义。ΔE%,量化模型相对 FP16 基线的能量变化:(E_量化 − E_基线) ÷ E_基线 × 100%。正数更费电,负数省电,贴近零算持平。我的 GP...
2026 年 9 月 15 日,一家叫 TypeSafe AI 的公司发布了 Jev。命名者是诚实的——Jev 取自杰文斯悖论(Jevons paradox):...
一句话版本:这是一个吵了三年的问题,答案从"省"变成了"取决于"——而"取决于什么",恰好是 2025 年最有意思的进展。本文整理 2023–2025 年约 3...
我在 WorkBuddy 专家中心创建了一个大模型能耗监控方向的专家——它基于我们团队公开的推理能耗实测数据集,回答"该不该量化"这类问题:给我 GPU 型号、...
做 LLM 部署的人大多有个默认假设:量化降低了显存占用和内存带宽压力,所以推理更省电。这个假设在论文和工程实践里被反复引用,但真正直接测过的很少——大部分"量...
做 LLM 推理优化时,多数人默认"权重低比特量化 = 省电"。我用 NVML 直接读功耗测了一轮后发现:低于某个模型规模的交叉点,NF4 反而更费电;而且这个...
之前那篇 4090 博客的结论是:决定量化省不省电的不是位宽,是 kernel。这周在 RTX 5090 上的补测把它再推半步——连 kernel 的版本号都算...
结论先行:在 RTX 4090 上用 bitsandbytes 的 LLM.int8() 做 7B 以下模型的解码推理,每一个模型尺寸都没有省电,反而多耗 50...
这张图叫 crossover curve,横轴是模型规模(1.1B–7B),纵轴是 NF4 量化相对 FP16 的每 token 能耗变化:零线以上是正数,量化...
给一个「在免费 Colab T4 上测量 LLM 推理能耗」的 notebook 做首跑验收。验收表三条硬指标全过:CUDA 可用、NVML 功率遥测正常、空闲...
"4-bit 量化能省多少电?"——这个问题可能就问错了。我们在一张 RTX 4090 上对 Llama-3.1-8B-Instruct 做了对照测量:同为"压...
量化大模型省电吗?我们在一张 RTX 4090 上做了配对实验:五个规模(0.5B–7B),NF4 与 INT8 两种量化,每次运行同时记录能耗与困惑度,FP1...
量化能省显存,但省不省电?为了回答这个问题,我们租了一张 RTX 4090(24GB),用自己写的开源测量容器跑了一下午:5 个模型(0.5B–7B)× 3 种...
做大模型部署的人几乎都会做一件事:量化。把权重从 FP16 压到 NF4 或 INT8,显存降了,推理能跑了,皆大欢喜。显存的故事确实如此——但能耗的故事不是。
做 LLM 推理部署的人都会默认一件事:模型量化 = 省显存 = 省电。但我在 5 款消费级 GPU 上、从 0.5B 到 14B 的模型里跑了 42 组实测数...
暂未填写公司和职称
暂未填写技能专长
暂未填写学校和专业
暂未填写个人网址
暂未填写所在城市