首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >一文讲透大模型推理的成本账

一文讲透大模型推理的成本账

作者头像
瑭宋元
发布于 2026-09-17 21:44:44
发布于 2026-09-17 21:44:44
1550
举报

从 GPU 时租到 token 定价,钱到底烧在哪;以及当 token 越来越便宜,为什么你的账单反而越来越贵。

有个做 AI 应用的团队跟我吐槽过一件事:同样的模型、同样的业务量,隔壁团队每月推理账单不到两万,他们快八万。

第一反应是"他们是不是用了什么黑科技"。查了一圈发现,黑科技没有,差别全在一些很土的地方:人家开了前缀缓存,请求路由做了分流,批处理策略调过,还把一批离线任务挪到了夜间批处理通道。

这就是推理这件事最反直觉的地方——它很少是"技术不够好"的问题,大多数时候是"账没算清"的问题。

这篇文章不聊怎么把模型切开(那是架构话题),聊钱:一次推理的钱花在哪,哪些杠杆最省钱,以及成本降到今天这个程度之后,行业会往哪儿走。

先记住一个公式:成本是三个数相乘

推理的单位成本,基本可以拆成三个乘数:

硬件自身价格(你租的是什么卡、多少钱一小时)

服务栈效率(调度、批处理、显存管理做得怎么样)

精度与批处理策略(用 FP16 还是 FP8、INT4,batch 开多大、延迟要求多严)

因为是相乘,所以任何一项差一点,整体会差出一个数量级。业内公开测算给过一个很直观的对照:同样的工作负载,优化到位和没优化,每百万 token 的成本可以从 5 美元压到 0.2 美元——25 倍差距。而这三件事里,只有第一件需要花钱,另外两件主要花的是工程时间。

顺便说个背景数字。Google 在 I/O 2026 上披露,其 token 处理量两年内从每月 9.7 万亿涨到超过 3.2 千万亿,约 330 倍;同期 GPT-4 级别质量的输出成本从每百万 token 约 30 美元降到 0.5 美元以下。量涨了几百倍,单价跌了几十倍——这两件事是同一个过程的两面。

硬件账:卡不是越贵越好,是越"解渴"越好

先看价格锚点。2026 年主流卡的按需时租大致在这个区间(不同云商、不同区域差异不小,仅作参照):

卡型

显存 / 带宽

按需时租(参考)

适合什么

H100 SXM

80GB / 3.35TB/s

约 2–3.5 美元

7B–70B 常规推理

H200 SXM

141GB / 4.8TB/s

约 2.6–4.5 美元

长上下文、大 batch、访存受限

B200

180–192GB / 8TB/s

约 4–6.2 美元

超大模型、高吞吐集群

GB200 NVL72

13.5TB 池化 / 130TB/s

约 8 美元

前沿规模、超节点域内并行

数据来源:多家 GPU 云公开报价与行业整理(2026 年中),不同云商、区域、承诺时长差异较大,仅作参照,实际以官方报价为准。

但真正的决策不在选卡,在于先搞清楚你被什么卡住了。推理的瓶颈基本就两类:算力受限(prefill、大矩阵乘)和访存受限(decode、读权重和 KV)。如果你是被显存或带宽卡住,那么 H200 比 H100 贵的那 0.6 美元/小时,很可能换来的是"一张卡干了两张卡的活"——这时候 H200 反而更便宜。反之,如果模型在 H100 上装得下、带宽也没吃满,那你多付的 0.6 美元买的只是闲置的余量。

比选卡更伤钱的,是利用率。一张卡你租了 24 小时,但实际只跑了 30% 的时间,那么它真正干活的那一小时,成本是标价的三倍多。这个"闲置税"在业务量不稳定的团队里极其普遍——白天排队、半夜空转,账单照收。

所以计费模式要和业务形态匹配:稳态的 7×24 生产流量适合预留(有折扣但要承担锁死风险);波动大、不可预测的流量更适合按请求计费或者 Serverless,宁可单价高一点,也别为空转买单。很多团队多花钱,是因为用错了计费模式——拿按需 GPU 跑稳态业务,或者在利用率还没摸清之前就签了预留。

显存账:KV cache 才是真正的吞金兽

很多人算显存只算模型权重,这是最大的一笔漏账。70B 模型 FP16 权重约 140GB,看起来吓人,但它是固定的——模型一加载就那么多,不随请求增长。真正随并发线性膨胀的是 KV cache。

有个业内常用的估算式子:每个请求的 KV 占用约等于 2 × 层数 × KV 头数 × head 维度 × 序列长度 × 每个元素的字节数。拿 70B 级别的模型举例,4K 上下文、FP16 精度下,单个并发请求大约吃掉 0.4GB;看起来不多,但 200 个并发就是 80GB——已经超过一张 H100 的全部显存。

到了长上下文(几十 K 甚至上百 K),KV cache 的开销在很多场景里会超过模型权重本身,成为新的瓶颈层。这也是为什么"长上下文贵"不只是营销话术——它确实在吃你的显存,进而吃掉你能开的并发数,最终吃掉单位成本。

应对的办法是一套组合拳,按性价比排序大概是:先把显存管理做对,再谈量化,最后才是加卡。

显存管理排在最先。按请求的最大长度预分配连续显存,碎片和浪费都非常严重;改成按需分页、用多少占多少之后,同样的卡能塞下更多并发。行业公开经验是,把调度粒度做细、配合分页式管理,显存利用率从两成提到七成以上是常态。这一步不换硬件、不改模型,纯粹是软件功夫,但往往就能把吞吐翻几倍。

量化排第二。FP8 在多数场景里能把显存和带宽压力砍掉约一半,质量损失可控;再往下到 INT4,省得更多,但对任务和模型的挑剔程度明显上升,需要按业务指标实测量。我的建议是:先试 FP8,拿你自己的业务数据验收,不要迷信论文里的通用结论。

分级存储是长上下文场景的补充手段——热数据留在显存,温的放主机内存,冷的下沉到 SSD。它不是免费的,跨层搬运本身有开销,但如果你的负载有大量"冷但可能被唤醒"的上下文(比如隔天继续的会话),这层设计能省下真金白银。

吞吐账:延迟是你花钱买回来的

吞吐和延迟是一对冤家。batch 开大,GPU 吃饱,单位成本下降;但请求要排队,延迟上升。所以你的延迟 SLO 本质上是一条价格曲线——要求越严,单价越高。

主流云商给批处理通道的折扣普遍在五折左右,逻辑就在这里:你把延迟的容忍度卖给了平台,平台用这段时间去填 batch,双方分这笔省下来的钱。很多业务的真实需求其实没那么急——日报生成、离线标注、批量改写、夜间数据清洗,全都走批处理,账单立刻减半,而且一行模型代码都不用改。

我的判断是:大部分团队的第一笔省钱,都应该来自"把不需要实时的任务挑出去",而不是来自换更快的卡。这件事的投入产出比高得离谱,但因为它不性感,经常被人跳过。

缓存账:最被低估的降本杠杆

如果只能选一个杠杆,我选缓存。

前缀缓存的逻辑很简单:多个请求如果共享同一段开头(同一份系统提示词、同一份文档、同一段对话历史),这段对应的中间结果只算一次,后面的请求直接复用,命中部分的计费通常只有原价的一成左右。行业里已经出现更极端的定价——部分模型的缓存命中价低到近乎免费的水平。

为什么我说它是第一杠杆?因为Agent 把这件事的重要性放大了一个数量级。一次 Agent 任务往往是多轮调用:同一份系统提示词、同一批工具定义、同一段上下文,被反复送进模型几十上百次。公开数据里,Agent 驱动的某些应用 token 消耗能比单次对话高出一个数量级。在这种负载下,缓存命中率从 0 提到 80%,成本差异就是几倍——比换任何硬件都猛。

落到工程上,要提高命中率无非三件事:把稳定不变的内容放在提示词最前面(顺序变了就不命中);控制动态内容的插入位置;让同类请求尽量路由到同一批实例(命中发生在实例本地)。第三点常被忽略——你的负载均衡策略如果纯粹按轮询分发,实际上是在主动降低缓存命中率。

顺带提一句定价趋势:已经有厂商开始按峰谷时段计价,忙时贵、闲时便宜。这提示我们,未来的成本优化会越来越像"用电管理"——什么时候跑,和怎么跑一样重要。

模型账:不是每个请求都需要最强的模型

2026 年的价格分布宽得离谱。按第三方价格追踪的统计,最贵模型和最便宜模型之间的单位 token 价差可以达到数千倍;开源权重模型的中位混合价格,比闭源模型低八成左右。

这意味着"选模型"本身就是最大的成本杠杆,比任何系统优化都大。而绝大多数线上流量,其实不需要最强的那个模型。

常见的两种做法。路由:用一个便宜的小模型或规则先判断请求难度,简单的直接小模型处理,难的升级到大模型。级联:先让小模型出结果,再用大模型做校验或兜底,只有小模型不确定时才动用贵的那个。两者都能把大部分流量挡在贵模型之外,而对最终效果的影响可以控制在可接受范围。

还有个容易踩的坑:输出 token 通常比输入贵 3 到 6 倍。同样的字数,模型吐出来的比喂进去的贵得多。所以那些"让模型写长文"的应用,账单结构和对谈型应用完全不同——如果输入 200 token、输出 2000 token,那么输出侧会主导整张账单。做产品设计时想清楚这点,比事后优化有用得多。

另外,别忽视峰谷和批处理这类"商务杠杆"。同样的模型、同样的量,换个通道或者换个时段,账单能差一半。这类折扣不写代码就能拿到,却经常因为没人专门负责而被漏掉。

怎么省:一份按优先级排的决策表

优先级

动作

典型收益

代价 / 注意

1

按难度分流模型,简单流量走小模型

单位成本常可降一个量级

需要建立效果验收机制

2

开前缀缓存,并优化路由提高命中率

Agent / 多轮场景可降数倍

提示词结构要稳定,顺序敏感

3

非实时任务走批处理 / 闲时通道

主流平台约五折

牺牲时效性,需业务配合

4

精细调度 + 分页式显存管理

吞吐翻几倍是常态

纯软件工作,需工程投入

5

量化(FP8 起步,INT4 实测后决定)

显存与带宽压力降约一半

质量需按业务指标验收

6

按瓶颈重新选卡 / 调整计费模式

消除闲置税

预留有锁死风险,先摸清负载

排序的逻辑是:越靠前的杠杆,投入越小、收益越大、风险越低。很多团队一上来就想换卡、上更快的硬件,其实前三项一分钱硬件都不用加。

未来预判:三个方向,以及它们会怎么改写行业

先给结论,再解释。

判断一:单价还会继续跌,但你的总账单大概率继续涨。

这不是悖论,是标准的杰文斯效应。2026 年以来 token 价格指数屡创新低,前沿能力的价格已经跌到 2023 年初的很小一部分;公开统计显示,某些基准上同等能力的成本相差可达数百倍。与此同时,用量涨得更凶——Google 两年 330 倍的 token 处理量增长就是最直白的证据。业内甚至还有"成本需要再降九成才能解锁真正大规模企业采用"的判断,意思是:现在还不够便宜。

对做预算的人来说,这句话要翻译成行动指南:不要按"单价下降"去做成本收缩的假设,要按"用量增长更快"去做容量规划。

判断二:Agent 成为主要负载,缓存命中率会变成核心竞争力。

Agent 的负载形态和聊天完全不同:一次任务多轮调用、大比例重复前缀、中间结果需要反复引用。这直接把"状态管理"推到了推理系统的中心——谁能把重复计算省掉,谁的成本结构就比别人好一个量级。我们已经能看到这个方向的产物:以 KV 为中心的架构、跨节点共享的缓存池、按缓存命中来做的请求路由。

我的判断是,未来两年推理引擎的竞争焦点,会从"单机吞吐"转向"命中率与复用率"。衡量一个推理平台好不好,指标会变成"你的缓存命中率是多少",而不只是"你的卡有多快"。

判断三:算力从集中走向分层。

不是所有推理都需要在最贵的数据中心里跑。模型变小、量化成熟、端侧芯片跟上之后,一条更经济的路径正在成型:最重的生成和复杂推理留在云端,常规的、隐私敏感的、延迟敏感的往边缘和端侧下沉。

分层的驱动力不只是成本,还有延迟和合规——数据不出本地,天然解决一部分隐私问题。这条路径一旦跑通,会反过来影响模型设计:会出现更多"为端侧而生"的小模型,以及云端与端侧协同的调度策略。

对行业意味着什么

应用层:一大批"算不过来账"的需求会突然可行。很多 AI 产品的失败不是因为模型不行,而是单位 economics 不成立——单次调用赚的钱覆盖不了 token 成本。成本每降一个数量级,就会有一批应用从"演示能跑"跨到"能商用"。真正受益的是那些高频、低毛利、过去不敢上 AI 的场景。

模型层:能力趋同之后,成本和生态成为壁垒。当开源权重模型以极低的边际成本提供接近前沿的能力,闭源模型的溢价就必须由别的东西支撑——更强的复杂任务能力、更稳的服务、更好的工具链。价格战会持续,但定价权最终会向"不可替代性"集中,而不是向"参数规模"集中。

基础设施层:整合加速,核心 KPI 是单位 token 成本。硬件、引擎、调度、缓存正在被打包成一体化的服务。谁能在同等质量下把每百万 token 的成本压得更低,谁就拿到更多流量。这也意味着"只会调 API"和"能优化整个链路"之间的价值差距会越拉越大。

对从业者:最值钱的能力正在移动。单纯的提示词调优、简单的模型调用,价值会继续被稀释;而懂成本结构、能把延迟和吞吐换成钱、能在效果和开销之间做取舍的工程能力,会越来越稀缺。说得更直白一点:会算账的 AI 工程师,会比只会跑通 demo 的人贵得多。

对中国 AI 产业:开源模型叠加成本优势,正在让中国模型在全球 token 流量中占据越来越大的份额。这个优势的持续性取决于两件事——算力供给的稳定性和软件栈的成熟度。成本领先是结果,不是原因,别把它当成护城河本身。

回到开头那个多花了六万的团队。

他们后来做的事其实很朴素:把系统提示词固定下来放到最前面,让同类请求走同一批实例,把离线任务挪到批处理,再给简单请求接了个小模型。两个月后账单降了六成多,业务指标没掉。

推理优化这件事,绝大多数时候不是比谁的技术更炫,而是比谁更舍得把账算细。

当 token 越来越便宜,真正稀缺的就不再是算力,而是"知道该把算力用在哪"的判断力。

今晚能做的一件事

打开你最近一个月的推理账单, 算出缓存命中率和输出 token 占比。

这两个数字,通常能解释你一半以上的成本差异。

本文为原创技术解读,数据均来自公开报道与厂商公开报价(2026 年),仅作技术讨论与成本测算参考,不构成采购或投资建议。关注我,持续更新 AI 基础设施与工程实践的深度拆解。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-09-08,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 吞吐账:延迟是你花钱买回来的
  • 缓存账:最被低估的降本杠杆
  • 模型账:不是每个请求都需要最强的模型
  • 对行业意味着什么
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档