dongdonglog
AI Infra 系列 · 第四章 推理引擎 (下):投机解码、量化、KV 池化、MoE 并行,一张卡当两张用
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
dongdonglog
社区首页
>
专栏
>
AI Infra 系列 · 第四章 推理引擎 (下):投机解码、量化、KV 池化、MoE 并行,一张卡当两张用
AI Infra 系列 · 第四章 推理引擎 (下):投机解码、量化、KV 池化、MoE 并行,一张卡当两张用
dongdonglog
关注
发布于 2026-08-27 10:29:21
发布于 2026-08-27 10:29:21
21
0
举报
概述
上篇讲了推理为什么慢、引擎怎么选。这篇给真刀真枪的四板斧:投机解码(让模型一次猜好几个 token)、量化(FP8/FP4 把权重塞进更小的盒子)、KV 池化(缓存复用,prefill 一次、处处复用)、MoE 并行(把 1 万亿参数的模型在集群上跑起来)。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
算法
机器学习
ruby on rails
自动推理
大模型部署
#AI infra
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档