腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
搜索
关闭
文章
问答
(1)
视频
开发者手册
清单
用户
专栏
沙龙
全部问答
原创问答
Stack Exchange问答
更多筛选
回答情况:
全部
有回答
回答已采纳
提问时间:
不限
一周内
一月内
三月内
一年内
问题标签:
未找到与 相关的标签
筛选
重置
0
回答
推理成本治理:先上量化还是先上前缀缓存?
缓存
、
部署
、
量化
、
系统
、
大模型部署
背景:我在给一个 RAG 应用做推理成本治理,实测开启 prompt 前缀缓存后输入成本降了 60% 以上,量化(
INT8
)也把显存砍了一半。但继续往下优化时遇到两个问题: 1.量化(
INT8
权重 + FP8 KV Cache)叠加后的质量归因。评测集上综合掉点约 1.5 个点,但说不清是权重量化还是 KV 量化贡献的。
浏览 6
提问于2026-10-08
领券