哈尔
长上下文模型来了,RAG 还要不要做?从成本、延迟和可验证性重新算一遍
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
哈尔
社区首页
>
专栏
>
长上下文模型来了,RAG 还要不要做?从成本、延迟和可验证性重新算一遍
长上下文模型来了,RAG 还要不要做?从成本、延迟和可验证性重新算一遍
哈尔
关注
发布于 2026-08-01 11:47:29
发布于 2026-08-01 11:47:29
142
0
举报
概述
百万级上下文模型让“把资料全塞进提示词”看起来很诱人,但工程落地不能只看窗口大小。本文从 token 成本、延迟、注意力衰减、引用验证和缓存策略出发,给出一套长上下文与 RAG 混合使用的实践路径。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
人工智能
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档