首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >长上下文模型来了,RAG 还要不要做?从成本、延迟和可验证性重新算一遍

长上下文模型来了,RAG 还要不要做?从成本、延迟和可验证性重新算一遍

作者头像
哈尔
发布2026-08-01 11:47:29
发布2026-08-01 11:47:29
1420
举报
概述
百万级上下文模型让“把资料全塞进提示词”看起来很诱人,但工程落地不能只看窗口大小。本文从 token 成本、延迟、注意力衰减、引用验证和缓存策略出发,给出一套长上下文与 RAG 混合使用的实践路径。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档