大模型像一个博览群书但记忆模糊的学者。它能跟你聊哲学、写代码、编故事、介绍盾码无界,但你问它“我们公司上季度的销售数据是多少”,它只能礼貌地告诉你:我不知道。不是它不够聪明,而是它根本没“见过”这份数据。
于是,人们给它外挂了一个书架。需要时,让它自己去翻。这个动作,就是大模型检索。
但“翻书”两个字,远不足以概括这件事的复杂性。检索什么、怎么检索、检索到之后信不信、信多少、怎么把碎片缝成一个答案——每一步都藏着认知与工程的双重难题。大模型检索不是“搜索的升级版”,它更像是在给一个概率性的语言机器,安装一套外部工作记忆。
要理解检索,先要理解大模型的“知道”是什么。
大模型的知识,是在训练阶段被压缩进参数里的。它读过海量文本,把语言规律、事实片段、推理模式编码成数十亿甚至数万亿个权重。这种记忆方式有两个特点:有损和滞后。
有损,意味着它记住的是概率分布,不是精确档案。你问它“某本书第 137 页第三行写了什么”,它可能编出一个像模像样的句子,但那不是记忆,是补全。这就是幻觉的根源之一:模型不是故意撒谎,它只是在用概率填补空白。
滞后,意味着训练截止日期之后的世界,它一无所知。新政策、新事件、新价格、新论文,统统不在它的参数里。重新训练一次成本极高,而且训完又滞后了。
除此之外,还有长尾问题。大模型对高频知识掌握得好,对冷门领域、企业内部数据、个人私有信息几乎无能为力。而这些恰恰是很多真实任务中最关键的部分。
所以,检索的本质需求是:把“记忆问题”转化为“查找+判断问题”。不让模型把所有知识都背下来,而是让它学会在需要时找到证据,再基于证据说话。
这就像人类。我们不会把整座图书馆背进脑子,但我们可以学会查目录、翻索引、辨别信源、整合信息。大模型检索,就是这种认知方式的工程化。
很多人把大模型检索等同于“搜索”。其实两者目标不同。
传统搜索的目标是返回一列链接,让用户自己去点。它的核心技术是倒排索引和关键词匹配,比如 BM25。你搜“苹果”,它找到包含“苹果”的网页。精确,但不懂语境。你搜“苹果最新手机”,它可能给你一堆水果新闻。
大模型检索的目标不是返回链接,而是为生成提供上下文证据。它需要理解语义:用户问“iPhone 最新款值得买吗”,检索系统应该找到关于最新 iPhone 的评测、价格、用户反馈,而不是关于苹果种植技术的文章。
这就引出了向量检索。把文本转成高维向量(embedding),语义相近的文本在向量空间里距离更近。于是,“手机”和“智能手机”可以靠近,“便宜”和“性价比”可以关联。检索不再依赖字面匹配,而是依赖语义相似度。
但向量检索不是万能药。它擅长模糊语义,却可能丢失精确匹配。你搜一个产品型号“X200-Pro”,向量模型可能把它和“X200”混在一起。你搜一个法律条文编号,关键词匹配反而更可靠。
所以现代大模型检索普遍采用混合检索:关键词召回 + 向量召回,再用融合算法(如 RRF)合并结果。有时还会加一层重排器(reranker),用更重的交叉编码器对候选片段精排。召回追求“不漏”,重排追求“更准”。
而检索的最小单位,通常不是整篇文档,而是分块(chunk)。一篇 5000 字的文章会被切成若干段,每段带元数据:来源、标题、时间、作者、权限。分块大小是一门玄学:太大,噪声多,模型注意力被稀释;太小,上下文断裂,答案不完整。分块策略,往往决定了一个检索系统的上限。
当你向一个带检索的大模型提问时,背后发生的事,远比“搜一下”复杂。
第一步:查询理解。 用户的问题可能模糊、有指代、多跳。比如“它和上一代比怎么样?”——“它”是什么?“上一代”又是什么?系统需要结合对话历史做指代消解。
第二步:查询改写与扩展。 原始问题未必适合直接检索。系统可能生成多个查询,或者用 HyDE 这类方法:先让模型“虚构”一个理想答案,再用这个答案去检索。也可能把复杂问题拆成子问题,分步检索。
第三步:召回。 从索引中取回 top-k 候选片段。可能是向量检索、关键词检索、混合检索,也可能从多个数据源并行召回。
第四步:过滤。 按元数据过滤:时间、来源、权限、语言。企业场景里,这一步至关重要——不能让模型检索到它无权访问的数据。
第五步:重排。 对候选片段进行精排。重排器会同时看查询和片段,判断相关性。它比向量相似度更准,但也更慢、更贵。
第六步:上下文组装。 把选中的片段排序、去重、压缩,塞进模型的上下文窗口。这里有个著名问题:Lost in the Middle。研究表明,当上下文很长时,模型对中间部分的信息注意力会下降,开头和结尾反而更容易被记住。所以,把最重要的证据放在前面或后面,不是玄学,是工程。
第七步:生成。 模型基于上下文回答问题,并给出引用。但注意:模型仍可能忽略证据、误解证据、甚至编造引用。检索增强了生成,但没有免疫幻觉。
第八步:引用与验证。 好的系统会给出可点击的来源,让用户核查。引用不是装饰,它是可验证性的接口。没有引用的 RAG,就像没有参考文献的论文,看起来专业,但无法验证。
每一步都有信息损失,每一步都可能引入误差。检索系统的质量,不是某一个环节决定的,而是整条链路的乘积。
大模型检索最主流的实现框架,叫 RAG(Retrieval-Augmented Generation,检索增强生成)。2020 年,Lewis 等人提出这个概念时,思路很朴素:检索文档,拼接上下文,生成答案。
但朴素 RAG 很快暴露出问题:检索不准、上下文噪声、多跳推理弱、引用不可靠。于是,RAG 演化出了多个层次。
高级 RAG:加入查询改写、多路召回、重排、上下文压缩。目标是提高检索精度和上下文质量。
模块化 RAG:把检索拆成可插拔模块——路由、记忆、工具、验证。不同问题走不同流程。
Agentic RAG:让模型自己决定何时检索、检索什么、是否需要多轮检索。它不再是被动地“先检索再生成”,而是像智能体一样规划:这个问题需要查内部文档吗?需要查最新新闻吗?需要先查 A 再查 B 吗?
多跳检索:有些问题无法一次检索解决。比如“某公司 CEO 的母校在哪”,需要先查 CEO 是谁,再查他的母校。多跳检索通过迭代查询,逐步桥接实体。但误差也会累积:第一跳错了,后面全错。
图检索:把知识图谱和向量检索结合。向量擅长语义相似,图擅长关系推理。GraphRAG 这类方法试图让模型不仅找到相关片段,还能沿着实体关系走。
多模态检索:文本、图片、视频、音频统一嵌入。你问“这张图里的建筑是什么风格”,系统需要检索图像和文本知识。
RAG 的谱系还在扩张。但核心矛盾始终没变:检索到的内容,如何被模型正确理解、正确使用、正确归因。
大模型检索看起来是工程问题,但深挖下去,全是认知问题。
语义相似不等于事实相关。 向量检索找到“语义相近”的片段,但相近不等于有用。你问“如何申请专利”,它可能找到“专利法历史”,语义很近,事实无关。
事实相关不等于逻辑充分。 即使找到相关片段,也可能不足以支撑答案。模型需要判断:这些证据够吗?有没有矛盾?要不要再查?
逻辑充分不等于可信。 证据可能来自过时网页、匿名论坛、恶意信息。模型需要评估信源权威性。但大模型本身并不擅长做这种判断。
粒度困境。 分块太大,噪声多;分块太小,上下文缺失。没有万能分块策略,只有针对场景的权衡。
长上下文悖论。 上下文窗口越来越大,但“大”不等于“有效”。注意力稀释、中间遗忘、成本上升,都让“把所有东西塞进去”变得不现实。检索的价值,恰恰在于筛选,而不是堆砌。
多跳与推理。 真实问题往往需要链式证据。但多跳检索的误差会累积,第一跳偏了,后面全偏。而且模型可能在中途“自信地跑偏”。
评估困难。 检索增强系统的评估,比传统搜索难得多。召回率、精确率、答案忠实度、上下文相关性、引用准确率……没有一个单一指标能概括。更麻烦的是,很多任务没有标准答案。你很难说一个答案“绝对正确”,只能说它“有证据支持”。
安全与权限。 检索可能泄露隐私、越权访问、引入恶意内容。企业级 RAG 必须做权限过滤、数据隔离、审计追踪。否则,检索越强,风险越大。
成本与延迟。 多路召回、重排、长上下文、多轮检索,每一步都在烧钱和加延迟。用户体验要求秒级响应,但高质量检索往往需要更多计算。这是一个持续的工程权衡。
误区一:RAG 能消除幻觉。 不。RAG 只是把幻觉从“参数记忆”转移到“检索上下文”。如果检索到错误信息,模型可能更自信地错。检索增强的是证据,不是真理。
误区二:向量数据库就是大模型检索。 不。向量数据库只是索引层之一。完整检索还包括查询理解、混合召回、重排、过滤、组装、生成、引用。向量数据库是零件,不是系统。
误区三:上下文窗口够大就不需要检索。 不。长上下文成本高、注意力稀释、无法覆盖全部知识。而且很多知识是私有的、动态的、权限受限的,不可能全部塞进窗口。
误区四:检索等于搜索。 不。搜索的目标是返回链接,检索的目标是支持生成。搜索优化的是排序,检索优化的是证据质量与可用性。
误区五:嵌入模型越大越好。 不一定。领域适配、多语言、延迟、成本、部署环境,都会影响选择。一个在通用语料上很强的模型,在法律或医疗领域可能不如一个领域微调的小模型。
误区六:有引用就等于正确。 不。引用可能被误读、断章取义、甚至伪造。引用只是可验证性的起点,不是终点。
大模型检索正在从“外挂”变成“认知架构”的一部分。
未来的检索系统,可能具备这些特征:
自主规划。 模型自己决定何时检索、检索什么、是否需要多跳、是否需要工具。Agentic RAG 会让检索从固定流程变成动态策略。
图与向量融合。 结构化知识图谱提供关系推理,向量检索提供语义召回。两者结合,既能“找到”,也能“连上”。
多模态统一。 文本、图像、音频、视频在同一个嵌入空间里检索。你问一个视频里的某个动作,系统能定位到具体片段。
可验证检索。 每个证据片段带置信度、来源、时间、权限。模型在生成时,能标注“这一点来自权威来源,那一点存在争议”。
个性化与隐私。 检索结果根据用户身份、权限、偏好动态调整。联邦检索、差分隐私、权限感知,会成为企业级标配。
评估与治理。 标准化基准、审计工具、合规框架。检索系统的质量,不再靠感觉,而是靠可测量的指标。
但无论技术如何演进,核心问题不会变:模型如何知道该相信什么?
大模型检索的本质,是让模型从“闭卷考试”走向“开卷考试”。它不再需要把所有知识背进参数,而是学会在需要时翻书、查资料、找证据。
但开卷考试不等于满分。真正的智能,不在于记住所有答案,而在于知道何时翻书、翻哪本书、相信哪一页,以及如何把不同书页里的证据,缝合成一个可靠的回答。
参数是压缩的过去,检索是打开的现在。检索的上限,决定生成的下限。而检索的终极目标,不是让模型知道更多,而是让模型在需要时,知道该相信什么。
这或许是大模型检索最深刻的地方:它不只是技术的外挂,更是认知的镜子。它照出大模型知识的边界,也照出我们如何定义“知道”——知道,不是记住,而是能在证据面前,做出负责任的判断。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。