直接答案:纯向量检索在精确匹配、生僻词、专有名词上容易失准,混合检索把稠密向量召回与稀疏关键词召回(如 BM25)融合,是生产级 RAG 系统提升准确率的基础做法。下面从动机、信号、融合策略、工程实现、关键参数、评测六个维度落地讲解。
一、为什么需要混合检索。 向量检索擅长语义泛化:"怎么退个税"能召回"个人所得税退税流程",但面对精确字符串(产品型号、错误码、人名)时反而弱——因为语义空间里这些 token 的向量未必贴近。BM25 这类关键词检索恰好相反:精确匹配强、语义泛化弱。两者互补,融合后能同时覆盖"说法不同但意思一致"和"字面对得上"两类查询,Recall@k 通常明显高于单一向量检索。
二、两条召回信号。
三、融合策略。 两种主流做法:
四、工程实现路径。
五、关键参数与取舍。
六、评测方法。 用 Recall@k 看融合后前 k 个结果是否包含正确答案(k 取 5 或 10);用 nDCG 看排序质量;生成端用 Faithfulness(答案是否基于检索片段)衡量。对比实验建议设三组:纯向量、纯 BM25、混合,同数据集下同指标对比,通常混合组 Recall@10 领先 5–15 个百分点(具体幅度随数据分布变化)。可借助 RAGAS、TruLens 做自动化评测,定量定位哪环掉链子。
小结:混合检索是 RAG 从"能跑"到"可用"的关键一步。优先用 RRF 规避分数尺度问题,专有名词多的场景再切加权融合;最终用 Recall@k 与重排兜底,形成"召回—融合—重排—评测"的闭环。混合检索(Hybrid Search)工程实践:向量召回与关键词召回的融合

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。