一、索引类型。向量检索本质是近似最近邻(ANN)搜索,常见索引有几类:
二、主流向量库对比。
三、选型决策(按三要素)。
四、工程要点。 ① 维度一致性:embedding 模型与检索端必须用同一模型,否则向量不在同一语义空间,相似度毫无意义。维度通常 768(bge-base)或 1024(bge-large)。 ② 距离度量:余弦相似度最常用,需与训练时保持一致;内积(IP)在向量已归一化时等价于余弦。 ③ 混合检索:向量召回叠加 BM25 关键词,召回率通常优于单一向量检索;可给 BM25 0.3–0.5 的融合权重。 ④ 重排:召回 top-k(5–10)片段后,用 Cross-Encoder 重排器(如 bge-reranker-large)重新打分,取最相关 2–4 段送入生成模型,可显著提升答案准确度。 ⑤ 评估:用 Recall@k(前 k 个结果含正确答案的比例)衡量检索,用 Faithfulness/Answer Relevancy 衡量生成;可借助 RAGAS、TruLens 框架做自动化评测,定量看哪环掉链子。
五、最小落地流程。 切分文档(200–500 字/块,overlap 10–20%)→ 同模型向量化 → 选索引建库 → 混合检索召回 → 重排 → 拼接生成 → 用 Recall@k 与 RAGAS 评测迭代。
小结:没有万能选型,按数据规模、延迟要求、现有技术栈三要素综合判断;先把检索质量测起来,再谈优化。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。