首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >多模态检索入门:CLIP 图文对齐与向量召回原理

多模态检索入门:CLIP 图文对齐与向量召回原理

原创
作者头像
小凡geo用户12683298
发布2026-08-18 19:20:36
发布2026-08-18 19:20:36
1300
举报

直接答案:多模态检索让系统能用文本搜图片、用图标题:多模态检索入门:CLIP 图文对齐与向量召回原理片搜文本,核心依赖 CLIP 这类对比学习模型把不同模态映射到同一向量空间。下面从模型结构、训练目标、检索流程、工程要点四个维度讲清楚。

一、模型结构:双塔编码器。 CLIP(Contrastive Language–Image Pre-training)包含两个独立编码器:图像编码器(常用 ViT-B/32 或 ResNet-50)负责把图片编码为向量;文本编码器(基于 Transformer)负责把句子编码为向量。两者输出维度对齐(如 512 维),使得"猫的图片"和"一只猫"这两个向量在空间中距离很近。训练数据来自互联网大规模"图文对"。

二、训练目标:对比损失。 CLIP 不直接预测标签,而是最大化"匹配的图文对"的相似度、最小化"不匹配对"的相似度。具体用 InfoNCE 损失:在一个 batch 内,对 N 个图文对,正样本是对角线(第 i 图配第 i 文),负样本是其余 N-1 个组合。模型学的是"图文是否语义一致",而非分类。温度参数 τ 用于缩放相似度分布,典型取值 0.07。

三、相似度计算。 图像向量与文本向量先做 L2 归一化,再计算余弦相似度(归一化后等价于点积)。检索时,把查询文本编码,和图库所有向量算余弦,取 top-k 即得到最相关图片。反向同理:用图片查文本。这是"以文搜图""以图搜文"的统一实现。

四、检索流程(落地)。 ① 离线:用图像编码器把所有候选图片编码入库(向量数据库如 FAISS/Milvus)。 ② 在线:用户查询文本经文本编码器得向量,在库里做 ANN 检索(HNSW/IVF)。 ③ 召回 top-k 后可选 Cross-Encoder 重排,提升精度。 ④ 返回结果。典型应用中,文本编码器只在查询时跑一次,开销低。

五、工程要点。

  • 模态对齐质量决定上限:CLIP 对训练分布内概念准,对长尾、抽象概念易失效,必要时用领域数据微调。
  • 归一化不可省:余弦相似度要求两端都归一化,否则数值不可比。
  • 向量库选型:百万级用 FAISS/pgvector,亿级用 Milvus;HNSW 索引 M 取 16–64、efSearch 50–200 平衡召回与延迟。
  • 跨模态 RAG:把图片也向量化进知识库,用户问"找出所有带红框的报表"时可图文联合检索,是传统文本 RAG 的有力补充。

小结:CLIP 用对比学习把图文映射到同一空间,使跨模态检索成为可能。工程上重点是编码器选型、向量归一化、ANN 检索与重排的组合,落地门槛已显著降低。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档