
在金融研报、行业分析、企业报告等场景中,大量关键信息隐藏在图表中。然而,传统RAG系统主要依赖OCR提取文本,只能“读文字”,难以理解图表中的结构与数据关系,导致问答结果不完整甚至错误。
为解决这一问题,澜舟推出面向图表理解的多模态RAG技术,实现从“读文本”到“读图表”的能力升级。在FinRAGBench-V数据集上,系统准确率从69.6%提升至90.7%,提升超过21个百分点。
从“读文本”到“读图表”:我们解决了什么问题?
传统RAG在处理文本信息时表现出色,但在面对真实世界中的复杂文档时仍存在明显局限,本质问题不在于“模型能力不足”,而在于“信息建模方式过于单一”。
具体表现为:
为此,澜舟提出面向图表理解的多模态RAG技术,将系统能力从“文本检索”升级为“跨模态理解与推理”,并将核心能力统一抽象为“建模-检索-推理-生成”的四阶段闭环,重点实现以下四个核心能力跃迁:
1. 图表语义建模:从“非结构化图像”到“结构化语义表示”
基于视觉语言模型与多模板驱动机制,对图表进行细粒度解析,抽取关键数据、趋势关系及元信息(如图表类型、坐标语义等),构建统一的结构化图表语义表示。
2. 跨模态检索:从“单通道文本检索”到“图文融合检索”
融合文档级检索与图文检索机制,引入视觉语言模型进行跨模态相关性建模与证据筛选,实现图表内容与文本上下文的联合召回与精排。
3. 图表推理增强:从“看图即答”到“基于图像操作的多步推理”
引入Thinking-with-images推理范式,通过图像裁剪、缩放等可执行操作,逐步完成复杂图表中的数据定位、关系分析与数值推断,提升复杂场景下的推理准确性。
4. 图文融合生成:从“单一文本生成”到“图文协同表达”
融合图表证据、图像内容与文本上下文进行统一生成,在答案中动态插入图表内容,实现图文交织的表达形式,提升结果的可读性与可验证性。
整体能力框架:四大核心能力

澜舟的多模态RAG系统在离线阶段完成图表语义建模与索引构建,在在线阶段依次执行跨模态检索、推理增强与图文融合生成,形成完整的多模态问答闭环。
具体流程如下:
离线阶段(数据构建)
在线阶段(问答推理)
核心技术亮点
图表语义建模

在离线阶段完成图表区域的识别与定位,并构建图表图像及其上下文信息。基于视觉语言模型(VLM)对图表进行结构化语义建模,统一抽取关键数据、趋势关系及元信息,显著提升多模态问答对图表内容的理解能力。
具体而言,图表语义建模能力可以从多模态信息抽取、多模板驱动以及多图对照与上下文增强三个方面实现:
跨模态检索
传统检索方式存在一定局限:仅采用文档级检索会对整段内容进行统一建模,图表信息容易被淹没在大量文本中;而仅依赖图文检索则只关注图表本身,对上下文与文档语义利用不足,且对相似图表的区分能力有限。为此提出融合式跨模态检索策略,兼顾全局语义与图表细粒度信息。

检索效果展示,Recall@k表示检索topk图表的召回率,Acc表示相关性判定后保留的图表准确率:

图表推理增强

在图表信息挖掘与证据提取阶段,“读图即答”难度高、易出错,引入基于图像操作的推理增强机制,提升复杂图表中关键信息抽取的准确性:
图文融合生成

基于检索与证据抽取结果,构建图文融合的答案生成机制:
效果评测
对系统在图表理解与多模态问答场景下的能力进行系统性评估,涵盖数据构建与结果评判两个方面:
评测数据集
采用 FinRAGBench-V 作为基础数据集,该数据集为面向多模态检索增强生成(RAG)的 benchmark。选取其中中文图表相关子集,问题类型覆盖图表信息提取、图表数值计算以及图表时效性查询。在此基础上,针对流程图、架构图等非结构化图形,人工构建补充测试样本,扩展数据覆盖范围。最终形成包含 270 条样本的评测集。
评估标准
采用基于大模型的三分量表(0–2 分)进行自动评估,其中 2 分表示回答完全正确。具体评分标准如下:
• 2 分(正确):最终答案与标准答案一致,关键事实完整且准确,不包含影响结论的错误信息。
• 1 分(部分正确):回答存在一定偏差,但整体接近正确结论,包含以下情况之一:
○ 仅覆盖部分关键事实;
○ 结论方向基本正确,但关键细节存在偏差;
○ 在非严格数值场景下,数值、时间、对象、排序或比较关系存在轻微误差;
○ 表达不够精确,无法完全确认与标准答案一致。
• 0 分(错误):回答错误、矛盾或无法判定为正确,包含以下情况之一:
○ 最终结论与标准答案不一致;
○ 关键事实错误;
○ 在严格数值场景下,数值、比例、百分比、排名、日期或数量不一致;
○ 存在编造信息或无依据推断;
○ 未回答问题或回答内容与问题无关。
当前效果

提升幅度:准确率(2 分)从 69.63% 提升至 90.74%(+21.11pp),提升幅度明显。
应用场景
多模态问答技术可广泛应用于以下场景:
1. 金融研报分析
○ 自动解读图表趋势
○ 辅助投资决策
2. 企业知识库(如澜舟智库)
○ 支持图文混合问答
○ 提升知识检索准确率
3. 政策/行业报告解读
○ 自动提取关键数据
○ 生成分析结论
案例展示
为直观展示多模态RAG在复杂图表场景下的能力,我们选取澜舟智库中的典型问答案例进行说明。
案例一:复杂图表趋势分析

用户问题:
2018年至2023年期间,国有六大行的定期存款占比变化趋势是什么?
系统能力展示:
系统从研报中自动定位相关图表,并结合文本与图表信息进行综合分析,给出结论:
• 文本信息表明:2023年定期存款占比约为58.0%,较上年提升约7.5个百分点,且首次整体超过50%
• 图表信息进一步验证:自2018年以来,各年份占比呈持续上升趋势
系统通过融合文本结论与图表趋势,实现对数据变化的完整理解与交叉验证。
案例二:时间序列走势判断

用户问题:
从2020年3月到2020年12月,中证全指指数的整体走势是上升还是下降?
系统能力展示:
系统定位到对应折线图,并分析得出:
• 指数在2020年3月底触及低点(约850点)
• 此后持续震荡上行,至年底接近1700点
• 整体趋势为明显上升
在该类问题中,模型不仅需要“看图”,还需要进行时间序列分析与趋势判断。
总结与展望
澜舟多模态RAG技术,通过图表解析、语义理解、跨模态检索与可执行推理等关键创新,实现了AI从“读文本”到“读图表”的能力跃迁,让AI不仅能“看见”,更能“理解”和“推理”。
未来,多模态技术将进一步向更强的结构化理解与跨模态对齐能力发展,包括更精细的图表解析、更高效的多模态检索与推理机制,以及统一的端到端模型架构,以减少人工规则与模块间误差传递,提升系统在复杂真实文档场景下的泛化能力与稳定性。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。