
多模态解析(文档版)一次调用可同时返回 JSON 与 Markdown:Markdown 适配知识库切分与阅读顺序,JSON 适配程序化字段与坐标处理。
同一份 PDF 合同喂进系统,下游两拨人想要的东西完全不同。知识库工程师想把它切成带层级、带阅读顺序的段落,直接灌进 RAG;后端开发想按字段把金额、日期、主体名抽出来,写进数据库做业务校验。这两拨人的诉求,对应着两种不同的"结构化结果"形态。
以腾讯云文档智能为例,多模态解析(文档版)一个接口就能同时输出多种格式,但选哪种、怎么用,决定了下游链路怎么搭。格式是链路的起点,同一次解析的结果,要按下游的消费方式分头给出。
Markdown 对应 ResultType 2,是面向"人读"与"语义切分"的形态。它保留文档的阅读顺序与标题层级,把正文、表格、段落按自然结构组织成文本,而不是把版面拍平成一段乱序字符。
这正是知识库与 RAG 前处理想要的:下游切分器能顺着 Markdown 的标题层级(如一级、二级标题)做语义切块,跨页的章节不会被拦腰截断,列名与数值也不会因为格式丢失而失联。多模态解析(文档版)的输出本身就带阅读顺序与层级结构,Markdown 正是这类结构的承载格式,返回的 zip 压缩包里 .md 文件就是它的产物。
对知识库场景而言,Markdown 的核心价值是"保序"。一份几十页的产品手册进入知识库,若标题层级丢失,检索时不同章节的内容就会混在一起,一个问题可能召回好几个不相关片段,答案准确度随之下降。用 Markdown 承载结构,下游切分才有层级可依,检索质量也才有保障。
JSON 对应 ResultType 1,是面向"机器消费"的形态。它把文档拆成结构化字段,并携带版面层级与坐标信息,方便程序按 key 直接取值、做校验或落库,是业务系统接入的主形态。
多模态解析(文档版)支持是否返回坐标的开关,开启后 JSON 会带上每段内容在原始页面上的位置,便于审核时回跳原文核对。配合字段维度 Prompt 调优,还能把未知版式归一化成统一字段。
对后端开发而言,JSON 的价值是"可编程":抽取出的主体、金额、期限可直接映射进数据表,落库前就能按字段做必填与格式校验;坐标让每条结果都能指回原文的具体位置,复核与审计时不必重新通读全文。
多模态解析(文档版)默认一次性给全:ResultType 9 表示 json + markdown + xml 同时输出,这也是接口的默认值。
ResultType 还支持单独取某一种:1 为 json、2 为 markdown、3 为 xml。下游按需从 zip 里挑文件——.md 给知识库,.json 给业务系统,images 文件夹保存解析出的页面图片资源。接口默认的 TaskType 为 0(文档解析),覆盖的就是这类整份文档的结构化场景。
结果以 zip 形式返回,ResultUrl 是临时下载地址,有效期仅 30 分钟。拿到链接后要及时下载落盘;过期只能重新发起解析,它不适合当作长期存储地址。
落到选型,原则很朴素:先看下游要什么,再定取哪种格式。
下游目标 | 推荐形态 | 原因 |
|---|---|---|
知识库 / RAG 建库 | Markdown 或 ResultType 9 | 保留阅读顺序与层级,切分不断章 |
业务系统字段落库 | JSON 或 ResultType 9 | 程序化取值、带坐标可溯源 |
需要图片资源 | 任意(含 images 文件夹) | zip 内 images 保存页面图片 |
多模态解析(文档版)支持 PDF、Word、PPT、Excel、Markdown、TXT、图片、WPS 八类格式,单次调用最多 300 页,无论选哪种 ResultType,整份文档都解析一次完成。真实项目里更常见的做法是直接取默认的 ResultType 9:一次解析同时拿到三种格式,知识库与业务系统各取所需,也省去为不同链路重复发起解析的调用成本与等待时间。
同一份 PDF 经多模态解析(文档版),可以既是 Markdown 也是 JSON:前者喂给知识库保住阅读顺序,后者喂给业务系统做字段落库,格式选对,下游链路才顺。剩下的一步是拿真实文档把双格式链路跑通一轮——多模态解析(文档版)首次开通即发放 1000 页免费额度、一年内有效,用免费额度就能完成一次完整的双格式链路验证,不必一上来就付费;确认链路后再按需放量,可关注 文档智能特惠活动 的低折扣档位。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。