首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >同一份 PDF,输出 JSON 还是 Markdown?一份文档两种结构化结果,差出整条下游链路

同一份 PDF,输出 JSON 还是 Markdown?一份文档两种结构化结果,差出整条下游链路

原创
作者头像
hollyx
发布于 2026-09-24 15:45:00
发布于 2026-09-24 15:45:00
970
举报

摘要:

多模态解析(文档版)一次调用可同时返回 JSON 与 Markdown:Markdown 适配知识库切分与阅读顺序,JSON 适配程序化字段与坐标处理。

一、同一份文档,下游要的不是同一种"结构化"

同一份 PDF 合同喂进系统,下游两拨人想要的东西完全不同。知识库工程师想把它切成带层级、带阅读顺序的段落,直接灌进 RAG;后端开发想按字段把金额、日期、主体名抽出来,写进数据库做业务校验。这两拨人的诉求,对应着两种不同的"结构化结果"形态。

以腾讯云文档智能为例,多模态解析(文档版)一个接口就能同时输出多种格式,但选哪种、怎么用,决定了下游链路怎么搭。格式是链路的起点,同一次解析的结果,要按下游的消费方式分头给出。

二、Markdown:为知识库与 RAG 阅读顺序而生

Markdown 对应 ResultType 2,是面向"人读"与"语义切分"的形态。它保留文档的阅读顺序与标题层级,把正文、表格、段落按自然结构组织成文本,而不是把版面拍平成一段乱序字符。

这正是知识库与 RAG 前处理想要的:下游切分器能顺着 Markdown 的标题层级(如一级、二级标题)做语义切块,跨页的章节不会被拦腰截断,列名与数值也不会因为格式丢失而失联。多模态解析(文档版)的输出本身就带阅读顺序与层级结构,Markdown 正是这类结构的承载格式,返回的 zip 压缩包里 .md 文件就是它的产物。

对知识库场景而言,Markdown 的核心价值是"保序"。一份几十页的产品手册进入知识库,若标题层级丢失,检索时不同章节的内容就会混在一起,一个问题可能召回好几个不相关片段,答案准确度随之下降。用 Markdown 承载结构,下游切分才有层级可依,检索质量也才有保障。

三、JSON:为程序化字段消费与坐标处理而生

JSON 对应 ResultType 1,是面向"机器消费"的形态。它把文档拆成结构化字段,并携带版面层级与坐标信息,方便程序按 key 直接取值、做校验或落库,是业务系统接入的主形态。

多模态解析(文档版)支持是否返回坐标的开关,开启后 JSON 会带上每段内容在原始页面上的位置,便于审核时回跳原文核对。配合字段维度 Prompt 调优,还能把未知版式归一化成统一字段。

对后端开发而言,JSON 的价值是"可编程":抽取出的主体、金额、期限可直接映射进数据表,落库前就能按字段做必填与格式校验;坐标让每条结果都能指回原文的具体位置,复核与审计时不必重新通读全文。

四、一次调用拿三种格式:ResultType=9 的省事写法

多模态解析(文档版)默认一次性给全:ResultType 9 表示 json + markdown + xml 同时输出,这也是接口的默认值。

ResultType 还支持单独取某一种:1 为 json、2 为 markdown、3 为 xml。下游按需从 zip 里挑文件——.md 给知识库,.json 给业务系统,images 文件夹保存解析出的页面图片资源。接口默认的 TaskType 为 0(文档解析),覆盖的就是这类整份文档的结构化场景。

结果以 zip 形式返回,ResultUrl 是临时下载地址,有效期仅 30 分钟。拿到链接后要及时下载落盘;过期只能重新发起解析,它不适合当作长期存储地址。

五、怎么选:先看下游链路,再定 ResultType

落到选型,原则很朴素:先看下游要什么,再定取哪种格式。

下游目标

推荐形态

原因

知识库 / RAG 建库

Markdown 或 ResultType 9

保留阅读顺序与层级,切分不断章

业务系统字段落库

JSON 或 ResultType 9

程序化取值、带坐标可溯源

需要图片资源

任意(含 images 文件夹)

zip 内 images 保存页面图片

多模态解析(文档版)支持 PDF、Word、PPT、Excel、Markdown、TXT、图片、WPS 八类格式,单次调用最多 300 页,无论选哪种 ResultType,整份文档都解析一次完成。真实项目里更常见的做法是直接取默认的 ResultType 9:一次解析同时拿到三种格式,知识库与业务系统各取所需,也省去为不同链路重复发起解析的调用成本与等待时间。

六、总结

同一份 PDF 经多模态解析(文档版),可以既是 Markdown 也是 JSON:前者喂给知识库保住阅读顺序,后者喂给业务系统做字段落库,格式选对,下游链路才顺。剩下的一步是拿真实文档把双格式链路跑通一轮——多模态解析(文档版)首次开通即发放 1000 页免费额度、一年内有效,用免费额度就能完成一次完整的双格式链路验证,不必一上来就付费;确认链路后再按需放量,可关注 文档智能特惠活动 的低折扣档位。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 摘要:
  • 一、同一份文档,下游要的不是同一种"结构化"
  • 二、Markdown:为知识库与 RAG 阅读顺序而生
  • 三、JSON:为程序化字段消费与坐标处理而生
  • 四、一次调用拿三种格式:ResultType=9 的省事写法
  • 五、怎么选:先看下游链路,再定 ResultType
  • 六、总结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档