
文档抽取(Agent 版)支持字段维度 Prompt 调优,无需重训模板即可适配未知版式,配合实时与异步模型完成归一化抽取。
企业每天要处理的文档,版式几乎从不静止。今天合作方换了一版采购单模板,明天风控那边新增一类担保函,后台的规则识别库始终在追赶新格式。处理固定版式的传统思路,是给每一种制式单据预先画好字段位置、写好抽取规则,再按图索骥。
腾讯云文档抽取(基础版)沿的就是这条路:它覆盖 6000+ 种版面的证照单据,在固定位置做高精度、高稳定性的字段提取,对身份证、营业执照这类标准件表现稳定。但这类方案的前提很明确——它只认"你见过的版式"。一旦文档换了个从没配置过的排版,字段位置一变,预先写死的坐标和键值就全部失效,要么抽不到,要么抽错位置。
业务里的麻烦恰恰在于,新模板是常态而非例外。合同、单据、条款的格式随合作方、监管要求和内部制度持续演化,靠堆规则模板去追,总会慢半拍,等模板配好,业务可能已经换了下一版。更棘手的是,同一份文档内部还可能存在跨页表格、嵌套条款,规则模板即便画得出来,维护成本也居高不下。
文档抽取(Agent 版)给出的解法,不是再去堆模板,而是把"适配"这件事交给字段维度 Prompt。所谓字段维度 Prompt 调优,是指针对你要抽取的每一个字段,用自然语言或字段描述告诉模型"这一栏要取什么"。模型据此理解字段语义,而不是依赖固定的坐标。
遇到一份全新版式的合同或单据,你不需要先画模板、等训练,只需要描述字段,就能让模型去读。这带来的直接收益是归一化抽取:不同版式、不同措辞的同一类信息(比如不同模板里的"乙方""供方""卖方"),可以被归一成统一的输出字段名。下游系统拿到的是一致的结构,而不是随版式漂移的脏数据。
这也正好对应文档智能"开箱即用与深度定制兼顾"的定位:它既提供标准 API 快速集成,也支持通过 Agent 提示词、字段映射等方式进行深度业务定制,字段维度 Prompt 正是这种定制在抽取环节的体现。同时它保留无需训练、简单配置即可上手的易用性,新模板上线不必等模型重训。
以文档抽取(Agent 版)为例,它面向的就是医疗票据、借贷合同、法律文书、保险条款、征信报告等多页非结构化文档——这些恰恰是版式不固定、急需对未知模板快速适配的场景。
适配未知版式只是第一步,长文档怎么跑得动是另一件事。文档抽取(Agent 版)提供了实时模型与异步模型两种形态,按业务时效性灵活选择。
实时模型对应接口 ExtractDocAgent,适合单页快速抽取,默认限频 5 次/秒,仅支持 PDF 单页识别。它胜在快,适合在线实时补录这类需要立刻拿到结果的场景。
异步模型则把深度语义理解放进来,支持上下文关联、逻辑推理与长文档处理,需要提交任务、查询任务两个接口配合:先用 SubmitExtractDocAgentJob 提交,再用 DescribeExtractDocAgentJob 轮询结果。提交接口 SubmitExtractDocAgentJob 默认限频 1 次/秒,查询接口 DescribeExtractDocAgentJob 默认限频 20 次/秒。通过 FileStartPageNumber 与 FileEndPageNumber 两个参数,可以指定要处理的起止页。
在长文档场景下,Agent 版支持长文档稳定抽取的页数上限为 50 页,多数合同、条款与报告的单次处理都落在这一范围内。
字段维度 Prompt 解决"怎么读",但要让抽取结果更贴合业务,还可以和三项通用能力搭配使用。其一是自定义键值:你可以创建个性化 key,模型自动建立图片中文字与 key 的对应关系,对任意版式图片做结构化识别,相当于给模型一份"字段词典"。
其二是智能匹配:上传图片后系统自动配准,把不同版式图片与已发布模板自动匹配,减少人工分类。当一批单据里混着几种版式时,智能匹配先把它们归位,再交给对应的抽取逻辑,省去人工前置分拣。其三是自定义字段类型:针对小写金额、日期、纯数字等内容类型做专项优化,还能穷举可能的输出值范围来智能纠正和规范结果,比如把"二〇二四"统成"2024"。
三者与字段维度 Prompt 不是替代关系,而是各管一段:Prompt 决定"新模板能不能读出来",字段类型决定"读出来规不规范",智能匹配决定"混在一起的版式怎么分派",组合起来,既有接新模板的灵活度,也保住了输出口径的稳定性。
落到工程接入,两种模型对应不同的 Action 与调用节奏。异步文档抽取 Agent 采用提交、查询分离的两步式:
# 异步文档抽取 Agent:提交任务(ImageUrl 传 PDF / 图片地址,用起止页参数圈定范围)
resp = client.SubmitExtractDocAgentJob({
"ImageUrl": "https://example.com/contract.pdf",
"FileStartPageNumber": 1,
"FileEndPageNumber": 20,
"ItemNames": [
{"KeyName": "甲方", "KeyPrompt": "合同的甲方主体名称"},
{"KeyName": "合同金额", "KeyPrompt": "合同总金额,保留币种与数值"}
]
})
job_id = resp["JobId"]
# 轮询查询结果
result = client.DescribeExtractDocAgentJob({
"JobId": job_id
})实时模型则是直接调用 ExtractDocAgent,传入单页 PDF 或图片即可。计费上,文档抽取(Agent 版)按页计量:后付费首档(月调用量 1 万次以内)自适应价格下,字段数 ≤ 10 的短文本 0.34 元/页,字段数 > 10 的长文本 0.68 元/页;固定价格不限字段数量,统一 0.4 元/页,字段规模大时按固定价格更划算。
它和文档抽取(基础版)的分工也就清晰了:基础版适合版式固定、量大的标准证照单据,靠规则拿稳定与速度;Agent 版适合版式不固定、需要语义理解的未知模板,靠 Prompt 拿灵活与覆盖。两者不是替代关系,而是按版式稳定度分工,遇到没见过的版式,先调 Prompt 试一版,往往比新建一套规则模板更快见效。
从成本角度看,规则模板的隐性开销常被低估:每一次版式微调,都可能意味着重新标坐标、回归测试与上线评审。字段维度 Prompt 把这部分开销转移到"描述字段"上,配置的边际成本随模板数量增长而平缓,模板越多,优势越明显。对于版式频繁变动的业务,规则库的维护投入会持续累积,而 Prompt 侧的投入要平缓得多。
未知版式之所以是抽取系统的硬骨头,根源在于规则模板只认"见过的版式"。文档抽取(Agent 版)的字段维度 Prompt 把适配从"重训模型、重配坐标"简化为"用自然语言描述字段",让新模板无需训练即可上线抽取,再配合实时与异步两种入口按文档长度分流、自定义字段类型与智能匹配兜住输出口径与混版分拣,未知版式便从接入的拦路虎变成了可快速试跑的一环。它和基础版也不是替代关系,而是按版式稳定度分工——标准件交给规则拿稳定,新模板交给 Prompt 拿灵活。
想先拿一版新模板验证效果,文档抽取(Agent 版)首次开通即发放 1000 次免费额度、一年内有效,用免费额度就能把一份合同或单据的字段抽取跑通一轮,不必一上来就付费;确认效果后再按需放量,可关注 文档智能特惠 的文档抽取(Agent 版)固定价格低折扣档位。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。