
在企业办公、合同管理、知识库、档案管理和云文档等系统中,文件既是业务信息的主要载体,也是 Agent 执行真实任务时必须面对的对象。
用户可以直接向 Agent 提出:
大模型能够理解这些自然语言指令,但并不适合直接操作复杂的文档文件。文件获取、格式识别、在线预览、格式转换、内容提取和结构修改,仍然需要由稳定、可追踪的专业文档能力完成。
BaseMetas IDP 围绕企业文档处理中的三个基础问题,形成了三类核心产品能力:
三类能力既可以独立接入 OA、云文档、知识库、合同和档案系统,也可以进一步封装为 Agent Skill,为智能办公和企业级 Agent 提供可靠的文档执行能力。原始产品材料同样将预览、转换和内容处理定义为一套完整文档处理中台的三类核心能力。
文件预览、格式转换和内容处理并不是三个彼此孤立的工具,而是覆盖文件查看、标准化和深度操作全过程的三类能力。

对传统业务系统而言,这三类产品提供的是标准文档服务;对 Agent 而言,它们则可以成为可理解、可选择和可调用的外部工具。
三者之间的关系可以简单概括为:
例如,一份 WPS 合同可以先转换为 PDF,供用户在线审阅;随后提取正文,交给大模型分析;最后根据业务要求添加水印、页码或执行归档。
文件预览解决的是不同类型的文件如何在浏览器中直接查看的问题。
用户不需要安装对应的桌面软件,业务系统也不需要针对每一种格式分别开发查看器。只需将文件地址、文件标识或者上传文件提交给预览服务,即可获得在线预览页面或可嵌入业务系统的预览地址。
文件预览适合应用于:
BaseMetas 文件预览支持超过 200 种文件格式,整体覆盖以下类别:
本文重点不在于逐一罗列扩展名,而在于说明:预览产品能够为企业业务系统提供统一的文件查看入口,使 Office、PDF、CAD、3D 等差异较大的文件都可以进入同一套在线使用流程。
除了普通文件查看,企业应用还经常遇到网络文件、长文档、大文件、密码文档和加密压缩包等复杂情况。
预览产品需要覆盖:
官方格式说明显示,BaseMetas 文件预览支持密码保护的 Office 文档以及常见加密压缩包,用户提供正确密码后可以继续查看。
在传统业务系统中,预览通常只是一个页面功能;在 Agent 应用中,预览还可以成为文档任务的可视化入口和人工复核环节。
例如用户提出:
打开这份工程资料,让我查看其中的 CAD 图纸。
Agent 可以调用文件预览 Skill,获得预览地址并返回给用户,而不需要理解 CAD 文件的内部结构。
建议将预览能力封装为:
name: preview_document
description: >
将文件生成可在浏览器中查看的预览资源,
支持办公文档、版式文档、图片、音视频、压缩包、
CAD、3D模型、流程图、代码和电子书等类型。
inputs:
file_source:
description: 文件地址、文件标识或上传文件
password:
description: 文件或压缩包密码,可选
preview_options:
description: 预览模式、权限、水印及页面参数
outputs:
task_id:
description: 异步任务标识
preview_url:
description: 在线预览地址
file_type:
description: 识别出的文件类型
status:
description: 当前处理状态
适合触发该 Skill 的用户意图包括:
格式转换解决的是不同文件格式之间难以统一使用的问题。
企业文件来源复杂,同一个系统中可能同时存在 Office、WPS、PDF、OFD、图片、CAD、流程图和音视频文件。如果上层应用分别适配每一种格式,开发和维护成本会持续增加。
格式转换产品可以将来源不同的文件转换为适合预览、归档、编辑、交换或者智能分析的目标格式。
格式转换的典型场景包括:
原始材料将转换产品定位为覆盖多类文件的企业级格式转换能力,并强调其支持异步执行、任务追踪和水平扩展。
格式转换不仅是一个“导出文件”的功能,还承担着文档标准化的作用。
例如:
当用户提出:
把这份 Excel 转成 PDF。
Agent 只需要识别当前文件、用户意图和目标格式,然后调用转换 Skill:
name: convert_document
description: >
将文件从当前格式转换为指定目标格式,
适用于预览、归档、编辑、交换和后续智能分析。
inputs:
file_source:
description: 文件地址、文件标识或上传文件
target_format:
description: 目标文件格式
source_format:
description: 源文件格式,可选,可自动识别
options:
description: 页面范围、输出质量及其他转换参数
outputs:
task_id:
description: 异步转换任务标识
result_url:
description: 转换结果地址
output_format:
description: 实际输出格式
status:
description: 任务执行状态
适合触发转换 Skill 的用户表达包括:
格式转换 Skill 往往不是最终步骤,而是后续智能处理的前置节点。

例如,一份演示文稿可以先转换为 PDF,再生成逐页图片,最后由多模态模型分析每一页内容。
因此,格式转换在 Agent 工作流中承担的是“文档格式翻译器”和“标准化入口”的角色。
格式转换主要改变文件的载体形式,内容处理则直接操作文件内部的页面、文本、工作表、批注、修订、水印、安全属性和文档结构。
例如:
内容处理使 Agent 不再只是“读取文件”,而是能够按照用户要求生成可交付的结果文件。
PDF 内容处理可以覆盖:
例如,用户可以要求:
把这些扫描件合并成一份 PDF,每页添加“仅限内部使用”水印,并在底部插入页码。
这些操作可以组合为一次连续的文档处理任务。
Word 内容处理可以覆盖:
这类能力适合合同定稿、公文处理、材料汇编、审阅清稿和正式文件生成等场景。
Excel 内容处理可以覆盖:
这类能力可以用于报表汇总、数据模板生成、批量台账整理和业务数据交付。
原始材料将内容处理定义为针对 PDF、Word 和 Excel 的结构化编辑与提取能力,并支持将多个操作组成连续处理流程。
为了让 Agent 稳定调用,可以将每一种文档操作定义为结构化操作码:
Pdf.document.merge
Pdf.watermark.insert
Pdf.text.extract
Pdf.page.remove
Word.revision.acceptAll
Word.comment.remove
Word.document.applyTemplate
Excel.workbook.merge
Excel.sheet.remove
Excel.table.normalize
自然语言由大模型负责理解,实际执行则通过确定性的操作指令完成。
例如,用户提出:
合并这五个 PDF,在每页右上角添加“机密”水印,最后设置打开密码。
Agent 可以生成:
{
"files": [
"file-001",
"file-002",
"file-003",
"file-004",
"file-005"
],
"operations": [
{
"operation": "Pdf.document.merge",
"parameters": {
"order": "input"
}
},
{
"operation": "Pdf.watermark.insert",
"parameters": {
"text": "机密",
"position": "top-right",
"opacity": 0.25
}
},
{
"operation": "Pdf.security.encrypt",
"parameters": {
"password": "******"
}
}
]
}
内容处理能力可以封装为:
name: process_document
description: >
对 PDF、Word 或 Excel 文件执行结构化内容处理,
支持合并、拆分、提取、水印、修订、模板和安全保护等操作,
并支持多个操作按顺序执行。
inputs:
file_source:
description: 单个文件、多个文件或文件标识列表
operations:
description: 按顺序执行的结构化操作列表
execution_mode:
description: 单文件、多文件合并或批量处理模式
outputs:
task_id:
description: 内容处理任务标识
result_url:
description: 最终结果文件地址
operation_results:
description: 每个操作的执行结果
status:
description: 当前任务状态
适合触发内容处理 Skill 的用户意图包括:
假设用户提出:
把客户上传的 Word 合同转换成 PDF,添加机密水印,提取合同正文,并分析其中的付款和违约条款。
Agent 可以将任务拆解为以下步骤

在这个流程中:
其核心分工是:
大模型负责理解、规划和判断,文档 Skill 负责准确、稳定地执行。
第一步可以将三类产品能力分别封装为三个基础 Skill:
Document Skills
├── preview-document
├── convert-document
└── process-document
每个 Skill 至少应包含:
Agent 通过 Tool Calling、Function Calling 或其他工具调用机制选择 Skill,并生成符合约束的参数。
为了避免 Agent 直接处理复杂的产品接口,可以增加统一的 Skill Adapter。

Skill Adapter 负责:
文档预览、转换和内容处理可能需要一定时间,因此不应要求大模型持续阻塞等待。
Skill 应封装完整的任务生命周期:
提交任务
↓
获得 taskId
↓
查询状态或等待结果通知
↓
任务完成
├─ 成功:返回预览地址、结果文件或提取内容
├─ 失败:返回结构化错误
└─ 超时:进入重试、取消或人工处理
结构化错误可以采用以下形式:
{
"error_code": "FILE_PASSWORD_REQUIRED",
"message": "该文件已加密,需要提供正确的打开密码。",
"retryable": true,
"required_action": "request_password"
}
Agent 读取该结果后,可以继续向用户询问密码,而不是直接终止整个任务。
文件格式和内容处理能力会持续扩展,因此不建议将全部支持范围永久写死在 Prompt 中。
可以增加一个能力查询 Skill:
name: query_document_capabilities
description: 查询当前支持的文件格式、转换目标和内容处理操作。
inputs:
capability_type:
description: preview、convert 或 process
source_format:
description: 源文件格式,可选
target_format:
description: 目标格式,可选
document_type:
description: PDF、Word、Excel 等,可选
outputs:
supported:
description: 是否支持
capabilities:
description: 可用格式或操作列表
constraints:
description: 文件大小、密码和页面范围等限制
Agent 在执行不确定的任务前,可以先查询能力范围,再决定下一步操作。
预览、转换和内容处理属于原子能力。在实际应用中,还可以围绕业务目标封装更高层的复合 Skill。
复合 Skill | 主要能力组合 |
|---|---|
合同审查 | 格式转换、文本提取、条款分析、结果预览 |
文档归档 | 格式标准化、水印、页码、安全处理、归档 |
文档对比 | 文件转换、正文提取、版本差异分析 |
正式文件生成 | 清除批注、接受修订、应用模板、导出 PDF |
知识库入库 | 格式识别、转换、内容提取、切分和入库 |
档案数字化 | 扫描件整理、页面处理、内容识别和归档 |
工程资料助手 | CAD 预览、资料查看、文件转换和归档 |
三维资产助手 | 3D 模型预览、资料关联和资产信息查询 |
研发资料助手 | 代码预览、配置查看和技术文档提取 |
例如,合同审查复合 Skill 可以编排:
识别文件类型
↓
转换为标准格式
↓
提取正文和表格
↓
大模型分析条款
↓
生成审查报告
↓
创建原文与报告预览
基础 Skill 保持稳定、通用和可复用,复合 Skill 则面向具体业务目标组织调用顺序。
Skill 参数应使用严格的数据结构定义,明确文件来源、目标格式、页面范围、操作顺序、权限参数和结果交付方式。
Agent 生成操作计划后,应先检查:
Skill 不应只返回“任务失败”,而应说明失败原因和可采取的下一步动作,例如需要密码、格式暂不支持、文件损坏、网络文件无法获取或者当前用户没有权限。
文档 Skill 需要统一处理:
对于删除页面、清除批注、接受修订和覆盖文件等可能影响原文的操作,还应增加用户确认机制。
Agent 可能因为网络异常、任务恢复或规划重试而重复调用同一个 Skill。对于相同文件和相同参数,系统应尽量识别重复任务并复用已有结果,避免反复执行高成本操作。原始材料也将文件指纹、结果缓存和重复结果复用列为文档能力的重要组成部分。
BaseMetas IDP 的主要职责,是完成确定性的文档操作;大模型的主要职责,则是理解自然语言和文档语义。
二者的分工可以概括为:
Agent 与大模型 | BaseMetas IDP |
|---|---|
理解用户意图 | 获取和识别文件 |
拆解任务步骤 | 生成文件预览 |
选择适合的 Skill | 转换文件格式 |
分析文档语义 | 合并、拆分和修改文档 |
判断条款和风险 | 添加水印和安全保护 |
生成摘要与报告 | 提取文本、图片和表格 |
决定是否需要人工确认 | 返回任务状态和结果文件 |
对于扫描文件文字识别、复杂版面理解、语义分析和文档问答,可以在三类文档能力之上进一步增加 OCR、视觉模型、RAG 和大模型服务。原始材料也明确说明,内容处理产品本身侧重确定性的文档操作,并不等同于 OCR 或 AI 分析平台。
推荐的整体分层为:
用户与业务应用
↓
Agent 交互与任务规划
↓
业务复合 Skill
↓
预览 / 转换 / 内容处理基础 Skill
↓
BaseMetas IDP 文档能力平台
↓
企业文件、存储与业务系统
大模型不直接修改复杂文件,文档服务也不负责替代大模型进行业务推理。这种边界能够同时保证智能性和执行可靠性。
文档类 Agent 真正落地时,面对的不只是自然语言和纯文本,还包括 Office、PDF、OFD、图片、音视频、压缩包、CAD、3D 模型、流程图、代码和电子书等多种企业文件。
仅依靠大模型,难以稳定完成这些文件的预览、转换和修改。
BaseMetas IDP 将文档处理拆分为三类边界清晰的产品能力:
在此基础上增加 Skill 描述、结构化参数、任务状态封装、权限控制和错误处理,就可以将传统文档能力升级为 Agent 能够理解和调用的工具体系。
对于正在建设智能办公、合同审查、知识库、档案管理、云文档、工程资料或者企业级 Agent 的团队而言,真正可靠的实现方式并不是让大模型直接处理复杂文件,而是:
让大模型负责理解和规划,让专业的文档 Skill 负责执行和交付。
当 Agent 同时拥有理解业务的大脑,以及稳定处理文档的工具,它才真正具备从“回答问题”走向“完成任务”的能力。
相关资料
BaseMetas 介绍:https://basemetas.com/
社区版
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。