用户8729876
ConfBench:大模型的「我很有把握」,到底能不能信?
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
用户8729876
社区首页
>
专栏
>
ConfBench:大模型的「我很有把握」,到底能不能信?
ConfBench:大模型的「我很有把握」,到底能不能信?
用户8729876
关注
发布于 2026-08-08 16:25:27
发布于 2026-08-08 16:25:27
124
0
举报
概述
ConfBench 是首个专门测试「VLM 在文档信息提取时自报的置信度可不可信」的基准。作者用 Augraphy 对 75 份真实发票做 20 种受控退化,把样本刻意推到现有干净基准测不到的「低精度区」,再用 7 个 VLM、3 种输入模态、4 种置信度策略跑出 7 万多条实体级评估。结论:OCR 文本加原图一起喂最准最可信;同厂家模型校准随规模变好,跨厂家参数量却不靠谱。作者还提出 ECARB,把校准直接换算成「能省多少人工审核」——做智能文档处理、需要人机协作路由的开发者值得读。
文章被收录于专栏:
智能文档处理
智能文档处理
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
LLM
行业文档识别
算法
大模型部署
#智能文档
#大模型应用
#AI 评测
#LLM
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档