首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >ConfBench:大模型的「我很有把握」,到底能不能信?

ConfBench:大模型的「我很有把握」,到底能不能信?

作者头像
用户8729876
发布2026-08-08 16:25:27
发布2026-08-08 16:25:27
1240
举报
概述
ConfBench 是首个专门测试「VLM 在文档信息提取时自报的置信度可不可信」的基准。作者用 Augraphy 对 75 份真实发票做 20 种受控退化,把样本刻意推到现有干净基准测不到的「低精度区」,再用 7 个 VLM、3 种输入模态、4 种置信度策略跑出 7 万多条实体级评估。结论:OCR 文本加原图一起喂最准最可信;同厂家模型校准随规模变好,跨厂家参数量却不靠谱。作者还提出 ECARB,把校准直接换算成「能省多少人工审核」——做智能文档处理、需要人机协作路由的开发者值得读。
文章被收录于专栏:智能文档处理智能文档处理

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档