首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI 批改的终点不是打分,是把每道题的错因汇成一张学情表

AI 批改的终点不是打分,是把每道题的错因汇成一张学情表

原创
作者头像
hollyx
发布于 2026-09-24 18:10:04
发布于 2026-09-24 18:10:04
1560
举报

摘要:

试题批改 Agent 返回的字段里,正误、错误类型、知识点与错误坐标比分数更值得用;学情表并不在返回结果里,而要由集成层基于这些字段汇成,聚合的维度决定了它能不能用。按题计费意味着成本随题量走,采购前要先估年用量。

一、分数之外的增量:批改留下了什么数据

一份试卷批完,先被看见的结果是分数。但从教学场景的实际使用来看,分数的增量价值有限——学生知道分数,教师也知道分数,这个数字在被算出来之后,能支撑的决策并不多。

真正影响下一步教学的是什么?是班上多少人错在同一道题、错误集中在哪个类型、涉及哪个知识点、错误发生在解题的哪一步。有了这四类信息,教师才能决定下一节课是重讲概念、还是补练计算、还是只针对几个人单独辅导。而这些信息,恰恰是纯人工批改很难顺手系统化产出的部分——人工能批对,但很难在批对的同时把所有错因按知识点累计成一张表。

所以评估一套 AI 批改方案时,值得看的不是"它能不能判对错、打多少分",而是"它批完之后有没有留下可继续计算的数据"。分数是终点还是起点,决定了这套系统到底只是把人工抄分变成了机器抄分,还是真的减少了后续工作量。

把定位落到具体能力上:试题批改 Agent 面向 K12 全学科(语、数、英),支持单题或整卷的一键上传,自动完成切题、识别、批改、回显的全流程,并输出一批可以继续往下计算的字段。

二、批改返回的字段有哪些

2.1 正误与得分:能直接用的部分

一道题批完,先拿到的判断是正误,以及对应的得分。这两个字段的作用是替代人工判卷中重复度很高的那部分动作——客观题逐题对答案。它们可以直接用于出分、统计平均分和及格率,也是教师快速掌握整体情况的一个入口。

判断质量方面,批改准确率为 89% 以上,切题准确率为 90% 以上,坐标准确率为 91% 以上。这几个数字对应三层不同的能力:切题决定一道题有没有被完整地框出来,批改决定判分对不对,坐标决定结论能不能精确落到卷面位置。

2.2 错误类型与知识点:能用于归因的部分

比正误更有价值的,是错误类型与知识点。批改还支持答案解析,也就是说,一次批改除了知道"这题错了",还能知道"错在哪一类"、"属于哪个知识点"。

这就是错因汇总的原始材料。错误类型回答的是"怎么错的",知识点回答的是"错在什么内容上"。前者用来判断是计算粗心、概念混淆还是理解偏差,后者用来判断是某个章节整体薄弱,还是只有个别知识点没掌握。两类信息交叉之后,才能区分"全班都需要重讲"和"个别学生需要加练"。

2.3 错误坐标:能把结论钉回卷面的部分

错误坐标解决的是另一类问题:教师想看到的不是一行结论,而是原来那张卷面上、学生写的那一步到底错在哪。批改结果可以高亮显示错误步骤位置,靠的就是坐标。

坐标在集成层的实际用法有两种。一是复核,教师点开某个学生的批改结果,直接在原卷图上看到被标出的错误位置,判断这个错误类型下得对不对。二是回显,把原卷、批注、得分叠在同一个视图里展示给学生或家长,比只给一个分数更容易被理解。没有坐标,结论只能以文字列表的形式呈现,"第 3 步算错"这句话对学生来说是抽象的。

三、从字段到学情表:集成层要做什么

学情表并不是在返回结果里现成给出的,而是要基于上一节那些字段在集成层汇成。把这一步想明白,才不会在选型和对接时提错需求。

集成层要做的第一件事是建立题目 ID 与知识点标签的映射。批改返回的是题目维度的信息,而教学决策需要的是知识点维度的视图,中间必须有一层题库数据把题目 ID 翻成知识点,这一步的质量直接决定学情表能不能用。

第二件事是按维度聚合。学生维度看个人错题分布,班级维度看同一知识点的正确率,时间维度看某个知识点连续几次考试的走势。这些聚合都不是一次调用能算出来的,需要把多份批改结果按同一套标签体系累计起来。

第三件事是把异步任务的工程部分补齐。试题批改 Agent 采用异步任务模式,提交任务走 SubmitQuestionMarkAgentJob、查询任务走 DescribeQuestionMarkAgentJob。集成层因此需要维护一张任务表:记录每次提交的 JobId、处理状态与对应的学生和试卷,再按状态轮询取回结果。并发限制为 10 张/分钟,批量批改需要做提交排队,否则请求会积压。

第四件事是把坐标用起来。除了在原卷上高亮,坐标还可以用来还原学生的作答区域,把错题按原始版式重排成个性化的错题集,让学生看到的是自己做错的那道原题,而不是一段被抄录出来的文字。

四、按题计费怎么算账

试题批改 Agent 的计量单位是"题",不是"次"。这一点对成本结构影响很大:一张试卷有多道题,上传一次却会计多次费用。采购前要先按"人均题数 × 份数"估出题量,而不是按上传次数估。

计费方式

规格

价格

折合单价

后付费

按量

0.15 元/题

0.15 元/题

预付费资源包

1000 题

130 元

0.13 元/题

预付费资源包

1 万题

1100 元

0.11 元/题

预付费资源包

10 万题

9500 元

0.095 元/题

预付费资源包

100 万题

80000 元

0.08 元/题

免费额度方面,试题批改 Agent 为 1000 题/用户,首次开通服务时一次性发放,有效期 1 年。资源包同样为 1 年有效期,1 年内未使用完的题数会过期作废。

把题量代进去算一遍。一个 40 人的班级、每人一份 20 题的试卷,一次批改是 800 题,后付费为 120 元。如果每周批改一次,一个月按 4 次计是 3200 题,后付费 480 元;按这个节奏走满一年约 38400 题,后付费口径为 5760 元。同样这个量,按年采购 4 个 1 万题档(共 4 万题)需要 4400 元,折算下来低于按量付费;若为了凑量拆成更小的档位,折算单价会一路走高。所以要不要买包,不能只看包的绝对价格,而要把年用量先估出来,看它能对上哪一档、又会不会用不完。用量还在爬坡、年用量尚不确定时,先用后付费把真实题量跑出来更稳妥。

五、教师复核的位置

最后回到流程里教师的位置。批改结果用于错因汇总和精准教学,不能替代教师对学生学业的最终评价,这既是教育场景一贯的应用口径,也是实际落地中必须保留的环节。

复核可以落在三个具体动作上。一是判定的合理性:错误类型的归因是否符合这道题的实际情况,尤其是同一道题存在多种解法、或者学生用了非标准但正确的思路时。二是主观题的评分:客观题的正误判定相对确定,涉及过程表达、推理完整性的部分仍需教师判断。三是最终认定:进入成绩册、评语、家长沟通的结论,应当由教师确认后再使用。

从工作流看,合理的顺序是先看聚合视图定位薄弱知识点,再抽样点开几份原卷、借助坐标回显核对批改结果,最后确认需要重讲或加练的范围。数据承担的是"把全班错因先归拢起来"的工作量,教师承担的是"判断这份归拢对不对、接下来怎么教"的判断。两者分工清楚,减负才成立。

六、总结

批改的终点不是一次考试的分数,而是把每道题的错因沉淀成可继续计算的数据。当批改结果能被稳定拿到并持续累计,学情分析才从一次性的报表变成日常可用的工具。

如果正在评估落地节奏,不妨先用试题批改 Agent 首次开通即发放的 1000 题免费额度(一年内有效)拿一批真实试卷跑一轮,把错因字段的沉淀链路验证一遍,再比照年用量决定采购形态。确认要放量之后,可对照 文档智能特惠活动 的折扣档位:试题批改 Agent 新用户首单低至 1 折、老用户下单低至 6 折,按实际题量逐档测算更划算。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 摘要:
  • 一、分数之外的增量:批改留下了什么数据
  • 二、批改返回的字段有哪些
    • 2.1 正误与得分:能直接用的部分
    • 2.2 错误类型与知识点:能用于归因的部分
    • 2.3 错误坐标:能把结论钉回卷面的部分
  • 三、从字段到学情表:集成层要做什么
  • 四、按题计费怎么算账
  • 五、教师复核的位置
  • 六、总结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档