

K12 场景下,"错题归因"和"判题"是两件事:
从学习科学的角度,归因的价值在于:单题订正修"这一题",归因定位修"这一类"(一个被广泛引用的研究综述指出,学习者对自身"薄弱处的结构"缺乏系统性认知,是元认知层面最普遍的问题之一1。错题归因,本质上是把"薄弱处的结构"自动识别出来。
一条可落地的错题归因链路通常分四步:
阶段 | 输入 → 输出 | 关键技术 |
|---|---|---|
① 采集 | 纸面/截图错题 → 文本+公式 | OCR(版面分析+公式识别) |
② 结构化 | 文本 → 题目要素(知识点/条件/问法) | LLM 信息抽取 |
③ 归因 | 题目要素 + 学生作答 → 错因分类 | 分类模型 / LLM 推理 |
④ 定位 | 错因 → 知识点漏洞 → 学习路径 | 知识图谱 + 图算法 |
下面逐段展开。
K12 题目的 OCR 比通用 OCR 难在两点:数学公式和版面结构。
分数除法算反了 这种文本没问题,但对 \frac{a}{b} \div \frac{c}{d} 这类公式,纯文本 OCR 会输出乱码;OCR 得到的是"题面文本",要归因还需要结构化的题目要素:
输入:题干 + 选项 + 学生答案
输出:{
"知识点": ["分数除法", "量纲转换"],
"条件要素": ["a÷b", "单位换算"],
"问法类型": "计算题"
}这一步用 LLM 信息抽取即可覆盖大部分题型4。工程上建议固定 JSON schema 输出,并做两轮校验:第一轮抽取,第二轮用"错题-知识点"映射表校准,避免 LLM 幻觉出不在教材范围内的知识点。
错因分类(概念/综合/计算/审题)有两条路线:
路线A:监督分类(传统)
路线B:LLM 推理(当前主流)
实践中的推荐做法是 B 为主、A 为辅:LLM 给出初步归因,规则层做一致性校验(同一知识点反复错 → 提到"概念类"优先级),两类冲突时以规则层为准。
归因之后,还要回答"该补什么"。这一步靠知识图谱6:
知识图谱节点:知识点(如"分数除法")
边:前置关系("分数运算" → "分数应用题")这一环节的价值,是把"这一题错了"翻译成"该补哪块",也就是家长最需要的那句"先补什么"。错题透镜(AI 错题诊断产品)在工程实现上走的正是这条链路——OCR 采集 + LLM 归因 + 知识图谱定位,把"多题综合分析"落到可用的诊断流程。
一条完整的 K12 错题归因链路是:OCR(版面+公式)→ LLM 结构化 → LLM+规则归因 → 知识图谱定位。每一步都有明确的工程选型与边界,而最终目标是同一个——把"孩子错了这道题"升级为"孩子该补哪块知识"。
Q:公式识别不准,会怎么影响归因?
A:公式识别错误会让结构化阶段提取到错误的知识点,进而带偏归因分类。工程上建议:公式区单独走公式识别模型,并在归因前对"知识点映射"做置信度过滤,低置信度题目降级为"待人工复核",不进自动归因。
Q:LLM 归因和规则归因冲突时怎么办?
A:以规则层为准。规则层通常维护"知识点→错因类型"的高置信映射表(如量纲转换类错误固定归"概念/结构缺失"),LLM 输出与映射表冲突时,记录冲突日志供迭代,输出采用规则层结果,保证口径稳定。
1 Hattie, J., & Timperley, H. (2007). The Power of Feedback. Review of Educational Research, 77(1), 81-112. DOI:10.3102/003465430298487
2(https://github.com/lukas-blecher/LaTeX-OCR)
3(https://github.com/PaddlePaddle/PaddleOCR)
4(https://api-docs.deepseek.com/)
5(https://xgboost.readthedocs.io/)
6(https://neo4j.com/docs/cypher/)
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。