
AI做数学题的历史,比你想的短
2024年,Google DeepMind的AlphaProof和AlphaGeometry 2第一次参加IMO,拿了28分,银牌水平。但那时候还需要专家先把题目翻译成专门的数学语言,AI才能做。算不上真正的「自己做题」。
2025年,Google的Gemini Deep Think拿到了35分,金牌水平。这一次,AI终于能直接读自然语言的题目了,不用人工翻译。但35分离满分还差7分,那年有5个人类选手比它强。

2026年,小红书的dots-note-3.0,42分,满分。
两年时间,从银牌到满分。AI在数学上的进步速度,比人类快了不知道多少倍。
而且不只是小红书和华为。Menlo Ventures的合伙人Deedy Das用今年的IMO题目测了四个最前沿的AI模型,Anthropic的Claude Fable拿了42分,OpenAI的GPT-5.6 Sol也拿了42分,Kimi K3同样42分。


从银牌到满分,AI只用了两年
但满分和满分不一样
表面上看,四个模型都拿了42分,好像打平了。但Deedy Das把每次尝试的细节全公开了,差异很有意思。

Axiom Math更有意思,它不仅做对了,还用Lean(一种数学编程语言)把每道题的证明过程全写出来了。它不是「算出来答案是对的」,它是「我证明给你看为什么是对的」。

这件事真正值得想的是什么
满分本身不是重点。重点是,IMO这些题考的不是计算,是推理。
每道题都需要多步逻辑推理、构造性证明、找到非显而易见的解题路径。这不是背公式能背出来的,不是算力堆出来就能碾压的。AI能做到,说明它的推理能力到了一个新阶段。
但另一方面,我得说实话。AI做数学题跟人类做数学题,不是同一件事。
人类做IMO题,是在两天的考试时间里,用纸笔和脑子。AI做IMO题,是在几个小时里,用上万张GPU生成几百万个token,反复试错。Claude Fable一次就对了,K3试了多次才全对。人类选手没有「试错」这个选项,考试就一次。

他说的这个区别很关键。AI能做到满分,说明它的推理能力够强。但它真的「理解」数学了吗?还是只是学会了极度高效的模式匹配?这个问题,现在没人能回答。
更让我担心的是另一件事
Hechinger Report前几天发了一篇研究,追踪了几百万学生用数学学习平台的数据。ChatGPT出来之后,高中生做数学文字题的时间下降了31%。在无人监督的练习里正确率上升了,但到了正式考试,正确率从80%暴跌到60%。

学生用AI做练习更快了,但学到的东西更少了。
AI能在IMO拿满分,跟高中生用AI做作业学得更少,这两件事同时发生。这才是真正值得关注的矛盾。

这跟计算器普及后的情况很像。计算器出来之后,没人手算开方了,也没人觉得这是问题。但数学不只是计算,数学是训练思维的体操。你让AI替你做思维体操,你的思维就萎缩了。
最后说一点
小红书做AI拿满分这件事,最大的信息不是「AI多厉害」。是「做AI的门槛正在快速降低」。
小红书不是AI公司,它是一个社交平台。华为不是AI公司,它是一个通信和硬件公司。它们都能做出数学奥赛满分的模型,说明底层技术已经足够成熟,不需要你是AI实验室也能做出顶级模型。
去年只有Google和OpenAI能到金牌水平。今年,四个模型都能满分,而且有两个来自中国公司,其中一个还是做社交的。
AI的推理能力过了IMO这个坎之后,下一个会是什么?
没人知道。但按这两年的速度,可能比我们想的快得多。
觉得不错,随手点个赞、在看、转发三连吧
谢谢你看我的文章,我们,下次再见 ✨