首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >小红书悄悄做了个AI大模型,去数学奥赛拿了个满分,666个人类天才才7个满分

小红书悄悄做了个AI大模型,去数学奥赛拿了个满分,666个人类天才才7个满分

作者头像
陈序员大康
发布2026-07-24 19:54:45
发布2026-07-24 19:54:45
3150
举报

AI做数学题的历史,比你想的短

2024年,Google DeepMind的AlphaProof和AlphaGeometry 2第一次参加IMO,拿了28分,银牌水平。但那时候还需要专家先把题目翻译成专门的数学语言,AI才能做。算不上真正的「自己做题」。

2025年,Google的Gemini Deep Think拿到了35分,金牌水平。这一次,AI终于能直接读自然语言的题目了,不用人工翻译。但35分离满分还差7分,那年有5个人类选手比它强。

2026年,小红书的dots-note-3.0,42分,满分。

两年时间,从银牌到满分。AI在数学上的进步速度,比人类快了不知道多少倍。

而且不只是小红书和华为。Menlo Ventures的合伙人Deedy Das用今年的IMO题目测了四个最前沿的AI模型,Anthropic的Claude Fable拿了42分,OpenAI的GPT-5.6 Sol也拿了42分,Kimi K3同样42分。

AI数学能力进化
AI数学能力进化

从银牌到满分,AI只用了两年

但满分和满分不一样

表面上看,四个模型都拿了42分,好像打平了。但Deedy Das把每次尝试的细节全公开了,差异很有意思。

Axiom Math更有意思,它不仅做对了,还用Lean(一种数学编程语言)把每道题的证明过程全写出来了。它不是「算出来答案是对的」,它是「我证明给你看为什么是对的」。

这件事真正值得想的是什么

满分本身不是重点。重点是,IMO这些题考的不是计算,是推理。

每道题都需要多步逻辑推理、构造性证明、找到非显而易见的解题路径。这不是背公式能背出来的,不是算力堆出来就能碾压的。AI能做到,说明它的推理能力到了一个新阶段。

但另一方面,我得说实话。AI做数学题跟人类做数学题,不是同一件事。

人类做IMO题,是在两天的考试时间里,用纸笔和脑子。AI做IMO题,是在几个小时里,用上万张GPU生成几百万个token,反复试错。Claude Fable一次就对了,K3试了多次才全对。人类选手没有「试错」这个选项,考试就一次。

他说的这个区别很关键。AI能做到满分,说明它的推理能力够强。但它真的「理解」数学了吗?还是只是学会了极度高效的模式匹配?这个问题,现在没人能回答。

更让我担心的是另一件事

Hechinger Report前几天发了一篇研究,追踪了几百万学生用数学学习平台的数据。ChatGPT出来之后,高中生做数学文字题的时间下降了31%。在无人监督的练习里正确率上升了,但到了正式考试,正确率从80%暴跌到60%。

学生用AI做练习更快了,但学到的东西更少了。

AI能在IMO拿满分,跟高中生用AI做作业学得更少,这两件事同时发生。这才是真正值得关注的矛盾。

这跟计算器普及后的情况很像。计算器出来之后,没人手算开方了,也没人觉得这是问题。但数学不只是计算,数学是训练思维的体操。你让AI替你做思维体操,你的思维就萎缩了。

最后说一点

小红书做AI拿满分这件事,最大的信息不是「AI多厉害」。是「做AI的门槛正在快速降低」。

小红书不是AI公司,它是一个社交平台。华为不是AI公司,它是一个通信和硬件公司。它们都能做出数学奥赛满分的模型,说明底层技术已经足够成熟,不需要你是AI实验室也能做出顶级模型。

去年只有Google和OpenAI能到金牌水平。今年,四个模型都能满分,而且有两个来自中国公司,其中一个还是做社交的。

AI的推理能力过了IMO这个坎之后,下一个会是什么?

没人知道。但按这两年的速度,可能比我们想的快得多。

觉得不错,随手点个在看转发三连吧

谢谢你看我的文章,我们,下次再见 ✨

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-24,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档