跳转到主要内容

小红书AI拿下IMO满分:中国大模型首夺奥数金牌,第三题解法让冠军直呼优雅

国际数学奥林匹克竞赛(IMO)向来是检验顶尖数学能力的试金石。今年第67届IMO的成绩刚刚出炉,一个令人瞩目的名字出现在金牌榜单上——不是某个天才少年,而是小红书的大模型dots-note-3.0。它拿下了满分42分,成为中国首个获得IMO官方金牌认证的大模型。

要知道,IMO可不是普通的数学考试。这项赛事每年汇聚全球最顶尖的高中生,如今的菲尔兹奖得主中有一半都曾是IMO的参与者。比赛分两天进行,每天3道题,每道题限时4.5小时,涵盖代数、组合、几何和数论。每道题7分,总共42分,而且要求给出逻辑严密的完整证明,每一步都要经得起推敲。对大模型来说,这简直是“地狱级”挑战。

Image

谷歌的Gemini是个不错的参照。2024年它首次参赛时拿了28分(银牌),而且需要把题目翻译成Lean等形式语言,有些题要花好几天才能解出来。到了2025年,Gemini Deep Think终于能用自然语言端到端完成证明,在4.5小时内解出5道题,拿到金牌。而这次,小红书dots-note-3.0不仅全部答对,还比金牌线(29分)高出整整13分。今年的金牌线比去年低了6分,说明题目难度明显增加,满分成绩的含金量更足。

满分背后,首先证明的是Agentic推理系统的稳定性。模型得理解自然语言条件,识别关键信息,提出中间结论,再组织成完整证明。任何理解偏差或推理跳跃,都会被阅卷人直接指出。dots-note-3.0能在六道不同类型题目上全部拿分,说明它的表现不是靠运气。更重要的是,它直接用自然语言处理问题,从理解到表达形成完整闭环,这体现的是可迁移的通用推理能力。

Image

在具体解题过程中,dots-note-3.0采用了Agent方法,结合自然语言和Python代码执行来推理求解,同时还用递归自我批评来审查自己的论证。真正让人惊艳的是第三题——一道组合博弈题。常规解法是把原问题转化为图连通性问题再证明,但dots-note-3.0另辟蹊径,用归纳法抓住了问题最本质的结构,设计了恰当的归纳对象和命题。

两位CMO金牌得主给出了极高评价。李汉佐说这个解法“正确而优雅,结构紧凑,逻辑自然,在IMO解答中属于比较简洁优雅的一类”。王千桐则感叹:“清晰直接,直击本质,每一步逻辑都站得住脚,但人类选手很难想到从这个角度切入。”

对小红书来说,IMO满分是一次重要的技术亮相。此前公众对它的技术认知主要停留在内容社区、推荐算法和内容理解上,没有公开权威的证据证明其在基础模型领域的地位。IMO满分不一样——42分就摆在那里,不需要复杂解释,足以证明小红书现在拥有了值得业界认真对待的基础模型能力。据报道,dots-note-3.0很快就会开源。

Key Points

  • 小红书大模型dots-note-3.0以满分42分夺得IMO金牌,是中国首个获此认证的大模型
  • 今年金牌线29分,比去年低6分,题目难度显著增加,满分含金量更高
  • 第三题解法被CMO金牌得主盛赞“正确而优雅”,思路独特,人类选手难以想到
  • 满分成绩证明了Agentic推理系统的稳定性和通用推理能力
  • dots-note-3.0即将开源,标志着小红书在基础模型领域的重要突破