小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> # 小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅 _[鹭羽](https://www.qbitai.com/author/luyu "由 鹭羽 发布")_ 2026-07-22 08:34:33 来源:[量子位](https://www.qbitai.com) 中国大模型首次获得IMO官方金牌水平认证 > 鹭羽 发自 凹非寺 > > 量子位 | 公众号 QbitAI 哈?小红书你真是闷声干大事啊! 刚刚,**IMO 2026** 成绩新鲜出炉,大模型交卷今年卷到了新高度。 结果第一个拿到官方评卷满分的居然是**小红书** ??? 经IMO官方评定,**小红书大模型dots-note-3.0** ,六道题全部答对,以满分成绩斩获金牌。 含金量有多高呢? 这么说吧,这是中国大模型首次获得IMO官方金牌水平认证,也是继谷歌Gemini模型之后,全球第二个达到该成绩的大模型。 而且划重点!是**满分** !谷歌当年也只答对了5/6…… 震惊了,这还是我印象中的小红书吗? 首次登上世界级竞赛,就来了场开门红~ 再往下深扒,小红书大模型dots-note-3.0的解题方式也让人眼前一亮又一亮: 它**仅用自然语言** 就完成了从读题、解析到写证明的全过程,最终答案不仅全部正确,在部分题目上还创新地提出了**非常规解法** 。 图片由AI生成 双CMO金牌得主**刘涵祚** 看完后这样评价: > 模型最终给出了一条正确且漂亮的证明思路。 > > 这种解法结构紧凑、逻辑自然,即使放在IMO解答中,也属于较为简洁优雅的一类。 CMO金牌得主**汪千桐** 也给出了相似的结论: > 从数学审美的角度看,小红书大模型dots-note-3.0的解答非常漂亮也很优雅。 > > 常规解法已经很巧妙,但dots直接攻克了题目最难、也最本质的部分。 在他看来,dots解题**简洁明了而且直击本质** 。 看完以后,会觉得每一步都顺理成章,但真正拿到题目时,人类选手很难想到能从这个角度切入。 换句话说,IMO满分金牌或许还远不是小红书大模型dots-note-3.0能力的上限。 ## 为什么当前的大模型需要IMO 先来个科普,讲讲IMO究竟是什么,又为何各家都在争先送自家大模型上考场。 IMO又叫**国际数学奥林匹克竞赛** ,每年全世界最顶尖的中学生云集于此。 陶哲轩等几乎半数当代菲尔兹奖得主都是从IMO出来的,谷歌联创Sergey Brin也拿过IMO金牌。 比赛一般分两天进行,每天4.5小时需要完成3道题,总计6道题,覆盖代数、组合、几何和数论四个方向。每题7分,满分42分。 但光有答案还不算数,参赛者要想拿分,必须写出逻辑完整、能接受逐步审查的证明过程。 这对大模型来说,难度极高,却也是最直观的能力展示途径。 以**Gemini** 为例,2024年谷歌首次挑战IMO,最终只拿到28分的银牌水平,彼时系统也还需要先将自然语言题目翻译成Lean等形式化语言,部分题目耗时甚至长达数天。 第二年卷土重来,Gemini Deep Think直接以自然语言端到端完成证明,用4.5小时就解决了5道题,获得金牌。 这背后是一次跨代的能力跃迁。 往深了说,数学就是大模型智力与推理能力的试金石,大模型在IMO这类数学竞赛中走得越远,越能说明其底层优势。 再举个最近的例子,就在本周,**Fable 5** 参与构造了一个雅可比猜想反例。 该猜想自1939年提出以来悬而未决长达87年,连张益唐等顶尖数学家都曾在此折戟。 这次找到的反例虽尚未经过正式同行评审,但也标志着大模型现阶段的能力足以参与真正的数学发现。 而数学竞赛,正是模型进入科研深水区之前,那道最硬核的能力门槛。 除此之外,IMO还有一个相比Benchmark得天独厚的优势——**未知** 。 每届比赛的赛题都是由专家命制,在正式比赛前严格保密。 也就是说,模型不可能提前拿到原题,实时参与当届比赛,也能够确保模型无法提前进行针对性训练。 一位头部模型研究员对此给出了这样的判断: > 在今天的模型训练里,你基本可以认为,互联网上一旦出现了某些数据,很快就会被模型拿去训练,模型也就知道了。 > > 所以如果要测试一个模型到底聪不聪明,**只能测一些没有公开过的东西** 。 这恰是同步参与官方IMO测评之于大模型最难复制的价值。 它考验的不是模型记住了多少题目和数学知识,而是在一个真正未知的问题第一次出现时,模型能否独立理解、探索,并最终完成严密推理。 而且只有新题还不够,官方评测采用的是严格的当届赛事流程。 每个比赛日的学生考试结束后,模型团队才会收到当天题目,并须在规定期限内提交PDF答卷。 模型将直接阅读英文题目并生成证明,工作人员只负责保障系统运行。 最终答卷则由来自不同国家的IMO评审员,按照正式标准进行审阅。 **本届新题、规定时间、完整证明、第三方专业评审** ,当这些条件同时成立,才让IMO成为现下很难靠背题和包装绕过去的能力大考。 ## 一分没丢,比拿到金牌更难 正因如此,这次小红书大模型dots-note-3.0能拿到金牌,还是满分,就显得格外醒目。 六道题全部做对,首先证明的是**Agentic推理系统稳定性** 。 模型需要读懂自然语言条件,判断哪些信息真正关键,提出可能成立的中间结论,再将它们组织成一套完整证明。 整个过程中,任何一个条件被误读、任何一次推导跳步,都会留下可以被评审直接指出的漏洞。 小红书大模型dots-note-3.0能够在六类不同问题中连续拿满,意味着它的表现并非依赖某一道题上的偶然灵感迸发。 其次,小红书大模型dots-note-3.0直接一步到位,使用自然语言端到端处理,也意味着模型能够像人类选手一样直接读懂题目、自主寻找路径,具备从问题理解到答案表达的完整闭环。 它代表模型拥有**可迁移的通用推理能力** 。 具体来说,在本次答题过程中,小红书大模型dots-note-3.0用**智能体** 的方式,让模型使用自然语言结合python代码执行来推理解题。 在推理过程中,也会借助递归自我批判能力,审视自己的论证,从而解决更多现实中的复杂任务。 图片由AI生成 不过,让人真正感到惊喜的,还是第三题传递出的**模型创新思维** 。 这是一道组合博弈问题,网上关于本届IMO赛题讨论的常见解法,是先将原问题转化成图论中的连通性问题,再借助图论语言建立证明。 这条路线本身已经非常巧妙,但小红书大模型dots-note-3.0没有沿用它,而是转用**归纳** 。 小红书大模型dots-note-3.0的解法,**抓住了问题最本质的结构** ,设计出了恰到好处的归纳对象与归纳命题。 这也解释了,为什么CMO得主汪千桐会用漂亮和优雅来形容这套答案。 小红书大模型dots-note-3.0对问题结构的剖析之深,会让人自然而然产生一种恍然大悟的感觉。 回到结果本身上,模型能够在本届拿下满分,其实相当不易,我们可以从以下几个层面来看。 **第一层,本届整套赛题的得分难度明显高于去年。** 2026年IMO金牌线为29分,去年则高达35分,短短一年,金牌线下降了6分,几乎是一整道题的分数。 所以这一届的金牌,较之去年的Gemini,分量更重。 **第二层,满分与金牌之间亦有差距,今年整整相差13分。** 29分意味着,选手完整解决4道题,再从剩余两道题中拿到1分,就已经能够进入金牌区间。而小红书大模型dots-note-3.0全部all in,直接抵达了这套试卷能够衡量的最高点。 毕竟老话说得好,满分只是卷面的上限,不是它的上限。 金牌的确代表进入了全球最顶尖的一批,但满分则代表在这批顶尖选手中,再完成一次极小概率筛选。 ## 小红书大模型dots-note-3.0即将开源 选择**IMO** 作为起始站,也是小红书非常聪明的一步。 如今行业内,想要把大模型底层技术能力推广出去,一般是两个方向,一个是**Coding** ,另一个就是**数学** 。 原因也很简单,这两种任务的结果,都很难靠语言包装蒙混过关,相比知识问答和主观评测,它们更直接地考查模型能否真正理解复杂问题、拆解任务并持续推进。 IMO更是其中的佼佼者,知名度高、业内认可度也够,直接给到的是模型面对高难度未知问题时,所展现出的深度推理能力。 所以对小红书而言,这是**一次重要的技术亮相** 。 过去,外界对小红书的技术认知,更多集中在内容社区、推荐算法和内容理解上。 在**基础模型** 领域,小红书究竟处于什么位置,一直缺少一份足够公开权威,而且不需要复杂解释的成绩单。 参数规模很难直接等同于能力,常规Benchmark上的几个百分点,也难让行业形成鲜明认知。 IMO满分不一样,42分就摆在那里,足以证明,**小红书已经具备值得行业认真审视的基础模型能力** 。 它用一枚IMO满分金牌,让行业第一次看清了自己的技术成色—— 基础模型领域,出现了一个值得关注的**新玩家** 。 P.S.对应模型即将开源~敬请期待 _版权所有,未经授权不得以任何形式转载及使用,违者必究。_ [IMO](https://www.qbitai.com/tag/imo) [小红书](https://www.qbitai.com/tag/%e5%b0%8f%e7%ba%a2%e4%b9%a6) * [全球首个!银河通用新框架仅需人类视频即可部署,特斯拉蚌埠住了](https://www.qbitai.com/2026/07/451403.html "全球首个!银河通用新框架仅需人类视频即可部署,特斯拉蚌埠住了") _2026-07-16_ * [估值4800亿,DeepSeek火速开启新一轮融资!最快明年IPO](https://www.qbitai.com/2026/07/450101.html "估值4800亿,DeepSeek火速开启新一轮融资!最快明年IPO") _2026-07-15_ * [Claude Code砸的坑,蚂蚁安全在尝试填上](https://www.qbitai.com/2026/07/448925.html "Claude Code砸的坑,蚂蚁安全在尝试填上") _2026-07-13_ * [只剩7天!第三届蚂蚁InTech奖申报即将截止,图灵奖得主坐镇评审](https://www.qbitai.com/2026/07/447846.html "只剩7天!第三届蚂蚁InTech奖申报即将截止,图灵奖得主坐镇评审") _2026-07-11_ ### 相关阅读 [ ](https://www.qbitai.com/2025/08/316723.html) #### [小红书提出首个社交大模型:八大社交任务平均提升14.02%](https://www.qbitai.com/2025/08/316723.html) 采用三阶段训练策略 [时令](/?author=47848)2025-08-01 __[小红书](https://www.qbitai.com/tag/%e5%b0%8f%e7%ba%a2%e4%b9%a6) [ ](https://www.qbitai.com/2023/11/101471.html) #### [陶哲轩支持!AI奥林匹克数学奖来了,奖金500万美元,寻找能得IMO金牌的大模型](https://www.qbitai.com/2023/11/101471.html) PK人类数学天才 [丰色](/?author=36)2023-11-28 __[IMO](https://www.qbitai.com/tag/imo) [大模型](https://www.qbitai.com/tag/%e5%a4%a7%e6%a8%a1%e5%9e%8b) [ ](https://www.qbitai.com/2025/02/251451.html) #### [谷歌AI解决IMO中84%的几何问题,o1一道没做对!Nature:AI已超过金牌得主平均水平](https://www.qbitai.com/2025/02/251451.html) 与顶级人类选手相当 [梦晨](/?author=32)2025-02-08 __[DeepMind](https://www.qbitai.com/tag/deepmind) [IMO](https://www.qbitai.com/tag/imo) [数学](https://www.qbitai.com/tag/%e6%95%b0%e5%ad%a6) [ ](https://www.qbitai.com/2020/10/18881.html) #### [微软AI要参加IMO竞赛!小目标:数学金牌](https://www.qbitai.com/2020/10/18881.html) 今年,可能是最后一届“纯人类”参赛的IMO [贾浩楠](/?author=23)2020-10-03 __[AI](https://www.qbitai.com/tag/ai) [IMO](https://www.qbitai.com/tag/imo) [数学](https://www.qbitai.com/tag/%e6%95%b0%e5%ad%a6) [ ](https://www.qbitai.com/2023/06/63032.html) #### [CVPR2023|小红书提出 OvarNet 模型:开集预测的新SOTA,“万物识别”有了新玩法](https://www.qbitai.com/2023/06/63032.html) [量子位](/?author=19)2023-06-21 __[小红书](https://www.qbitai.com/tag/%e5%b0%8f%e7%ba%a2%e4%b9%a6) [ ](https://www.qbitai.com/2021/02/21762.html) #### [一位华裔复活了美国奥数国家队:掌舵6年4次夺冠,打破中国队“垄断”](https://www.qbitai.com/2021/02/21762.html) 出身于数学世家 [鱼羊](/?author=16)[白交](/?author=24&nid=21762)2021-02-18 __[IMO](https://www.qbitai.com/tag/imo) [奥数](https://www.qbitai.com/tag/%e5%a5%a5%e6%95%b0) [罗博深](https://www.qbitai.com/tag/%e7%bd%97%e5%8d%9a%e6%b7%b1)