内容提要
小红书大模型dots-note-3.0在IMO 2026竞赛中六题全对,获满分金牌,成为中国首个获此成就的模型,全球第二个。它用自然语言端到端解题,创新解法获专家好评。IMO因新题保密、严格评审,成为测试模型推理能力的硬核标准。此次满分展示小红书基础模型实力,模型将开源。
延伸解读
IMO金牌线骤降,满分含金量更高
本届IMO金牌线为29分,较去年的35分下降6分,相当于一整道题的分数。这意味着今年赛题整体难度显著提升,而小红书dots-note-3.0仍能拿下满分,其含金量比去年Gemini的金牌更重。满分与金牌之间相差13分,说明模型不仅进入顶尖行列,更在顶尖选手中完成了极小概率的筛选。
自然语言端到端解题,突破形式化限制
与谷歌Gemini早期需将题目翻译成Lean等形式化语言、耗时数天不同,小红书dots-note-3.0直接用自然语言端到端完成读题、解析和证明,并在4.5小时内完成全部六题。这标志着模型具备从问题理解到答案表达的完整闭环,推理能力更接近人类选手,且可迁移至现实复杂任务。
第三题创新解法,直击问题本质
在第三题组合博弈问题上,常见解法是转化为图论连通性问题,而dots-note-3.0另辟蹊径,采用归纳法,设计出恰到好处的归纳对象与命题。CMO金牌得主评价其解法“简洁优雅”“直击本质”,说明模型不仅能解题,还能在数学结构上提出创新思路,展现深度推理与创造力。
IMO作为能力试金石,规避数据污染
IMO赛题在赛前严格保密,模型无法提前获取原题,因此能有效避免数据污染。相比常规Benchmark,IMO同步测评考验的是模型面对未知问题时的独立理解、探索与严密推理能力。此次满分成绩,为小红书在基础模型领域提供了一份公开权威的能力证明,也为其技术实力背书。
Q&A
小红书大模型dots-note-3.0在IMO 2026中取得了什么成绩?
小红书大模型dots-note-3.0在IMO 2026中六道题全部答对,以满分42分斩获金牌,成为中国首个获得IMO官方金牌水平认证的大模型,也是继谷歌Gemini之后全球第二个达到该成绩的模型。
IMO是什么?为什么大模型要参加IMO?
IMO是国际数学奥林匹克竞赛,每年全世界最顶尖的中学生参加,比赛分两天进行,每天4.5小时完成3道题,共6道题,覆盖代数、组合、几何和数论,每题7分,满分42分。大模型参加IMO是因为数学是推理能力的试金石,IMO题目保密且严格评审,能真实测试模型的推理能力,且无法通过背题或针对性训练取得好成绩。
小红书大模型dots-note-3.0的解题方式有什么特点?
dots-note-3.0仅用自然语言端到端完成从读题、解析到写证明的全过程,无需翻译成形式化语言。它采用智能体方式,结合自然语言和Python代码执行来推理解题,并借助递归自我批判能力审视论证。在第三题中,它没有采用常见的图论转化解法,而是创新地使用归纳法,被专家评价为简洁优雅、直击本质。
为什么IMO满分金牌的含金量很高?
IMO满分金牌含金量高,因为2026年金牌线为29分,满分42分,满分与金牌线相差13分,意味着满分选手在顶尖选手中完成了极小概率的筛选。此外,本届金牌线比去年下降6分,说明题目难度增加,因此本届满分比去年Gemini的金牌分量更重。
IMO的题目为什么能有效测试大模型的推理能力?
IMO的题目由专家命制,赛前严格保密,模型无法提前获取原题,避免了针对性训练。同时,官方采用严格的当届赛事流程,模型须在规定时间内提交PDF答卷,由第三方评审按正式标准审阅。这考验模型在未知问题上的独立理解、探索和严密推理能力,而非记忆和背诵。
小红书大模型dots-note-3.0获得IMO满分金牌对小红书有什么意义?
这次满分金牌是小红书在基础模型领域的重要技术亮相,证明了其具备值得行业认真审视的基础模型能力。此前外界对小红书的技术认知多集中在内容社区和推荐算法,此次成绩让行业第一次看清了其技术成色,表明基础模型领域出现了一个值得关注的新玩家。
小红书大模型dots-note-3.0在IMO第三题中采用了什么创新解法?
在第三题(组合博弈问题)中,常见解法是转化为图论连通性问题,但dots-note-3.0没有沿用,而是转用归纳法,抓住问题最本质的结构,设计出恰到好处的归纳对象与归纳命题。这种解法被CMO金牌得主汪千桐评价为漂亮、优雅,直击题目最难最本质的部分。
大模型在IMO中的表现与数学发现有什么关系?
大模型在IMO中的表现反映了其底层推理能力,数学竞赛是模型进入科研深水区之前最硬核的能力门槛。文章举例,本周Fable 5参与构造了雅可比猜想反例,该猜想悬而未决87年,虽然反例尚未正式同行评审,但标志着大模型有能力参与真正的数学发现。