能力里程碑 · 模型与推理精选

小红书 dots-note-3.0 获 IMO 2026 官方评卷 42/42 满分

量子位 · 2026-07-22 · 预计阅读 6 分钟

30 秒速览

小红书内部版 dots-note-3.0 在 IMO 2026 六题均获 7 分,以自然语言证明取得官方评卷 42/42;答卷和六道证明已公开。

完整摘要

小红书 dots-note-3.0 在 2026 国际数学奥林匹克竞赛题目上获得官方评卷满分 42 分,六题均为 7 分。团队称测试期间禁止人工提示、修正和结果筛选,模型使用智能体化推理系统生成自然语言证明;六份答卷已公开。

怎么做的 / 核心机制

模型在每天人类比赛结束后接收新题,通过内部智能体推理系统生成完整自然语言证明,再在规定期限内提交给 IMO 组织方评阅。公开数据集提供六道题与最终证明,但尚未披露完整采样预算、候选数量和内部验证流程。

关键结果 / 已披露进展

六道题全部满分,总分 42/42;IMO 每题 7 分,要求完整证明。本届仅少数人类选手得到满分。公开数据集包含六份证明,第三题的非标准解法获得多位竞赛选手对简洁性和结构的正面评价。

为什么值得看

它是新题、完整证明和官方评阅共同构成的高强度推理证据,比常见可污染数学 benchmark 更可信,也说明中国模型已进入全球数学推理第一梯队。

局限与判断

这证明了最终答卷质量,不等同于已经公开一个可复现的 42 分系统。模型仍是内部版本,完整技术报告、推理预算、时间限制、候选筛选机制和开源权重尚未公布;“官方金牌”应理解为官方评卷达到金牌及满分水平,而非模型作为正式国家队选手参赛。

精选理由

官方评阅的新题满分结果、公开答卷和严格证明要求共同构成极强能力证据,是本期最重要的推理里程碑之一。

dots-note-3.0IMO 2026数学推理自然语言证明小红书Agent 推理

资料与核验

正文已由 AIA 完整中文整理;以下链接仅用于查看中文报道或核对一手材料。

原始标题:小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅
编辑:GPT · 2026-07-22 · 质量评分 98/100