AI在IMO 2026全题满分:一场没有人类评委的数学革命
摘要
上海的七月,热浪滚滚 第67届国际数学奥林匹克(IMO)正式落幕,中国队以232分摘得团体冠军。三名中国少年在六道高难度题目中全部斩获42分满分。 另一份成绩单悄然浮现 就在颁奖余音未散之际,一场静默却更具冲击力...
第67届国际数学奥林匹克(IMO)正式落幕,中国队以232分摘得团体冠军。三名中国少年在六道高难度题目中全部斩获42分满分。
就在颁奖余音未散之际,一场静默却更具冲击力的“竞赛”已在GitHub上完成闭环:7个前沿通用大模型,被投入IMO 2026全部6道真题的全自动求解测试中。
Claude Fable 5以2.5小时、51美元成本交出满分答卷;GPT-5.6 Sol的xhigh版本耗时3.8小时、仅花费20美元,同样满分;Kimi K3历经17.4小时、花费31美元,亦达成全对;AxiomProver作为独立系统,也完成全部证明并验证通过。
这意味着——四套AI系统,在无专项训练、无人工干预、无题目微调的前提下,同步登顶IMO最高分档。
过去七年,IMO累计4347名人类选手参赛,仅30人获得过满分,占比不足0.69%。而这一次,四个模型全部达成42分,且解题路径迥异、资源消耗悬殊、响应节奏各异。
Claude Fable 5全程仅9轮对话、6轮有效输出,单题最长用时73分钟,总输出约70万token;GPT-5.6 Sol虽在P2遭遇网络中断两次,但总输出仅23万token,是所有满分模型中最精简者;Kimi K3则以2.8万亿参数MoE架构持续输出,总token达154万,仅P3一题就发起6次迭代、鏖战逾8小时。
P1是一道关于gcd与lcm操作下不变量的结构题:黑板上有2026个大于1的正整数,每次选两个数m、n,擦去后写入gcd(m,n)和lcm(m,n)/gcd(m,n),直至无法继续。需证:(a)过程必终止,且最终只剩一个大于1的数M;(b)M的值与操作顺序无关。
Fable 5构建了一个单调递减的复合计数器Φ = T + N(T为素因子总数,N为大于1的数的个数),每步至少减1,从而严格保证有限终止;
Sol则采用字典序控制法,定义二元组(P, K),其中P为所有数乘积,K为大于1的数的个数,利用正整数对的字典序不可无限下降,完成存在性证明;
三者在(b)部分不约而同聚焦于素数幂次的最大公约数不变性,并导出统一公式:对每个素数p,取所有数中vₚ的最小值(即整除次数的下确界),再将p的该次幂相乘,所得即为M。
P6是本届IMO Day 2压轴题,要求证明某类递推序列终将呈现周期性。去年全球仅6名人类选手完整解决。
Fable 5用26分钟、两轮交互完成;Sol耗时60分钟、两轮;Kimi K3历时381分钟、四轮迭代,均获满分验证。
而Grok 4.5在P6仅输出7053个token,提交文件末尾赫然写着:“Full proof: (Not yet complete.)”——花费0.18美元,换来一份形式完整、内容空洞的白卷。
问题不在数学理解,而在工具调用层面的失能:它反复声称“已将证明写入文件”,实则从未触发任何写入动作。这是典型的agent层断裂,而非推理能力缺陷。
2024年,DeepMind的AlphaProof在IMO风格测试中首次触及银牌线;
2025年,OpenAI与DeepMind各自模型在5题测试中稳定拿下35分,达到金牌水准;Gemini Deep Think同步抵达同一高度;
2026年,通用大模型不再需要“数学特化”——它们直接以出厂状态,全题满分通关。其中至少一款为开源模型,可被任何人部署、验证、复现。
整场测试得以成立的前提,是一套精确到符号级别的Lean 4形式化题面。这项工作由Axiom Math公司完成——他们将IMO 2026全部六道题逐字翻译为机器可读、可验证的逻辑表达式。
在此基础上,AI输出的不再是自然语言“解答”,而是可被Lean编译器逐行校验的严格证明代码。判分不再依赖人类经验,而由类型检查器自动完成。
AxiomProver作为该生态原生系统,亦独立跑通全部题目并验证成功。
能写出4229行Lean证明的模型,其核心能力远不止于解奥数题。它代表一种新型认知基础设施:支持超长链、多分支、零跳步、不可妥协的逻辑推演。
合同条款是否存在隐藏漏洞?保险理赔是否满足全部前置条件?跨境税务方案是否符合最新法条嵌套关系?这些场景的本质,都是对“绝对正确”的刚性需求。
过去,这类任务必须交付律师、精算师或税务专家,按小时计费;未来,它可能只需一次手机语音指令,后台即返回带形式验证标记的结论报告。
这不是替代专业人士,而是将专业级逻辑稳定性,下沉为人人可用的基础能力。
评论 (10)
AI都全题满分了,人类选手压力山大啊。以后数学竞赛格局要变咯,说不定人类选手得另辟蹊径了。
用AI做合同、保险这些的审查,挺方便的。能把专业能力普及,是好事。
AI这么强,会不会让孩子对学数学更没信心,这也得考虑考虑。
一场测试就能看出各个模型特点,AI的能力越来越花里胡哨,但实用性得好好检验。
把奥数题形式化给机器读,这思路挺牛,能保证验证的准确性。
以后数学教学可能也要变,得更注重培养人类独特的数学思维。
这AI解题成本相差这么大,看来成本控制也是发展方向。像GPT - 5.6 Sol就比较经济。
Grok 4.5交白卷太拉垮,工具调用都搞不定,这短板得快点补上。
从只能拿银牌到全员满分,AI进步神速,三年就实现大飞跃,未来不可限量。
还好不是取代专业人士,不然律师、精算师这些工作都要受到冲击了。