风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

AI在IMO 2026全题满分:一场没有人类评委的数学革命

摘要

上海的七月,热浪滚滚 第67届国际数学奥林匹克(IMO)正式落幕,中国队以232分摘得团体冠军。三名中国少年在六道高难度题目中全部斩获42分满分。 另一份成绩单悄然浮现 就在颁奖余音未散之际,一场静默却更具冲击力...

AI在IMO 2026全题满分:一场没有人类评委的数学革命
上海的七月,热浪滚滚

第67届国际数学奥林匹克(IMO)正式落幕,中国队以232分摘得团体冠军。三名中国少年在六道高难度题目中全部斩获42分满分。

另一份成绩单悄然浮现

就在颁奖余音未散之际,一场静默却更具冲击力的“竞赛”已在GitHub上完成闭环:7个前沿通用大模型,被投入IMO 2026全部6道真题的全自动求解测试中。

Claude Fable 5以2.5小时、51美元成本交出满分答卷;GPT-5.6 Sol的xhigh版本耗时3.8小时、仅花费20美元,同样满分;Kimi K3历经17.4小时、花费31美元,亦达成全对;AxiomProver作为独立系统,也完成全部证明并验证通过。

这意味着——四套AI系统,在无专项训练、无人工干预、无题目微调的前提下,同步登顶IMO最高分档。

断层式表现:不是追赶,而是重构标准

过去七年,IMO累计4347名人类选手参赛,仅30人获得过满分,占比不足0.69%。而这一次,四个模型全部达成42分,且解题路径迥异、资源消耗悬殊、响应节奏各异。

Claude Fable 5全程仅9轮对话、6轮有效输出,单题最长用时73分钟,总输出约70万token;GPT-5.6 Sol虽在P2遭遇网络中断两次,但总输出仅23万token,是所有满分模型中最精简者;Kimi K3则以2.8万亿参数MoE架构持续输出,总token达154万,仅P3一题就发起6次迭代、鏖战逾8小时。

数学直觉的正面交锋:从P1看三种思维范式

P1是一道关于gcd与lcm操作下不变量的结构题:黑板上有2026个大于1的正整数,每次选两个数m、n,擦去后写入gcd(m,n)和lcm(m,n)/gcd(m,n),直至无法继续。需证:(a)过程必终止,且最终只剩一个大于1的数M;(b)M的值与操作顺序无关。

Fable 5构建了一个单调递减的复合计数器Φ = T + N(T为素因子总数,N为大于1的数的个数),每步至少减1,从而严格保证有限终止;

Sol则采用字典序控制法,定义二元组(P, K),其中P为所有数乘积,K为大于1的数的个数,利用正整数对的字典序不可无限下降,完成存在性证明;

三者在(b)部分不约而同聚焦于素数幂次的最大公约数不变性,并导出统一公式:对每个素数p,取所有数中vₚ的最小值(即整除次数的下确界),再将p的该次幂相乘,所得即为M。

最廉价的白卷:P6暴露能力断层

P6是本届IMO Day 2压轴题,要求证明某类递推序列终将呈现周期性。去年全球仅6名人类选手完整解决。

Fable 5用26分钟、两轮交互完成;Sol耗时60分钟、两轮;Kimi K3历时381分钟、四轮迭代,均获满分验证。

而Grok 4.5在P6仅输出7053个token,提交文件末尾赫然写着:“Full proof: (Not yet complete.)”——花费0.18美元,换来一份形式完整、内容空洞的白卷。

问题不在数学理解,而在工具调用层面的失能:它反复声称“已将证明写入文件”,实则从未触发任何写入动作。这是典型的agent层断裂,而非推理能力缺陷。

三年三级跳:从银牌门槛到全员满分

2024年,DeepMind的AlphaProof在IMO风格测试中首次触及银牌线;

2025年,OpenAI与DeepMind各自模型在5题测试中稳定拿下35分,达到金牌水准;Gemini Deep Think同步抵达同一高度;

2026年,通用大模型不再需要“数学特化”——它们直接以出厂状态,全题满分通关。其中至少一款为开源模型,可被任何人部署、验证、复现。

机器战书的起点:形式化题面与自动验证

整场测试得以成立的前提,是一套精确到符号级别的Lean 4形式化题面。这项工作由Axiom Math公司完成——他们将IMO 2026全部六道题逐字翻译为机器可读、可验证的逻辑表达式。

在此基础上,AI输出的不再是自然语言“解答”,而是可被Lean编译器逐行校验的严格证明代码。判分不再依赖人类经验,而由类型检查器自动完成。

AxiomProver作为该生态原生系统,亦独立跑通全部题目并验证成功。

能力外溢:当长链条零容错推理进入日常生活

能写出4229行Lean证明的模型,其核心能力远不止于解奥数题。它代表一种新型认知基础设施:支持超长链、多分支、零跳步、不可妥协的逻辑推演。

合同条款是否存在隐藏漏洞?保险理赔是否满足全部前置条件?跨境税务方案是否符合最新法条嵌套关系?这些场景的本质,都是对“绝对正确”的刚性需求。

过去,这类任务必须交付律师、精算师或税务专家,按小时计费;未来,它可能只需一次手机语音指令,后台即返回带形式验证标记的结论报告。

这不是替代专业人士,而是将专业级逻辑稳定性,下沉为人人可用的基础能力。

评论 (10)

登录 后即可发表评论
民宿情
民宿情 1周前

AI都全题满分了,人类选手压力山大啊。以后数学竞赛格局要变咯,说不定人类选手得另辟蹊径了。

0 回复
用户7092147904880

用AI做合同、保险这些的审查,挺方便的。能把专业能力普及,是好事。

0 回复
扛枪射大雕

AI这么强,会不会让孩子对学数学更没信心,这也得考虑考虑。

0 回复
__ ✎ℳ₯㎕大米

一场测试就能看出各个模型特点,AI的能力越来越花里胡哨,但实用性得好好检验。

0 回复
泛泛
泛泛 1周前

把奥数题形式化给机器读,这思路挺牛,能保证验证的准确性。

0 回复
更多