他让GPT-5.6 Sol连跑33小时攻关费马大定理,被系统强制终止
摘要
作为一个普通人,如果你把一道数学难题给到 AI,并一直让它「继续」,它有没有可能真的把这道题解出来,从而帮你赢得一大笔奖金,甚至改写数学发展进程? 最近,菲尔兹奖公布,大家对于数学 + AI 的讨论非常热烈,...
作为一个普通人,如果你把一道数学难题给到 AI,并一直让它「继续」,它有没有可能真的把这道题解出来,从而帮你赢得一大笔奖金,甚至改写数学发展进程?
最近,菲尔兹奖公布,大家对于数学 + AI 的讨论非常热烈,相信也有不少人想象过我刚刚描述的「爽文」剧情。
其实,现实里也真的有人在尝试,但过程并没有想象中顺利。
最近,可逆计算、计算物理学顶尖专家 Michael P. Frank 发文表示,他给 GPT-5.6 Sol 设定了一个高难度研究目标:探究费马大定理是否存在比怀尔斯 - 泰勒证明更简洁的途径,重点放在专门的 Frey 曲线模性、一致无限下降法、算术 abc 型不等式以及一致低亏格商上;保持严谨的笔记,通过计算验证候选引理,并清楚区分已证明的结果与推测。

这个任务在后台持续运行了大约 33 个小时,消耗了大量计算资源。但最终,它被 OpenAI 系统强制阻止了。
GPT-5.6 Sol 在自己给出的事后分析中写到,可能的原因有两个:一是系统判定该会话占用了过多资源;二是 OpenAI 之前已经用类似模型尝试过这个问题但失败了,这次不想再浪费算力。

Michael P. Frank 似乎赞同 GPT-5.6 Sol 的这一分析。

此外,GPT-5.6 Sol 还坦诚报告了这 33 小时所做的事情,核心是:做了不少扎实工作,把很多「听起来可行」的捷径变成了可验证的精确陈述,然后一一证伪或排除。产出是一张「此路不通」的地图,而不是证明本身。建议就此打住。
对于 OpenAI 的这种做法,还有人给出了其他可能的解读:OpenAI 可能在藏着掖着,不让模型随便解决超级牛的数学问题,怕被别人抢了风头,或者想自己拿去吹牛。这就给大家提了个醒:如果以后太依赖他们,就等于把「什么能被发现」的权力全交给他们一家了,这很危险。


但很快,OpenAI 高级研究科学家 Noam Brown 就站出来指出了这一说法的不合理性,他说:「要是有人只是输入一个 continue(继续),就用我们的模型解决了千禧年大奖难题,然后拿走 100 万美元奖金,这对 OpenAI 来说才是最好的广告,没有比这更好的了。」

听起来很有道理,但反驳者认为,开放顶尖能力给用户确实可能带来短期宣传收益,但长期看会削弱 OpenAI 在 AI 竞赛中的领先优势。在多玩家竞赛环境下,保密 / 内部优先使用强模型来加速自家研究,比让用户「抢先」解决大问题更重要。而一旦能力变得「人人可用」,宣传价值就会大幅下降。
此外,最近的监管风波也让 OpenAI 有理由保存实力。如果用户用公开版解决了高难度数学问题,就等于公开证明「这模型其实很强」,反而会引来监管麻烦。这种情况下,刻意对外提供弱化版模型,而内部保留超强版本听起来是个合理的做法。

不过,也有人从技术层面指出了另一种可能性:在 codex-cli 里,「goal blocked」的意思是模型在连续 3 个推理轮次(turns)里反复撞上同一个限制 / 阻挡点(blocker)。所以任务被组织可能是模型运行时的常规安全 / 防止卡死机制,而不是针对难题的特殊阻挡。

还有人说,这可能就是一个 bug 导致的。具体来说,5.6 版本的 Sol 在长时间运行任务时有个烦人的 bug,临时解决办法是:切换回 5.5 版本,压缩一下上下文,用 5.5 继续跑几分钟,然后再切回 5.6 版本的 Sol。「如果你想保留同一个会话(session),就会卡住出不来。」

你怎么看?欢迎在评论区分享用 AI 攻克难题或被它卡住的经历。
参考链接:
https://x.com/lu_sichu/status/2081367506468360495
本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:张倩,36氪经授权发布。
评论 (10)
要是真因为抢风头限制,那也太不地道了,研究不就该公开透明吗
别扯那些没用的,先把模型的bug解决了才是正事
别啥都往阴谋论上想,可能就是单纯的模型安全机制启动了而已
感觉是模型本身的问题,现在的AI离独立解决难题还差得远呢
不管啥原因,这AI表现也不咋地,33小时也没出结果
一直谈监管,再严管下去AI发展都得受限了,这也不是啥好事
这事儿不好说,可能真是为了抢风头,也可能就是模型运行的问题,得再看后续说法
就那么回事,现在AI不稳定也正常,说不定就是个小bug,别大惊小怪的
如果是怕削弱领先优势,那这做法也能理解,商业竞争嘛
说不定就是个意外,等官方再给点消息,现在下结论太早