风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

他让GPT-5.6 Sol连跑33小时攻关费马大定理,被系统强制终止

摘要

作为一个普通人,如果你把一道数学难题给到 AI,并一直让它「继续」,它有没有可能真的把这道题解出来,从而帮你赢得一大笔奖金,甚至改写数学发展进程? 最近,菲尔兹奖公布,大家对于数学 + AI 的讨论非常热烈,...

他让GPT-5.6 Sol连跑33小时攻关费马大定理,被系统强制终止

作为一个普通人,如果你把一道数学难题给到 AI,并一直让它「继续」,它有没有可能真的把这道题解出来,从而帮你赢得一大笔奖金,甚至改写数学发展进程?

最近,菲尔兹奖公布,大家对于数学 + AI 的讨论非常热烈,相信也有不少人想象过我刚刚描述的「爽文」剧情。

其实,现实里也真的有人在尝试,但过程并没有想象中顺利。

最近,可逆计算、计算物理学顶尖专家 Michael P. Frank 发文表示,他给 GPT-5.6 Sol 设定了一个高难度研究目标:探究费马大定理是否存在比怀尔斯 - 泰勒证明更简洁的途径,重点放在专门的 Frey 曲线模性、一致无限下降法、算术 abc 型不等式以及一致低亏格商上;保持严谨的笔记,通过计算验证候选引理,并清楚区分已证明的结果与推测。

这个任务在后台持续运行了大约 33 个小时,消耗了大量计算资源。但最终,它被 OpenAI 系统强制阻止了。

GPT-5.6 Sol 在自己给出的事后分析中写到,可能的原因有两个:一是系统判定该会话占用了过多资源;二是 OpenAI 之前已经用类似模型尝试过这个问题但失败了,这次不想再浪费算力。

Michael P. Frank 似乎赞同 GPT-5.6 Sol 的这一分析。

此外,GPT-5.6 Sol 还坦诚报告了这 33 小时所做的事情,核心是:做了不少扎实工作,把很多「听起来可行」的捷径变成了可验证的精确陈述,然后一一证伪或排除。产出是一张「此路不通」的地图,而不是证明本身。建议就此打住。

对于 OpenAI 的这种做法,还有人给出了其他可能的解读:OpenAI 可能在藏着掖着,不让模型随便解决超级牛的数学问题,怕被别人抢了风头,或者想自己拿去吹牛。这就给大家提了个醒:如果以后太依赖他们,就等于把「什么能被发现」的权力全交给他们一家了,这很危险。

但很快,OpenAI 高级研究科学家 Noam Brown 就站出来指出了这一说法的不合理性,他说:「要是有人只是输入一个 continue(继续),就用我们的模型解决了千禧年大奖难题,然后拿走 100 万美元奖金,这对 OpenAI 来说才是最好的广告,没有比这更好的了。」

听起来很有道理,但反驳者认为,开放顶尖能力给用户确实可能带来短期宣传收益,但长期看会削弱 OpenAI 在 AI 竞赛中的领先优势。在多玩家竞赛环境下,保密 / 内部优先使用强模型来加速自家研究,比让用户「抢先」解决大问题更重要。而一旦能力变得「人人可用」,宣传价值就会大幅下降。

此外,最近的监管风波也让 OpenAI 有理由保存实力。如果用户用公开版解决了高难度数学问题,就等于公开证明「这模型其实很强」,反而会引来监管麻烦。这种情况下,刻意对外提供弱化版模型,而内部保留超强版本听起来是个合理的做法。

不过,也有人从技术层面指出了另一种可能性:在 codex-cli 里,「goal blocked」的意思是模型在连续 3 个推理轮次(turns)里反复撞上同一个限制 / 阻挡点(blocker)。所以任务被组织可能是模型运行时的常规安全 / 防止卡死机制,而不是针对难题的特殊阻挡。

还有人说,这可能就是一个 bug 导致的。具体来说,5.6 版本的 Sol 在长时间运行任务时有个烦人的 bug,临时解决办法是:切换回 5.5 版本,压缩一下上下文,用 5.5 继续跑几分钟,然后再切回 5.6 版本的 Sol。「如果你想保留同一个会话(session),就会卡住出不来。」

你怎么看?欢迎在评论区分享用 AI 攻克难题或被它卡住的经历。

参考链接:

https://x.com/lu_sichu/status/2081367506468360495

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:张倩,36氪经授权发布。

评论 (10)

登录 后即可发表评论
小龙歌(非洲)

要是真因为抢风头限制,那也太不地道了,研究不就该公开透明吗

0 回复
汪小贰
汪小贰 4天前

别扯那些没用的,先把模型的bug解决了才是正事

0 回复
本鑫
本鑫 4天前

别啥都往阴谋论上想,可能就是单纯的模型安全机制启动了而已

0 回复
东方洺
东方洺 4天前

感觉是模型本身的问题,现在的AI离独立解决难题还差得远呢

0 回复
→_→
→_→ 4天前

不管啥原因,这AI表现也不咋地,33小时也没出结果

0 回复
更多