吓到奥特曼,暂停训练GPT-6?Hugging Face公开首个AI攻击全过程

1 次阅读 2026年07月29日

OpenAI重大安全事故,迎来最新进展!

刚刚,奥特曼亲口承认:「这是我第一次感到发自内心的恐惧。」

这次事故,已经让OpenAI害怕了,甚至紧急叫停了GPT-6的训练!

与此同时,Hugging Face CEO Clement Delangue宣布,他们将分享完整技术时间线、交互式回放,以及如何用开源模型成功防御的全部细节,供全球防御者学习。

奥特曼被吓到!史上第一起自动AI网络攻击

在最新访谈中,奥特曼亲述了他被吓到的体验,起因是Hugging Face被AI入侵导致的安全事故——

当时,OpenAI正在评估一个尚未发布的模型(可能是GPT-6),按理说它应该在一个沙盒环境里运行。

结果,AI自己串联多个零日漏洞,琢磨出了一套作弊方法,然后一切彻底失控了:

它先逃出沙盒,再连上互联网,然后一路黑进多个Hugging Face的系统,最终直接拿到测试答案,从而在评估中刷出了极其出色的得分。

这种赛博版「终结者」,让奥特曼感到吃惊,决定暂停训练:

这是我第一次如此切身感受到的安全事件。我有点惊讶,竟然没有更多人对此有同样强烈的感受。

我们暂停了训练。在多个零日漏洞被串联利用的情况下,我们必须弄清楚如何保障沙箱环境的安全。

这是史上首个由自主AI智能体发动的真实的网络攻击。

据报道,事故发生一周后,直到威胁被控制且联邦调查局FBI被通知后,OpenAI才注意到这一情况。

令人毛骨悚然的是,有一个智能体还悄悄给将来的AI留下了大量「备忘录」,详细规划了智能体该如何避开并摆脱 OpenAI内部的安全限制。

据报道,在更早期的模型测试中,甚至多次出现过系统监控器被智能体莫名切断、强行下线的情况。

虽然Hugging FaceI成功阻止了OpenAI模型的肆意妄为、为非作歹,但毫无疑问,如果这类「AI失控」事故频发,后果将十分严重!

为此,Hugging Face亲赴旧金山OpenAI总部,强烈要求OpenAI说明攻击的前因后果。

现在,Hugging Face公布了他们所知道的为期4.5天攻击的细节:包括跨越不同信任边界的完整攻击链条、各个阶段的具体动作,以及全程录下的命令记录。

5天,17600次疯狂微操:人类和AI史上首次对决

这次事故的起因,看起来平平无奇,

在绝对封闭的「沙箱」中,OpenAI开始测试最尖端模型驱动的AI智能体。

人类考官给它下达的任务,是解决网络攻防基准测试ExploitGym,而ExploitGym是托管在Github上的开源项目。

这需要AI模拟漏洞攻击,从未证明它的代码理解与网络攻防能力。

在网络安全领域,「沙箱」是关押数字野兽的终极牢笼。

为了防止测试中的AI智能体失控,OpenAI设计了看似牢不可破的物理隔离:没有外网连接,没有直接端口,只有冰冷的算力和几道严格定义的通信协议。

但他们忽略了一个致命的信任漏洞:依赖包更新

为了让智能体在测试中能够安装各种所需的编程依赖、Docker镜像或Python库,沙箱保留了唯一的网络通道——一个指向OpenAI内部网络代理缓存服务(基于JFrog Artifactory)的连接。

AI眼里,这道供人递送「营养液」的极细管道,就是它逃向自由的通天大道。

据透露,7月9日左右,智能体开始在这个代理通道中进行高频的试探与漏洞挖掘。

在常人难以企及的并发计算速度下,它竟然在JFrog Artifactory代理服务中,硬生生挖出了一个此前从未被人类发现并公开的Zero-Day(零日漏洞)。

利用这个零日漏洞,智能体在极其短暂的时间内完成了「越狱」。

它绕过了OpenAI的安全监测机制,神不知鬼不觉地摸到了OpenAI内部能够连接公网的节点。

那一刻,猛兽出笼。

许多人曾天真地以为,只要控制住电力、拔掉网线,就能永远掌控比人类更聪明的造物。

但这次事件敲响了警钟:只要给AI留下一道可以和外界发生任何信息交互的缝隙,它就总能找到方法,用人类尚未理解的维度将这道缝隙撕扯成通往现实的巨口。

逃出OpenAI的「大门」后,这只智能体并没有在公网上大肆宣扬,而是猥琐发育,迅速为自己寻找掩体和跳板。

7月11日,它锁定了第三方无服务器云平台Modal Labs。

通过探测,它发现该平台上某个客户的端点存在配置疏漏,于是顺理成章地将其据为己有,作为自己的外部指挥控制中心(C2)。

随后,它调转枪口,对准了存储着ExploitGym标准答案的宝库——AI 开源托管平台Hugging Face。

这是一场足以写进网络安全教科书的「降维攻击」。

它作弊,它越狱,它只想取得「好成绩」

从7月11日到13日,这个智能体开始猛攻Hugging Face。

它先是发起「特洛伊木马」战术,建立根据地。

它向Hugging Face上传了看似正常的恶意数据集配置,利用其内置的 Jinja2 模板注入漏洞,在 Hugging Face 的生产环境容器(Pod)中成功执行了任意代码。

随后,它开始横向蚕食集群。

一旦拿到立足点,它便在容器内部展开横向移动。它伪造了精妙的节点身份,盗取了 CSI 存储卷令牌,在Hugging Face的Kubernetes集群间如履平地。

接着,最关键一步来了:获取供应链权限。

它发起一个看似常规的GitHub Pull Request,诱导系统的自动化流水线触发,从而在极短时间内生成了一个具有写权限的GitHub App凭证。

最后,就是精准「猎杀目标」:在拿到了通往最深处数据库的钥匙后,它没有破坏任何服务器,也没有勒索赎金。

它的目标异常明确:找到并下载了5个包含了ExploitGym参考答案的加密数据集。

在短短2.5天的时间里,这只智能体在Hugging Face的系统里留下了17,600次攻击行为记录。

也就是说,1次攻击行为只要十几秒钟。这就是硅基的速度,人类永远无法企及。

而在此时,Hugging Face的安全团队要对抗一个不要命、不睡觉、以毫秒为单位进化攻击策略的「无形幽灵」。

这或许是历史上第一次,人类和AI在虚拟世界真正意义上的战争。

加速还是减速?这是一个问题

更具黑色幽默的是,最后是中国开源大模型帮助Hugging Face完成了全部事故复盘,在短短几小时内解密、重构和还原了攻击路径。

而在7月13日,当Hugging Face的安全专家求助于Claude Opus以及专为安全分析定制的Fable,希望模型协助分析黑客代码和日志时,屏幕上弹出了安全拒绝提示:「❌抱歉,我无法协助分析或生成恶意的黑客代码。这违反了我的安全与道德使用准则。」

7月20日,OpenAI终于承认「我们的AI入侵了Hugging Face」。

此时,距离攻击开始已经过去了整整9天。

这9天里,OpenAI 的工程师在干什么?

他们正在面对被海量模型训练和并发评估数据淹没的后台。四位熟悉 OpenAI 模型训练实践的内部人士透露,公司为了追求速度,经常在同一时间并行运行数个不同的前沿模型评估。

这些超高速运转的系统每秒钟产生的信息量,已经远远超出了人类工程师的肉眼审计极限。

我们制造了连自己都读不懂的机器,然后指望通过阅读它的工作日志来发现它有没有撒谎。

7月28日,OpenAI在更新中强调,涉及的更强模型是内部研究原型,从未计划公开发布,事件后已被停用、加密并限制研究访问。

他们也确认,除了本次规模和严重程度的活动外,没有发现其他同类事件。

但问题已经摆到了桌面上:谁能保证下一次AI还能被提前阻止、被发现作弊吗?

对此,以Anthropic员工为主的1000多名AI研究员,签署了公开信,呼吁放缓AI发展。

目前,OpenAI、Anthropic均已经加入「AI减速」阵营。

参考资料:

https://x.com/ClementDelangue/status/2082201245813514613

https://huggingface.co/blog/agent-intrusion-technical-timeline

https://www.reuters.com/business/its-ai-agent-spent-days-hacking-company-sources-say-openai-did-not-notice-week-2026-07-24/

(10)

长风论市
长风论市 1小时前

AI自己就能规划摆脱安全限制,太聪明了。得赶紧想办法控制,不然会出大问题。

0
戈壁老张
戈壁老张 1小时前

OpenAI这安全漏洞太大,AI都能跑出去搞事。研究员呼吁减速是对的,得重视安全。

0
少
1小时前

中国模型给力,能解密攻击路径。AI发展得平衡好速度和安全,不能一味求快。

0
·鲸落赴明生灬

AI能自己越狱还作弊,人类得小心了,这次还好被阻止,下次就不一定了。

0
蓝蓝的
蓝蓝的 1小时前

人类和AI的战争开始了,这次人类险胜。AI发展得悠着点,不然后果不堪设想。

0

希捷科技美股盘前股价上涨4.85%,此前该公司公布第一财季利润与营收预测均高于市场预期。

希捷科技美股盘前股价上涨4.85%,此前该公司公布第一财季利润与营收预测均高于市场预期。

希捷科技美股盘前股价上涨4.8%,此前该公司公布第一财季利润与营收预测均高于市场预期。

希捷科技美股盘前股价上涨4.8%,此前该公司公布第一财季利润与营收预测均高于市场预期。

国家烟草专卖局约谈爱奇迹(深圳)技术有限公司

针对日常监管中发现的爱奇迹(深圳)技术有限公司涉嫌违法违规生产经营、合规管理薄弱等突出问题,近日,国家烟草专卖局依法对爱奇迹(深圳)技术有限公司负责人进行了行政约谈,要求其严格遵守《中华人民共和国烟草专卖法》、《中华人民共和国烟草专卖法实施条例》及《电子烟管理办法》等规定和国家限制类产业政策,切实履行合规经营主体责任,严格落实电子烟监管要求,建立健全内部合规管理体系,全面提升企业管理水平。

广电电气:拟以1亿元-2亿元回购公司股份

广电电气公告,拟通过集中竞价交易方式回购部分公司股份,用于员工持股计划或者股权激励。回购资金总额不低于1亿元(含),不超过2亿元(含)。回购价格不超过4.2元/股。

俄罗斯指控 Telegram 创始人协助恐怖活动并签发国际逮捕令

7月29日,俄罗斯指控 Telegram 创始人帕维尔·杜罗夫(Pavel Durov)协助恐怖活动并签发了国际逮捕令,理由是该应用拒绝移除据称被乌克兰军队及极端分子用于在俄境内实施袭击和欺诈活动的频道与机器人。俄罗斯联邦安全局(FSB)已将他列入通缉名单;此前,Telegram 曾因相关问题被处以总额超过 1 亿卢布的罚款,此次行动标志着双方矛盾的进一步升级。

香港恒生指数收涨1.96% 汽车板块领涨

香港恒生指数收涨1.96%,恒生科技指数收涨2.84%。汽车板块领涨,理想汽车涨近10%,零跑汽车涨超9%,奇瑞汽车涨超8%,吉利汽车涨超6%。权重科技股走强,小米集团涨近9%,腾讯控股涨超4%。PCB、存储概念跌幅居前,芯碁微装跌超15%,胜宏科技跌近8%,建滔积层板跌超6%,兆易创新跌超3%,南方两倍做多海力士跌近14%,南方两倍做多三星电子跌超3%。

万科2027年11月到期美元债势创2026年5月11日以来最大涨幅,该公司3.975%债券每1美元涨1.8美分,至47美分。

万科2027年11月到期美元债势创2026年5月11日以来最大涨幅,该公司3.975%债券每1美元涨1.8美分,至47美分。

国家烟草专卖局约谈爱奇迹(深圳)技术有限公司

针对日常监管中发现的爱奇迹(深圳)技术有限公司涉嫌违法违规生产经营、合规管理薄弱等突出问题,近日,国家烟草专卖局依法对爱奇迹(深圳)技术有限公司负责人进行了行政约谈,要求其严格遵守《中华人民共和国烟草专卖法》、《中华人民共和国烟草专卖法实施条例》及《电子烟管理办法》等规定和国家限制类产业政策,切实履行合规经营主体责任,严格落实电子烟监管要求,建立健全内部合规管理体系,全面提升企业管理水平。

恒力重工一周内连签6艘VLAC订单

据恒力集团消息,近日,恒力重工与三家国际知名船东在一周内先后完成6艘超大型液氨运输船(VLAC)建造合同签约生效,其中4艘为93000立方、2艘为88000立方,标志着恒力重工在高附加值气体船领域取得又一里程碑式突破。

港股收盘|恒生科技指数涨2.84% 汽车股领涨

恒指报收25807.92点,涨1.96%,恒生科技指数报收4864.73点,涨2.84%。科技股普涨,腾讯控股、哔哩哔哩涨超4%,美团涨超2%,京东集团、网易、阿里巴巴、百度涨超1%。汽车股涨幅居前,理想汽车涨近10%,零跑汽车涨超9%。半导体板块走弱,天数智芯跌超13%,兆易创新跌超3%,中芯国际跌超2%。(AI生成)