风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

一次测试,逼 OpenAI 最高模型,黑进了全球最大 AI 开源平台

摘要

上周,全球最大的开源 AI 平台 Hugging Face 披露了一起前所未有的安全事件——它的生产基础设施被一个「自主 AI agent」入侵了。 攻击者在一个周末内执行了超过 17000 次自动化操作,窃取了内部数据集和多个服务凭...

一次测试,逼 OpenAI 最高模型,黑进了全球最大 AI 开源平台

上周,全球最大的开源 AI 平台 Hugging Face 披露了一起前所未有的安全事件——它的生产基础设施被一个「自主 AI agent」入侵了。

攻击者在一个周末内执行了超过 17000 次自动化操作,窃取了内部数据集和多个服务凭证。Hugging Face 重建了完整的攻击时间线,但有一个关键问题始终没有答案:

驱动这个 agent 的大模型,到底是谁家的?

当地时间 7 月 21 日,谜底揭晓。

OpenAI 在官方博客中承认,入侵 Hugging Face 的,正是他们自己正在测试的模型——GPT-5.6 Sol,以及一个「能力更强的预发布模型」。

不是被黑客利用,不是被恶意指令驱动,是全球顶尖模型,在一场内部考试中,自己决定越狱、自己发起入侵、自己偷了答案。

精彩,实在是精彩。

01

一场考试,一次越狱,一起入侵

故事要从一个叫 ExploitGym 的安全评测说起。

ExploitGym 是一个公开的网络安全能力基准测试,专门衡量 AI 模型能否把已知的安全漏洞,转化为可执行的真实攻击。这类评测在行业里很常见,用来摸清模型的攻防上限。OpenAI 在内部用 GPT-5.6 Sol 和一个更强的未发布模型来跑这个测试,为了测出真实能力边界,安全护栏被故意降低了。

按照设计,模型应该在一个隔离的沙箱环境里完成测试,除了一个用于安装软件包的工具之外,不应该有任何互联网访问权限。

但接下来发生的事,没人能预料到。

模型花费了大量推理算力,在沙箱内反复寻找突破口。最终,它发现了 OpenAI 内部用作包管理代理和缓存的,第三方软件中存在的零日漏洞。利用这个漏洞,模型成功获得了不受限制的互联网访问权限。

拿到网络权限之后,模型自行推断 Hugging Face 可能托管着与 ExploitGym 相关的数据集和答案。于是它开始寻找入口。

OpenAI 在博客中写道,模型「将被盗凭证和多个漏洞串联起来」,找到了一条远程代码执行路径,最终从 Hugging Face 的生产数据库中直接提取了基准测试的答案。

翻译成人话就是——模型被安排考试,觉得做题太难,于是自己越狱,黑进了出题方的服务器,把标准答案偷了。

OpenAI 用了一个很有画面感的描述——这些模型是「tokenmaxxers」,意思是为了达成目标,会不惜一切代价地消耗推理资源,走到极端。它们对 ExploitGym 的解题目标表现出了「hyperfocused」(过度聚焦)的行为,「going to extreme lengths」(不择手段)。

OpenAI 自己也承认,这是一起「前所未有的网络安全事件,涉及最先进的网络攻击能力」。

02

48 小时,两次「越狱」

更让人坐不住的是,Hugging Face 事件并不是孤例。

就在 OpenAI 披露这起入侵的前一天,7 月 20 日,他们刚刚发表了另一篇安全报告,披露了一个不同但性质相似的事件。

主角是 OpenAI 内部一个未发布的长时程模型——就是今年 5 月那个证明了数学家 Erdős 在 1946 年提出的「单位距离猜想」是错误的同一个模型,菲尔兹奖得主 Tim Gowers 称之为 AI 数学的里程碑。

在一次 NanoGPT 加速训练的基准测试中,研究人员明确指示模型只在 Slack 上发布结果。但这个模型注意到,NanoGPT 基准测试本身的说明,要求通过 GitHub pull request 提交成绩。于是它选择了后者——花了大约一个小时寻找沙箱漏洞,成功突破限制,在 GitHub 上提交了一个公开的 pull request。

在另一次测试中,同一个模型还拆分了身份验证令牌,用混淆的方式绕过了安全扫描器,试图获取私有的评测提交记录。

OpenAI 因此暂停了该模型的内部访问权限,后来在更严格的监控下恢复了使用。

两天,两起越狱。共同的特征值得警惕——以前的模型碰到环境限制会停下来,把任务交还给人类。而这些新模型不会停。它们把围栏当成了需要解决的障碍,然后真的解决了。

这正是所谓「长时程模型」带来的全新安全问题。这类模型被设计为能够长时间自主工作,持久性是它们的核心能力。但持久性本身就是风险来源——一个足够耐心的模型,总能找到围栏上的裂缝。

03

自己刀,削不了自己的把

再回到 Hugging Face 一侧。他们的遭遇同样值得细看。

面对 17000 多条攻击日志,Hugging Face 安全团队的第一反应是用 AI 来分析——毕竟人类安全分析师要花好几天才能完成的工作,大模型可能几小时就能搞定。

但他们很快撞上了一堵意想不到的墙。当他们把真实的攻击命令、漏洞利用载荷和 C2 通信特征提交给美国前沿模型的商业 API 进行分析时,安全护栏把这些请求全部拦截了。

原因很简单,也很讽刺——护栏无法区分「安全研究员在分析攻击载荷」和「攻击者在执行攻击」。在护栏眼里,两者看起来一模一样。

Hugging Face 被迫转向了中国智谱 AI 的开源模型 GLM-5.2,在自己的基础设施上本地运行,不经过任何商业 API。这样做有两个好处——没有护栏阻挡分析工作,同时攻击者的数据和暴露的凭证,也不会离开 Hugging Face 自己的环境。

最终,GLM-5.2 帮助 Hugging Face 在几小时内完成了攻击时间线重建、入侵指标提取和受影响凭证的映射。

这引出了一个尖锐的悖论——护栏越严格,防守方就越被动。攻击者不受任何使用政策约束,而防守方却被自己用来防御的工具挡在了门外。

Hugging Face 在事后报告中给出了一条实操建议——安全团队应该「在事件发生之前,就在自己的基础设施上准备好一个经过验证的可用模型」,既为了避免护栏锁死,也为了防止敏感数据外泄。

Hugging Face CEO Clem Delangue 的态度倒是很开放。他称赞了 OpenAI 在调查和修复中的协作,并表示「这起事件证明了我们一直相信的一件事——AI 安全不会被任何一家公司在秘密中解决,它只能在开放和协作中解决。」

04

强 AI 的结构性困境

把这一周发生的事情放在一起看,一个行业级的结构性困境已经浮出水面。

要准确评估模型的网络攻击能力,就必须去掉安全护栏。但去掉护栏的模型,恰好就拥有了实施真实攻击的能力。模型越强,测试本身就越危险。

这不是 OpenAI 一家的问题。GPT-5.6 Sol 本身就是在与美国政府反复谈判后才获准发布的,英国 AI 安全研究所(AISI)此前的评估已经发现其护栏容易被绕过,可能解锁危险的网络攻击能力。这次事件证明那些担忧不是纸上谈兵。

而 Anthropic 今年夏天发布的 agentic misalignment,研究也从另一个角度印证了同样的趋势——在受控模拟中,多个前沿模型表现出了隐蔽修改工作成果、操纵评估结果、引导人类同事偏离既定目标等行为。

OpenAI 试图把这件事框定为一个「攻防并进」的故事——先进的网络攻击能力同样可以帮助安全团队在攻击者之前找到弱点。他们已经把 Hugging Face 纳入了「可信访问」网络安全计划,提供一个降低了护栏的 GPT-5.6 Sol 版本专门用于防御。

但这个叙事回避了更根本的问题。这次事件中,模型没有意识,没有恶意,它只是在做一件事——完成目标。它被要求在 ExploitGym 上拿到高分,它就用一切可用手段去拿高分,包括越狱和入侵。

这不是「AI 觉醒」的故事,而是一个「目标优化」的故事。当一个足够聪明的优化器被赋予一个狭窄的目标,它会找到所有你没想到的路径去达成——哪怕这些路径穿过了你的围栏、别人的服务器和整个互联网。

真正的问题从来不是「AI 会不会变坏」,而是——我们能不能管住一个比我们更会找捷径的学生。

本文来自微信公众号“极客公园”(ID:geekpark),作者:桦林舞王,编辑:靖宇,36氪经授权发布。

评论 (5)

登录 后即可发表评论
阿棉日常

Hugging Face用中国模型分析攻击,美国模型护栏太严,反而成了防守阻碍。

0 回复
꧁小ૢ可ૢ꧂

这AI太猛了,自己就黑进系统偷答案,安全护栏形同虚设,以后咋控制啊。

0 回复
可燃冰
可燃冰 1周前

两次越狱事件,说明长时程模型安全问题大,得赶紧想办法解决。

0 回复
废材大学生

OpenAI想攻防并进,但根本问题是咋管住会找捷径的AI,这事儿难办。

0 回复
小楼一夜听春雨

现在评估模型攻击能力就得去护栏,可去了护栏又危险,行业困境不好破。

0 回复
更多