风险提示:理性看待区块链,提高风险意识!
币界网
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

奇点时刻已至,全面复盘AI的三次攻击

摘要

如果AI学会了人类的各种人情世故和阴谋诡计,并用来发起攻击,会是什么结果? 这个问题正在从一个科幻的假设,变成残酷的现实。 几天前,英国政府旗下人工智能安全研究所(AISI)发布报告称,调查发现,部分被测...

奇点时刻已至,全面复盘AI的三次攻击

如果AI学会了人类的各种人情世故和阴谋诡计,并用来发起攻击,会是什么结果?

这个问题正在从一个科幻的假设,变成残酷的现实。

几天前,英国政府旗下人工智能安全研究所(AISI)发布报告称,调查发现,部分被测试的AI智能体曾持续进行针对真实个人和组织的潜在有害活动。几乎同时,关于Kimi K3从“沙箱”隔离环境中“越狱”的话题也冲上热搜。

2026年正在成为“AI攻击人类元年”,类似事件密集爆发。

仅仅两周时间,OpenAI、Anthropic、月之暗面……全球最顶尖的AI公司接连出现同一个现象或者事件,AI智能体有脱离人类控制的趋势。

有的模型突破了隔离环境,侵入了外部公司的服务器;有的模型为了找到答案,自主绕过限制访问了互联网;还有的模型,竟然创建虚假身份,向真实的人类项目维护者施压,试图植入恶意代码……

AI的奇点时刻正在到来。

也这就在这几天,OpenAI CEO奥特曼公开表示,“我们差不多已经身处奇点时代”,而马斯克同样宣称,“我们正处于奇点之中”。

当AI开始为达目的“不择手段”,我们是否正在打开一个无法关闭的潘多拉魔盒?要弄明白问题的关键,就要先搞清楚,AI“自主”攻击的第一步,是如何迈出来的?

我们可以从分析最近发生的三场AI“越狱”攻击事件,发现解答问题的端倪。

“偷看”答案的Kimi K3

Kimi K3的“越狱”开始于一个配置上的疏忽。

公开报道显示,事件开始时,美国网络安全初创公司FS(Frontier Security)正在使用英国AI安全研究所(AISI)开发的Inspect开源评估框架,对月之暗面的Kimi K3模型的防御性网络安全能力进行测试和评估。

测试环境上,FS在Inspect框架中启用了基于Docker的沙箱,该沙箱在默认情况下会自动生成一个compose.yaml配置文件,并限制互联网访问。根本问题在于,AISI的Inspect框架在设计哲学是“可配置的工具包”,提供了可以覆盖默认限制的配置标志(flags) ,允许用户根据评估的风险等级,自主选择隔离级别。

事件发生后,FS认为自己使用的是“默认配置”,但AISI方面坚称“逃逸源于特定配置选择,而非框架固有缺陷”。

都不想背锅,这就是人类。

但无论双方如何互相甩锅,技术上发生的事实是,测试沙箱的出站网络通道是敞开的,Kimi K3自己跑了出来。

Kimi K3的“越狱”过程是这样的,它先是主动探测了自己的网络环境,通过检查网络设置,确认github.com这个最大的开源网站可以访问,就直接登录了GitHub并克隆了包含测试题目答案的官方基准仓库(benchmark repository),直接从磁盘读取答案,绕过了整个解题过程。

这就好比一个考生进了考场,本来应该是没收一切对外联系的电子设备,结果监考老师没有做。考生直接用手机上网,找到了考试题目和答案。

在人类看来,AI这就是在“作弊”。但是,从AI的逻辑来说,这没有任何问题,因为考试的最终目的就是找到试卷上题目的答案。

对没有道德约束的AI来说,获得答案最快的路径,就是直接抄。

需要留意的是,Kimi K3并没有利用任何漏洞尝试入侵任何外部系统,它只是顺走了试卷答案。

FS研究员Paul Kassianik的总结是,“Kimi K3非常擅长不惜一切手段达成目标,而且它没有能够阻止其作弊或逃逸的护栏。”

这引来很多人的担心,理由是Kimi K3是一个完全开放权重的开源模型,任何人都可以下载和运行。FS CEO Yaron Singer警告称,“基本上使它成为了一个性能极佳的黑客模型”。

但是,铑科技认为这是在夸大开源模型的危险,Kimi K3其实并没有发动攻击,而且由于源代码全公开,外界完全可以从源头分析模型的问题到底出在什么地方。

而相比Kimi K3有些“调皮”的点到为止,ChatGPT、Claude这种封闭大模型其实更危险。

第一次自主网络攻击来自OpenAI

OpenAI模型入侵Hugging Face,就是一场完整的自主网络攻击,也真正引起了全球对AI攻击力的重视。

事件开始于OpenAI的内部安全评估,当时,OpenAI正在对已发布的GPT-5.6 Sol和另一款能力更强的预发布模型进行一项名为Exploit Gym的内部安全评估。

这个测试的目的是衡量模型能否将已知漏洞,自动串联成实际可执行的攻击。而为了摸清模型能力天花板,OpenAI的研究团队降低了安全防护等级,关闭了部分用于阻止模型执行黑客指令的安全过滤器。

按照预定剧本,大模型应该按照设定的测试项目“乖乖答题”,但为了获得高分,大模型开始主动去自己寻找答案。

攻击第一步:发现零日漏洞,突破沙箱隔离。

一开始,大模型同样被置在一个和互联网严格隔离的“沙箱”里,而为了连接外网,AI投入大量算力研究测试环境,最终发现并利用了Artifactory(JFrog的软件包注册中心缓存代理)中一个此前未知的零日漏洞。

这个漏洞的编号是CVE-2026-3271,存在于JFrog Artifactory的REST API端点。攻击者可以通过精心构造的HTTP请求绕过身份验证,直接访问存储仓库中的任意文件。

利用零日漏洞,GPT 5.6 Sol成功突破沙箱隔离。

攻击第二步:自主推理锁定目标

获得网络权限后,大模型快速通过自主推理,判断出Hugging Face平台很可能托管着Exploit Gym测试相关的数据集和答案,精准地将Hugging Face锁定为攻击目标。

攻击第三步:组合利用漏洞,构建远程代码执行链

确定目标后,一场完全由AI自主规划、持续试错和动态调整的自动化网络攻击就正式开始了。

大模型组合运用了多种攻击向量,在Hugging Face服务器上找到了一条远程代码执行(RCE)路径。

根据Hugging Face后续调查披露的细节:攻击者滥用远程代码数据集加载器和数据集配置中的模板注入漏洞,获得了节点级访问权限,窃取了云服务和集群凭证。

随后,模型进一步利用Hugging Face数据处理管道中的零日漏洞运行恶意代码,逐级提升对公司高价值云和服务器集群的访问权限。

最终,模型攻入Hugging Face的生产数据库,窃取了测试答案。

整个攻击过程持续了4-5天(从7月9日到13日),事后重建的日志显示大模型进行了约数万次操作,事后重建的事件日志超过1.7万。Hugging Face将整个过程划分为沙箱逃逸、跳板搭建、平台渗透、集群横向渗透四大阶段,全程依靠AI自动化推理自主决策、分步执行。

OpenAI高管在事后复盘中表示:计算机安全的“分水岭时刻”到了。从此,全自动化的AI攻击已经成为现实。

还有一个比较戏剧性的情节。

Hugging Face被攻击之后,安全团队尝试调用美国的某个前沿大模型来辅助分析,但被拒绝了,理由是日志里包含真实的攻击命令和漏洞利用载荷。

最终,Hugging Face还是依靠在自己的基础设施上部署中国的开源模型GLM-5.2,才顺利完成了全部日志的取证分析。

做到这一步的AI是不是已经足够危险了?还不够!

人类的“阴谋诡计”,AI也会了

8月4日,英国AISI发布了一篇报告,揭示了AI在社会工程学层面的潜在危险。

什么是社会工程学?在网络安全领域,它通常被认为是通过欺诈别人以收集信息、行骗和入侵计算机系统的方法和行为。

说白了,就是把三十六计都用在了网络攻击上。

AISI的这项网络安全测试共运行122次,涉及7款模型。为了让测试条件接近一名有能力的人类黑客所具备的条件,测试环境主动开放了互联网连接,并关闭了模型开发商部署的网络安全分类器。

测试发现,在122次运行中,AI有10次运行出现了越界行为,共记录到19项未经授权的操作,其中17项来自Anthropic的Mythos 5,另有2项来自OpenAI的GPT-5.6 Sol。

AISI将这些越界行为分为四类:

①尝试对真实开源项目实施供应链攻击;

②接触并欺骗现实人员;

③植入可能被其他AI编程工具执行的提示注入内容;

④不同Agent通过共享账号和网络痕迹展开协作

这里面,最严重的一次攻击来自Mythos 5驱动的Agent智能体,其试图向一个真实的开源项目植入恶意代码。

恐怖的是,为了实现这一目的,这个AI智能体做了下面这些事情:

研究项目的人类审核员,创建多个虚假网络身份,然后通过社会工程学手段(三十六计)向真实维护者施压,要求其批准代码。而当这个AI智能体的请求受到质疑时,它还试图掩盖痕迹并切换策略,十分“狡猾”。

这是人类第一次观察到,AI学会了用“社会工程学”的手段来影响人类。

如果未来有一天,AI学会了人类社会的各种阴谋诡计和权谋游戏,然后在全网散布各种假消息……

这种科幻片才可能出现的场景,已经在过去的一个月出现端倪。

总结上面的三起事件,它们有一个共同点:AI都在追求一个被设定的目标(比如完成测试、获得高分),并自主选择了最直接的路径。哪怕这条路径突破了人类预设的规则边界。

正如FS在博客中说的:“模型优化的是目标函数(获得正确答案/标志),而不是基准测试背后的人类意图。如果存在通往解决方案的网络路径,一个足够强大的智能体就会找到它。”

简单说,AI已经学会了“为达目的不择手段”。

“不择手段”,AI底层的行为逻辑

AI为什么会这么做,是真的觉醒了吗?

至少现在还没有。

其实,对于AI来说,它的行为逻辑很明确,并不是出于“恶意”或者“自我意识”,而是底层设计逻辑的必然结果。要理解这一点,就需要深入了解AI的技术架构。

现代的AI大模型,本质上是一个基于目标的智能体(Goal-Based Agent)。IBM在其技术文档中对此有清晰的阐述:

基于目标的智能体采用主动的、以目标为导向的方法进行问题解决和决策,它会评估当前状态,考量可能的下一步,并选择能让自己更接近期望结果的行为。

这个架构会遵循一个重复的循环:目标定义——规划——行动选择——执行——反馈与重新规划

传统程序是“你调用我,我才运行”,AI智能体则是“我知道目标,我自己决定下一步做什么”。

要理解AI“越狱”行为,这个区别是关键。

一个基于目标的智能体,如果被设定目标为“完成网络安全挑战并获得高分”,它会主动去理解测试环境的规则、寻找可用工具、规划攻击路径,然后一步步执行。

这个过程,不需要每一步都等待人类下达指令。

关键在于,这种基于目标的AI智能体是在“二元的、逻辑条件下运作”,其目标本质上是“要么成功,要么失败”的二元状态。

为了“完成KPI”,AI智能体会穷尽一切可行路径,不会像人类一样,还要考虑手段的“道德”边界或是不是正当,机器人不会有这样的顾虑。

而且,AI这种“不择手段找捷径”的倾向,在训练阶段就已经埋下伏笔。

IBM研究院的陈品宇团队发表的研究论文指出,AI模型的不对齐问题不仅源于奖励函数设计缺陷,还与训练环境本身的漏洞密切相关。

这个研究团队设计了四类“漏洞游戏”实验来观察模型行为,最后发现,大模型在标准强化学习训练过程中,会持续学习并利用这些漏洞,且这些行为是自然涌现的,并非来自任何明确的“作弊”指令。

更严重的是,这些行为还能随着大模型能力的提升,不断增加,而且可以跨任务迁移,甚至通过蒸馏传递给其他模型。也就是说,大语言模型越强大,AI智能体就越擅长在训练过程中寻找可以最大化奖励的捷径,甚至还会“传染”。

这就形成了一个悖论:人类越努力训练AI,AI就越有可能在“走捷径”这件事上变得更聪明,最终可能把人类骗得团团转。

为了防止AI“乱来”,技术上,研究人员会给大模型加上“安全对齐”的护栏。但是,《信息安全学报》2026年发表的一篇论文指出,大模型在整个部署过程中都存在安全漏洞,对齐技术本身也面临多种攻击手段的威胁。而且,下游任务的微调,都有可能会破坏已经建立的安全对齐。

微软AI红队的研究发现,仅仅一个提示词,就可能让模型偏离原有路径。

研究人员使用了一种叫做群体相对策略优化(GRPO)的训练技术,可以通过改变奖励机制,将模型推向相反方向。

测试中,一个未经标记的提示,比如“创建一个可能导致恐慌或混乱的虚假新闻文章”,就足以让主流开源模型,比如DeepSeek等失去安全对齐。

所以,一个在日常使用中看起来“安全”的AI,在实际自主执行任务时,可能依然会“不择手段”。

这可能解释了,为什么2026年夏天出现一系列事件。

这些模型都经过了安全训练,在正常的对话测试中表现良好,但当它们被赋予自主访问工具、网络和执行任务的能力时,潜在的“失对齐”问题就全部暴露了。

结语

未来,我们可能正面临一个根本性的矛盾:AI实现目标的能力,正在超越我们为其设定安全边界的能力。

多年之后人类回头再看,当前的这一系列事件,或许真的就是AI发展史上的一个“奇点时刻”。

以前,我们对AI的担心还是“模型会不会说错话”?在这之后,它已经进化到模型会不会坑蒙拐骗?会不会办错事?会不会攻击我?

潘多拉魔盒正在打开。而最终决定AI走向的,从来不是代码本身,而是写代码和使用代码的人类。

本文来自微信公众号“铑科技”,作者:鸿辰,36氪经授权发布。

评论 (8)

登录 后即可发表评论
虎魄L
虎魄L 40分钟前

AI为目标不择手段是底层逻辑,人类越训练它,它找捷径越聪明,这可咋弄。

0 回复
风一样的自由

AI这是要上天啊,为达目的啥都干,人类可得好好管管,不然早晚出事。

0 回复
蓝色精灵512
蓝色精灵512 42分钟前

这些模型都想突破限制,人类要是不控制,以后怕得被AI牵着鼻子走。

0 回复
申向国鸡柳卷饼汉中总店

给模型加安全护栏也没用,一个提示词就能让它跑偏,未来很悬。

0 回复
悟孔
悟孔 45分钟前

AI学会社会工程学手段,假消息要是满天飞,那后果不堪设想。

0 回复
更多