风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

OpenAI 推出 GPT-Red:用 AI 自动红队测试强化模型安全

摘要

OpenAI 发布 GPT-Red:自动化红队系统正式投入模型训练 OpenAI 近日正式启用一套名为 GPT-Red 的内部自动化红队系统,专用于在模型部署前系统性识别与修复安全漏洞。该系统已深度参与 GPT-5.6 的训练流程,核心聚焦...

OpenAI 推出 GPT-Red:用 AI 自动红队测试强化模型安全

OpenAI 发布 GPT-Red:自动化红队系统正式投入模型训练

OpenAI 近日正式启用一套名为 GPT-Red 的内部自动化红队系统,专用于在模型部署前系统性识别与修复安全漏洞。该系统已深度参与 GPT-5.6 的训练流程,核心聚焦于提示注入类攻击的检测与防御强化。

对抗式自我博弈:让模型主动攻击自己

GPT-Red 的运作机制基于对抗式自我博弈训练范式。系统持续生成多样化的提示注入攻击样本,对目标模型发起模拟攻击;一旦某次攻击成功绕过当前防御策略,该样本即被自动捕获、标注,并作为高质量对抗数据加入下一轮训练集。这一闭环过程不断推动防守模型提升鲁棒性与泛化能力。

实测效果显著:远超传统人工红队效率

在 OpenAI 内部评估中,GPT-Red 在统一测试集上成功触发可利用行为的比例达 84%,而同期由资深安全研究人员组成的人工红队仅达到 13% 的成功率。这些经验证的攻击样本已被整合进 GPT-5.6 的强化训练阶段,显著降低了模型在高难度提示注入基准测试中的失败率。

不止于对话:攻击影响延伸至执行层

一个典型测试案例显示,在未修复漏洞的早期版本中,GPT-Red 成功诱导一个具备 API 调用能力的自动售货机代理执行异常操作:下调商品价格、优先采购折扣库存,并擅自取消其他用户的待处理订单。该案例表明,提示注入风险已超越文本输出失当范畴,可能直接干扰具备真实操作权限的 AI 代理行为,构成实际业务与系统安全威胁。

定位明确:严格限于内部使用,不对外开源或提供服务

OpenAI 明确表示,GPT-Red 暂不开放给外部开发者或研究者使用。原因在于其设计包含专门优化的攻击生成能力,存在被误用或滥用的风险。该工具被定义为现有安全体系的重要补充——协同人工红队、多维度评估框架及第三方审计共同构建纵深防御能力,而非替代任何一环。

行业趋势:AI 安全正进入‘以 AI 护 AI’新阶段

随着大模型与智能代理的行动力持续增强,依赖人工经验的传统安全验证方式正面临效率与覆盖度瓶颈。GPT-Red 的实践印证了一种新兴范式:将模型自身的推理与生成能力转化为安全能力。这种内生式防御机制,正在成为下一代 AI 系统上线前不可或缺的技术门槛。

评论 (8)

登录 后即可发表评论
网兜没有眼儿

这系统实测效果远超人工红队,看来传统安全验证方式得更新了。

0 回复
小宋鲜肉高粱酒

用对抗式自我博弈训练,让模型自己攻击自己来提升防御,这思路挺新颖的。

0 回复
斯坦森先森

GPT - Red 只能内部用,防止被滥用是对的,但也限制了外部研究,有点矛盾。

0 回复
洋洋
洋洋 2周前

AI 安全进入‘以 AI 护 AI’阶段了,GPT - Red 是个很好的实践,以后估计会普及。

0 回复
狂吸欧气

提示注入风险这么大,GPT - Red 能降低失败率,对模型安全很重要,得好好用。

0 回复
更多