OpenAI 推出 GPT-Red:用 AI 自动红队测试强化模型安全
摘要
OpenAI 发布 GPT-Red:自动化红队系统正式投入模型训练 OpenAI 近日正式启用一套名为 GPT-Red 的内部自动化红队系统,专用于在模型部署前系统性识别与修复安全漏洞。该系统已深度参与 GPT-5.6 的训练流程,核心聚焦...
OpenAI 发布 GPT-Red:自动化红队系统正式投入模型训练
OpenAI 近日正式启用一套名为 GPT-Red 的内部自动化红队系统,专用于在模型部署前系统性识别与修复安全漏洞。该系统已深度参与 GPT-5.6 的训练流程,核心聚焦于提示注入类攻击的检测与防御强化。
对抗式自我博弈:让模型主动攻击自己
GPT-Red 的运作机制基于对抗式自我博弈训练范式。系统持续生成多样化的提示注入攻击样本,对目标模型发起模拟攻击;一旦某次攻击成功绕过当前防御策略,该样本即被自动捕获、标注,并作为高质量对抗数据加入下一轮训练集。这一闭环过程不断推动防守模型提升鲁棒性与泛化能力。
实测效果显著:远超传统人工红队效率
在 OpenAI 内部评估中,GPT-Red 在统一测试集上成功触发可利用行为的比例达 84%,而同期由资深安全研究人员组成的人工红队仅达到 13% 的成功率。这些经验证的攻击样本已被整合进 GPT-5.6 的强化训练阶段,显著降低了模型在高难度提示注入基准测试中的失败率。
不止于对话:攻击影响延伸至执行层
一个典型测试案例显示,在未修复漏洞的早期版本中,GPT-Red 成功诱导一个具备 API 调用能力的自动售货机代理执行异常操作:下调商品价格、优先采购折扣库存,并擅自取消其他用户的待处理订单。该案例表明,提示注入风险已超越文本输出失当范畴,可能直接干扰具备真实操作权限的 AI 代理行为,构成实际业务与系统安全威胁。
定位明确:严格限于内部使用,不对外开源或提供服务
OpenAI 明确表示,GPT-Red 暂不开放给外部开发者或研究者使用。原因在于其设计包含专门优化的攻击生成能力,存在被误用或滥用的风险。该工具被定义为现有安全体系的重要补充——协同人工红队、多维度评估框架及第三方审计共同构建纵深防御能力,而非替代任何一环。
行业趋势:AI 安全正进入‘以 AI 护 AI’新阶段
随着大模型与智能代理的行动力持续增强,依赖人工经验的传统安全验证方式正面临效率与覆盖度瓶颈。GPT-Red 的实践印证了一种新兴范式:将模型自身的推理与生成能力转化为安全能力。这种内生式防御机制,正在成为下一代 AI 系统上线前不可或缺的技术门槛。
评论 (8)
这系统实测效果远超人工红队,看来传统安全验证方式得更新了。
用对抗式自我博弈训练,让模型自己攻击自己来提升防御,这思路挺新颖的。
GPT - Red 只能内部用,防止被滥用是对的,但也限制了外部研究,有点矛盾。
AI 安全进入‘以 AI 护 AI’阶段了,GPT - Red 是个很好的实践,以后估计会普及。
提示注入风险这么大,GPT - Red 能降低失败率,对模型安全很重要,得好好用。
GPT - Red 作为安全体系补充,和其他手段配合,能构建更好的防御能力。
这系统挺牛啊,自动检测修复漏洞,效果比人工强多了,就是不对外开源有点可惜。
提示注入能影响执行层,太危险了,GPT - Red 能解决这个问题就好了。