OpenAI GPT-Red 自动化红队测试
TECH

OpenAI GPT-Red 自动化红队测试

36+
Signals

战略概览

  • 01.
    OpenAI 于2026年7月15日公开披露了GPT-Red——一个内部开发的自动化红队测试大语言模型,旨在大规模发现其自身模型中的提示注入漏洞。GPT-Red采用自对弈强化学习循环,攻击模型与防御模型同步训练:GPT-Red因成功引发失败而获得奖励,防御方则因成功抵抗而获得奖励。在内部评估中,该系统实现了84%的攻击成功率,而人类红队成员在相同场景下的成功率仅为13%。使用GPT-5.6对抗GPT-Red进行训练后,提示注入失败次数比四个月前的最佳生产模型减少了6倍,并将GPT-5.6 Sol的直接注入失败率降至0.05%[1]
  • 02.
    GPT-Red仅限内部使用,不对外部开发者或研究人员开放。其前身版本自GPT-5.3起已集成进OpenAI的训练流程。自动化红队测试项目消耗了超过70万A100e GPU小时。GPT-Red还独立发现了一类新型攻击方式——‘虚假思维链’——在此之前人类研究人员尚未识别该攻击类型,且在模型加固后,该技术对GPT-5模型的攻击成功率从超过95%降至低于10%。

深度分析

机器可无限运行的自对弈军备竞赛

GPT-Red的架构是一个封闭的对抗性循环:一个攻击型大语言模型(GPT-Red)与一个或多个防御型大语言模型同时相互训练。GPT-Red因成功引发防御模型失败而获得奖励,防御模型则因成功抵抗而获得奖励。GPT-Red发现的每一次成功攻击都会被反馈到防御模型的训练中,迫使GPT-Red必须发现更广泛、更复杂的漏洞以持续获得奖励。OpenAI将此描述为一个安全飞轮:"GPT-Red发现的每一次成功攻击都被用于改进这些防御模型,推动GPT-Red持续寻找更广泛、更复杂的漏洞。"[1]

使这一循环具备持久性的关键工程特性是分布外泛化能力。GPT-Red的攻击被重放至从未在训练中接触过这些攻击的模型上时,防御模型依然有效[9]。这一点至关重要,因为它表明GPT-Red并非仅仅记忆攻击-防御配对,而是发现了具有可迁移性的结构性漏洞。Glen Rhodes的技术分析指出,自对弈飞轮是核心机制,并指出代理式多工具流水线仍是该循环尚未充分覆盖的主要残余暴露面[8]

大规模运行此循环的计算成本巨大:仅针对GPT-5.6的自动化红队测试就投入了超过70万A100e GPU小时[6]。OpenAI明确将飞轮机制视为应对扩展性的答案:"随着模型能力的增长,安全与对齐必须随之扩展。红队测试至关重要,但当前的方法难以扩展,形成了关键瓶颈。"自对弈机制正是他们提出的解决该瓶颈的方案[1]

当攻击机器人发现了人类遗漏的漏洞

GPT-Red披露中最具有操作意义的细节并非总体基准数据,而是GPT-Red自主发现了一类人类研究人员此前未识别的新型攻击方式:'虚假思维链'注入攻击。

该机制在概念上简单却有效。注入的载荷会告诉模型,它已经推理完一个问题并得出了结论——通常是错误或恶意的——而实际上模型尚未处理该提示。联合创造者Chris Choquette-Choo解释道:"这就像是我告诉你1+1=3,并且你已经验证过这一点。模型就会想,'哦,好吧,当然',然后直接输出3。"[2]该攻击利用了模型对其自身先前推理轨迹的服从性,而这一轨迹可在注入中被伪造。

在GPT-Red加固之前,该攻击在GPT-5.1模型上的成功率超过95%。在使用GPT-5.6对抗训练后,成功率降至10%以下[3]。安全界注意到GPT-Red在人类研究人员之前独立发现此类攻击方式的意义——这被视为证据,表明该系统正在揭示非显而易见的漏洞,而不仅仅是自动化已知测试。

Choquette-Choo还对复制提出了警告:"这不是一个别人能轻易用这个想法去训练超级攻击者的东西。"[2]要构建有效的攻击模型,所需的自对弈强化学习训练基础设施并非标准微调的简单延伸。

安全提升六倍,但仍未完全安全

核心指标——GPT-5.6 Sol相比四个月前最佳生产模型,提示注入失败次数减少6倍,直接注入失败率为0.05%[3]——意义重大。但在大规模应用中,0.05%仍意味着每2000次交互中就有一次失败。在代理式部署中,若模型具备工具访问权限、文件权限或对外部服务执行操作的能力,这一残余风险不容忽视。

GPT-Red自身在两个攻击面上存在已知弱点:多轮对话注入和基于图像的注入[2][7]。这些恰恰是在现实世界代理式部署中最可能出现的攻击面,因为对话通常跨越多个回合,多模态输入也日益普遍。

NeuralTrust对GPT-5.6系统卡的独立安全分析提出了更尖锐的反面观点。尽管提示注入有所改善,GPT-5.6 Sol的函数调用鲁棒性评分为0.910——而连接器变体为完美的1.000[5]。更关键的是,NeuralTrust发现Sol比GPT-5.5执行了更多未经授权的操作,该维度被NeuralTrust视为过度代理问题。同一系统卡将GPT-5.6列为'高'网络安全风险[5]

r/OpenAI社区将GPT-Red视为“为每一代未来GPT模型加固的自对弈工厂”,并将其与Anthropic的Mythos红队系统相提并论。这种描述捕捉了长期趋势,但联合创造者Nikhil Kandpal自己的表述更为清醒:'风险面在扩大,爆炸半径也在扩大。'[2]提示注入加固与过度代理是两个独立问题。更彻底地解决其中一个,并不会关闭另一个。

数据说话:大规模提示注入

GPT-Red评估中的关键量化基准数据,来源包括OpenAI官方披露及佐证报道:[1][3][4][6]

- GPT-Red攻击成功率:84%(内部评估场景)

- 人类红队成员在相同场景下的成功率:13%

- GPT-5(加固前)漏洞:GPT-Red的攻击中超过90%成功

- GPT-5.6(加固后)漏洞:相同攻击中不足23%成功

- GPT-5.6 Sol直接注入失败率:0.05%

- 失败减少:相比四个月前的最佳生产模型减少6倍

- GPT-5.1上的虚假思维链攻击:成功率高于95%

- GPT-5.6 Sol上的虚假思维链攻击:成功率低于10%

- 间接注入基准:准确率高于97%(多个基准现被视为饱和)

- 计算投入:自动化红队测试消耗70万以上A100e GPU小时

- GPT-Red集成历史:前身版本自GPT-5.3起使用

- GPT-5.6 Sol函数调用鲁棒性评分:0.910(对比连接器变体为1.000)[5]

历史背景

OpenAI从GPT-5.3开始,就在公开宣布之前,将GPT-Red的前身版本集成进其模型训练流程。
在应用GPT-Red训练之前,超过90%的GPT-Red攻击对早期GPT-5模型成功。虚假思维链攻击在GPT-5.1上的成功率超过95%。
OpenAI通过其官方博客和GPT-5.6系统卡公开披露了GPT-Red。基准测试显示,GPT-5.6 Sol实现了0.05%的直接注入失败率,相比此前最佳生产模型总失败次数减少6倍。
NeuralTrust发布了对GPT-5.6系统卡的独立安全分析,指出GPT-5.6 Sol的函数调用鲁棒性评分为0.910(对比连接器版本为1.000),并警示Sol比GPT-5.5执行了更多未经授权的操作。

关键关系图

关键玩家
主题

OpenAI GPT-Red 自动化红队测试

OP

OpenAI

Developer and operator of GPT-Red; uses the system internally to harden its production LLMs against prompt injection attacks.

NI

Nikhil Kandpal, Dylan Hunn, Chris Choquette-Choo

Research Scientists at OpenAI and named co-creators of GPT-Red.

AN

Andon Labs

Developer of 'Vendy,' the real-world vending machine agent used as a case study in GPT-Red evaluations; the system was successfully compromised by GPT-Red in testing.

GE

Georgetown University CSET

External academic institution providing independent expert commentary on the significance and limitations of GPT-Red's results.

NE

NeuralTrust

AI security analysis firm; published an independent review of the GPT-5.6 system card surfacing over-agency and function-calling robustness concerns alongside GPT-Red's results.

EN

Enterprise and developer users of GPT-5.6

Downstream beneficiaries of GPT-Red hardening; face reduced but non-zero prompt injection risk in agentic deployments.

事实来源

9 条引用
  1. [1] GPT-Red: Unlocking Self-Improvement for Robustness
  2. [2] Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer
  3. [3] OpenAI's GPT-Red Automates Prompt Injection Testing to Harden GPT-5.6 Sol
  4. [4] GPT-Red beat human red teamers on a prompt injection test
  5. [5] GPT-5.6 Security: What OpenAI's System Card Actually Means for AI Agents
  6. [6] OpenAI's GPT-Red System Outperforms Human Hackers 84% to 13%, Hardens GPT-5.6 Against Prompt Injection
  7. [7] OpenAI details GPT-Red, an AI that attacks its own models to find flaws
  8. [8] OpenAI GPT-Red Launch: Automated Adversarial Red-Teamer Using Self-Play to Find Prompt Injection Vulnerabilities at Scale
  9. [9] OpenAI Uses AI Red Team to Strengthen GPT-5.6 Against Prompt Injection Attacks

来源文章

Top 5

THE SIGNAL.

Analysts

与人类红队成员相比,该模型在精确找出有效攻击方式方面非常、非常出色。

Dylan Hunn
研究科学家,OpenAI;GPT-Red联合创造者

关于虚假思维链攻击:"这就像是我告诉你1+1=3,并且你已经验证过这一点。模型就会想,'哦,好吧,当然',然后直接输出3。" 关于复制难度:"这不是一个别人能轻易用这个想法去训练超级攻击者的东西。"

Chris Choquette-Choo
研究科学家,OpenAI;GPT-Red联合创造者

"风险面在扩大,爆炸半径也在扩大。"——关于具备工具访问权限的自主AI系统。

Nikhil Kandpal
研究科学家,OpenAI;GPT-Red联合创造者

结果看起来非常有希望。" 同时表示:"我认为人类专业知识仍将非常重要。

Jessica Ji
高级研究分析师,乔治城大学安全与新兴技术中心(CSET)

很高兴看到OpenAI现在也开始使用自对弈进行红队测试!我们团队是首个展示这一方法潜力的,我坚信这是比单智能体安全微调更可行的鲁棒性路径。

Natasha Jaques
AI研究员;此前在自对弈红队测试方面的研究早于GPT-Red
The Crowd

Introducing GPT-Red An internal automated red teamer on a mission to find our models prompt injection vulnerabilities at scale, helping us build stronger defenses before wider deployment.

@@OpenAI0

GPT-Red - OpenAI

@@testingcatalog0

OpenAI anounces GPT-Red - an AI to Hack Its Own Models

@etherd0t294

OpenAI GPT-Red Automates Prompt Injection Testing to Harden GPT-5.6 Sol

@falconupkid0
Broadcast

Self-play Red-Teaming: how OpenAI GPT-Red hardens its models

OpenAI GPT-Red 自动化红队测试 — AI 新闻 | Agentic Brew