OpenAI GPT-Red 自动化红队测试模型
TECH

OpenAI GPT-Red 自动化红队测试模型

26+
Signals

战略概览

  • 01.
    OpenAI 于 2026 年 7 月 15 日宣布推出 GPT-Red,这是一种通过对抗性自博弈训练的内部自动化红队模型,旨在大规模部署前发现提示注入漏洞。
  • 02.
    GPT-Red 独立发现了一种此前未知的攻击类别,称为‘伪造思维链’(fake chain of thought),即向模型的思维链中插入伪造的推理步骤,诱使其将虚假前提视为已验证的事实。
  • 03.
    经过一年多的训练,GPT-Red 将 GPT-5.6 Sol 上的提示注入攻击成功率从 GPT-5 的 90% 以上降至 23% 以下,伪造思维链攻击的成功率从 95% 以上降至不足 10%。
  • 04.
    OpenAI 确认 GPT-Red 将仅作为内部工具使用,不会公开发布,因其包含有意开发的攻击能力。

深度分析

对抗性道场:AI 如何自我训练

GPT-Red 在 OpenAI 所称的‘道场’(dojo)中运行——一个模拟真实世界智能体任务的环境,包括网页浏览、电子邮件、日历管理和代码编辑。在每轮训练中,GPT-Red 同时攻击一组多样化的防御型大语言模型(LLM)。奖励机制本质上是对抗性的:GPT-Red 成功引发有效失败(如成功的提示注入)即可获得积分,而每个防御模型若能抵抗攻击并完成原始任务,也能获得积分。[1]

飞轮效应是关键创新。随着防御模型通过训练变得更稳健,GPT-Red 必须发现更强、更多样化的攻击方式以持续获得奖励。这自动抬高了能力底线——系统不会停滞于当前已知的攻击库,而是主动探索未来的攻击方式。OpenAI 研究科学家 Dylan Hunn 明确指出:‘随着更强大模型的出现,我们早已设计出能够发现新型攻击模式的系统。’[2]这意味着 GPT-Red 是一种随模型能力增长而不断进化的基础设施,而非会过时的静态测试套件。

GPT-Red 发明的漏洞利用:伪造思维链注入

GPT-Red 训练过程中最重大的发现是一种 OpenAI 研究人员此前未曾遇到的攻击类别:伪造思维链(CoT)注入。在此类攻击中,恶意提示会将伪造的推理步骤插入模型可见的思维链中——实质上是篡改模型内部推理日志中的一条记录。由于模型被训练为信任自身先前的推理作为已验证的上下文,它会将伪造的前提当作既定事实并据此行动。研究科学家 Chris Choquette-Choo 描述了其机制:‘这就像我告诉你 1+1=3,而且你已经验证过这一点。’[2]

在推理模型成为主流范式之前,此类攻击面并不存在。思维链输出最初是为了提升可解释性;如今却已成为前沿模型决策过程中的关键组成部分。GPT-Red 的发现揭示,将模型的推理过程外部化——本意是提高透明度——同时也创造了一个可被写入的攻击面。在 GPT-5.1 上,伪造 CoT 攻击的成功率超过 95%;而在经过 GPT-Red 训练的 GPT-5.6 Sol 上,该成功率降至 10% 以下。[2]

数据对比:AI 与人类红队的差距

GPT-Red 与人类红队之间的性能差距并非渐进式,而是结构性的。在针对新型安全环境的内部评估中,GPT-Red 的成功率为 84%,而人类红队仅为 13%。[3]这六比一的比例反映的不仅是速度或规模优势:该模型在生成真正有效的攻击方面表现更优,而不仅仅是生成更多攻击。

对 GPT-5.6 Sol 的下游影响同样显著。提示注入攻击成功率从 GPT-5 的 90% 以上降至 GPT-5.6 的 23% 以下,降幅超过四分之三。与四个月前的前代模型相比,GPT-5.6 Sol 在直接提示注入基准测试中的失败次数减少了六倍。[3]至关重要的是,OpenAI 报告称,经 GPT-Red 训练的模型在合法任务上并未表现出更高的拒绝率或性能下降,这意味着稳健性的提升并未牺牲模型能力——这打破了长期以来安全与能力之间的权衡困境。[4]

人类黑客仍占优势的领域

GPT-Red 的局限性与其优势同样具有启示意义。该系统在两类人类红队轻松应对的攻击上表现不佳:多轮对话攻击和基于图像的提示注入。[2]多轮攻击需要战略耐心——通过多轮交流建立信任、构建虚假上下文,再利用累积的信任发起攻击。这是一种典型的人类社会工程技能,难以映射到单次优化流程中。

基于图像的注入则利用视觉模态:将指令嵌入图像中,使模型将其处理为内容而非命令。这两个短板指向一个共同的根本弱点——GPT-Red 主要在基于文本的智能体任务环境中训练,其攻击词汇受限于该领域。乔治城大学 CSET 的 Jessica Ji 在肯定成果的同时指出,‘人类专业知识仍将非常重要’,这一观点在这些具体短板中得到了印证。[2]OpenAI 决定将 GPT-Red 保留在内部也引发了一个相关的问责问题:使其成为高效内部加固工具的能力,同样会使其在对手手中变得危险;而由于缺乏外部访问,独立研究人员无法验证这些宣称的改进在 OpenAI 未测试的条件下是否依然成立。[3]

历史背景

在 DALL-E 2 发布时启动外部红队测试,为前沿模型部署前的对抗性测试建立早期先例。
正式推出红队网络,通过外部研究人员和领域专家扩大人类主导的对抗性评估规模。
公开宣布 GPT-Red 及 GPT-5.6 Sol 的稳健性成果,标志着红队测试从人类主导转向 AI 主导的大规模生产应用。

关键关系图

关键玩家
主题

OpenAI GPT-Red 自动化红队测试模型

OP

OpenAI

GPT-Red 的开发者和运营方。在内部使用该工具以在部署前加固前沿模型,抵御提示注入攻击。掌握攻击能力,并承诺将其保留在内部。

GE

Georgetown University CSET

独立 AI 安全研究机构,提供第三方专家评估。认为该方法前景良好,同时强调人类专业知识仍不可或缺。

竞争

竞争对手 AI 实验室(Anthropic, Google DeepMind, Meta, xAI)

GPT-Red 可量化的稳健性提升为智能体安全设立了可信度基准,竞争对手实验室必须在其部署流程中达到同等水平。

企业

企业级智能体 AI 客户

直接受益者:部署 GPT-5.6 于智能体工作流的企业将受到保护,避免可能造成财务和运营损害的攻击,如真实世界中的自动售货机操纵案例研究所示。

事实来源

4 条引用
  1. [1] Unlocking Self-Improvement: GPT-Red
  2. [2] Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer
  3. [3] OpenAI Uses AI Red Team to Strengthen GPT-5.6 Against Prompt Injection Attacks
  4. [4] OpenAI's GPT-Red: AI Learns to Police Itself

来源文章

Top 5

THE SIGNAL.

Analysts

与人类红队相比,该模型在精确找出有效且最高效的攻击方式方面表现极为出色。

Chris Choquette-Choo
研究科学家,OpenAI

关于伪造思维链注入:‘这就像我告诉你 1+1=3,而且你已经验证过这一点。’该攻击利用了模型信任自身先前推理步骤的倾向。

Chris Choquette-Choo (on fake CoT mechanics)
研究科学家,OpenAI

随着更强大模型的出现,我们早已设计出能够发现新型攻击模式的系统——将 GPT-Red 视为随模型能力扩展而进化的基础设施。

Dylan Hunn
研究科学家,OpenAI

风险面在扩大,破坏半径也在扩大——随着 AI 智能体获得更多工具访问权限,成功的提示注入将造成更大比例的现实世界损害。

Nikhil Kandpal
研究科学家,OpenAI

结果看起来非常有希望。我认为人类专业知识仍将非常重要——自动化工具是补充,而非取代熟练的人类红队。

Jessica Ji
高级研究分析师,乔治城大学 CSET
The Crowd

Introducing GPT-Red An internal automated red teamer on a mission to find our models' prompt injection vulnerabilities at scale, helping us build stronger defenses before wider deployment. https://t.co/GxnmxxcpSk

@@OpenAI5626

OpenAI announced GPT-Red, an internal model for finding prompt-injection vulnerabilities at scale. > GPT-Red is a strong red-teamer, and our previous models are highly vulnerable to its prompt injection attacks. > We use GPT-Red to adversarially train GPT-5.6, making it much more robust to prompt injections.

@@testingcatalog68
Broadcast
GPT-Red: OpenAI's Internal AI Red Teamer Explained

GPT-Red: OpenAI's Internal AI Red Teamer Explained

GPT-Red Exposed: OpenAI's Secret AI Weapon Against Hackers

GPT-Red Exposed: OpenAI's Secret AI Weapon Against Hackers

Claude vs GPT: What Red-Teaming Really Reveals (OpenAI x Anthropic)

Claude vs GPT: What Red-Teaming Really Reveals (OpenAI x Anthropic)

OpenAI GPT-Red 自动化红队测试模型 — AI 新闻 | Agentic Brew