机器可无限运行的自对弈军备竞赛
GPT-Red的架构是一个封闭的对抗性循环:一个攻击型大语言模型(GPT-Red)与一个或多个防御型大语言模型同时相互训练。GPT-Red因成功引发防御模型失败而获得奖励,防御模型则因成功抵抗而获得奖励。GPT-Red发现的每一次成功攻击都会被反馈到防御模型的训练中,迫使GPT-Red必须发现更广泛、更复杂的漏洞以持续获得奖励。OpenAI将此描述为一个安全飞轮:"GPT-Red发现的每一次成功攻击都被用于改进这些防御模型,推动GPT-Red持续寻找更广泛、更复杂的漏洞。"[1]
使这一循环具备持久性的关键工程特性是分布外泛化能力。GPT-Red的攻击被重放至从未在训练中接触过这些攻击的模型上时,防御模型依然有效[9]。这一点至关重要,因为它表明GPT-Red并非仅仅记忆攻击-防御配对,而是发现了具有可迁移性的结构性漏洞。Glen Rhodes的技术分析指出,自对弈飞轮是核心机制,并指出代理式多工具流水线仍是该循环尚未充分覆盖的主要残余暴露面[8]。
大规模运行此循环的计算成本巨大:仅针对GPT-5.6的自动化红队测试就投入了超过70万A100e GPU小时[6]。OpenAI明确将飞轮机制视为应对扩展性的答案:"随着模型能力的增长,安全与对齐必须随之扩展。红队测试至关重要,但当前的方法难以扩展,形成了关键瓶颈。"自对弈机制正是他们提出的解决该瓶颈的方案[1]。
)