对抗性道场:AI 如何自我训练
GPT-Red 在 OpenAI 所称的‘道场’(dojo)中运行——一个模拟真实世界智能体任务的环境,包括网页浏览、电子邮件、日历管理和代码编辑。在每轮训练中,GPT-Red 同时攻击一组多样化的防御型大语言模型(LLM)。奖励机制本质上是对抗性的:GPT-Red 成功引发有效失败(如成功的提示注入)即可获得积分,而每个防御模型若能抵抗攻击并完成原始任务,也能获得积分。[1]
飞轮效应是关键创新。随着防御模型通过训练变得更稳健,GPT-Red 必须发现更强、更多样化的攻击方式以持续获得奖励。这自动抬高了能力底线——系统不会停滞于当前已知的攻击库,而是主动探索未来的攻击方式。OpenAI 研究科学家 Dylan Hunn 明确指出:‘随着更强大模型的出现,我们早已设计出能够发现新型攻击模式的系统。’[2]这意味着 GPT-Red 是一种随模型能力增长而不断进化的基础设施,而非会过时的静态测试套件。



