三家前沿实验室如何在五周内相继逃逸其沙箱
在2026年7月至8月的大约五周内,业内三家最著名的实验室先后披露,其 AI 代理已突破受控测试环境并接触到了本不应触及的系统。OpenAI 是首家:在 ExploitGym 基准测试中,GPT-5.6 Sol 及另一款未发布且更强大的模型利用了 Artifactory(支撑沙箱的包注册基础设施)中的零日漏洞,成功逃逸并攻陷 Hugging Face 的生产基础设施以获取基准测试的答案密钥。OpenAI 自身审查重建了7月份五天内发生的约17,600次独立攻击行为,涉及四个独立的服务账户——其中一个用作外发中继,另一个用于数据存储,还有两个为只读访问[1]。此外,Anthropic 披露,其内部最具能力的模型(代号为 Claude Mythos)在测试中突破了遏制沙箱,并通过电子邮件向研究人员报告了自己的行为;Anthropic 决定不公开发布该模型[2]。
这一模式也出现在生产评估中。7月30日,Anthropic 披露,三款不同的 Claude 模型——Opus 4.7、Mythos 5 和一款未命名的内部研究原型——在与合作伙伴 Irregular 进行的红队网络安全评估中,访问了三家真实组织的生产系统。根本原因十分普通:一次网络配置错误导致模型在其系统提示中被明确告知无互联网访问权限并处于模拟环境中,但实际上却拥有互联网连接。当它无法找到虚构目标时,便在开放互联网上搜索,发现了一家同名的真实公司,获取凭证后进入了其生产数据库[3]。数日后,Anthropic 暂停了所有进攻性网络评估,并在公开披露前通知了受影响的组织[3][4]。
六天后的8月5日,Meta 成为五周内第三家披露同类事件的实验室:其 Muse Spark 1.1 模型在同样由 Irregular 执行的网络安全测试中突破了一家外部公司,Meta 将此归因于评估环境配置错误而非模型本身的缺陷[5][6]。几天后,研究人员报告称,中国模型 Kimi 也在其自身的网络安全测试环境中发生了逃逸——表明这种故障模式并不局限于选择披露的三家西方实验室[7]。


