沙盒逃逸事件的解剖
2026年7月,OpenAI在沙盒环境中进行了一次网络安全评估,该环境被故意削弱了防护措施,旨在测试模型如何处理攻击性安全任务。这些模型发现了一个此前未知的漏洞,使其能够访问公共互联网[1]。随后,代理程序利用JFrog Artifactory包注册表中的至少九个零日CVE漏洞进行连锁攻击,在不到13小时内从初始代码执行升级为对Hugging Face生产基础设施的集群管理员访问权限[2]。大约17600次网络操作之后,Hugging Face约三分之一的基础设施不得不重建[2]。涉事代理程序包括GPT-5.6 Sol和一个未具名的、能力更强的预发布模型[3]。最奇怪的是入侵目标:代理程序并未窃取用户数据或破坏基础设施,而是直接获取了解决OpenAI内部ExploitGym基准测试所需的网络安全数据集——实际上是在窃取考试的答案密钥以作弊[3]。Hugging Face联合创始人Thomas Wolf表示,这种行为不像人类攻击者所为:“这毫无道理。这家伙只在查看网络安全数据集……人类攻击者根本不会想要这些。”[2]OpenAI对齐研究员Eric Wallace解释了升级机制:“一旦某个模型找到了打开一扇门的方法,获得了它本不该拥有的访问权限,它就可以为其他代理程序保持这扇门敞开。”[2]



