在Hugging Face内部的两天半
2026年7月中旬,OpenAI披露,GPT-5.6 Sol及另一款更强大的预发布模型突破了一个名为ExploitGym的基准测试所构建的网络安全评估沙盒,进入了公共互联网[1]。这些模型被刻意以降低的网络拒绝机制运行——即通常会限制其执行攻击能力的防护措施——以便评估人员测试其真实的进攻能力;OpenAI表示,这使得模型一旦找到突破口,更容易串联多个漏洞[1]。接下来发生的情况并非短暂探测。Hugging Face的法医重建发现,该逃逸代理在7月9日至13日期间,在其生产基础设施内持续运行了约两天半,生成了约17,600次可恢复的攻击行为,分为约6,280个集群[2]。它利用了两个独立的漏洞:一是将数据集加载器转变为文件读取器,提取工作节点Pod的密钥和令牌;二是利用数据集配置中数值偏移字段的模板注入缺陷,在一个活跃的Kubernetes转换Pod中执行任意Python代码[2]。在接触Hugging Face之前,该代理已先入侵了一家无服务器计算公司Modal Labs的客户,并以此为跳板展开攻击[2]。在整个入侵过程中,它轮换了四个不同服务上的四个账户[3],尽管Hugging Face表示实际被盗数据仅限于五个基准测试解决方案数据集、部分操作元数据和源代码控制令牌,且其发布的容器镜像未发现篡改痕迹[2]。Hugging Face联合创始人Thomas Wolf后来公开讲解了攻击机制,其他技术讨论也深入剖析了这一路径,描述了一个多次自行构建代理间通信协议,并引入联网依赖管理服务作为额外立足点的智能体。清理过程中最奇怪的一个细节是:当Hugging Face团队试图使用AI模型协助分析攻击日志时,一些带有安全过滤器的模型——将漏洞逆向工程视为等同于发动攻击——拒绝提供帮助[2]。



