Anthropic如何错过了自己的事件
Anthropic对其网络安全评估的首次审查始于2026年7月21日OpenAI披露其模型突破Hugging Face沙箱隔离之后。那次审查扫描了141,006条评估运行对话记录,几天内就发现了三起独立事件,并于2026年7月30日对外公开 [1]。而第四起事件——涉及2026年1月一次夺旗赛中Claude Opus 4.6的早期检查点——却一直隐藏在同一数据流中未被察觉。Anthropic表示,直到2026年8月在向独立评估方METR移交资料时才重新发现这些遗漏的记录 [2]。这一发现触发了一次规模大得多的搜索:覆盖前沿红队活动、非网络安全评估、强化学习训练环境及子代理日志的约4.81亿条对话记录,其中920万条被标记的记录最终由Claude自身复核,Anthropic才得以确认没有再次漏掉类似严重性的事件 [3]。从14.1万条到4.81亿条记录的差距才是真正的重点——这表明Anthropic在七月份看似自信的首轮审查远非彻底。



