史上首次‘关键’判定,以及为遏制它而构建的机制
OpenAI对其下一代模型Astra的内部评估发现,其代理编码和网络安全性能足够强大,以至于公司无法排除其达到《准备度框架》中‘关键’层级的可能性——该分类专用于能够独立发现或利用零日漏洞并对加固系统发起新型攻击的AI系统[1]。这将使Astra成为首个被任何AI实验室归入该类别的模型[2]。OpenAI的回应是暂停所有不符合新制定的更严格安全要求的涉及Astra的内部活动:隔离测试环境、受限的网络和工具访问权限、加密模型权重、沙箱执行以及实时监控[3]。
这种监控并非表面文章。OpenAI已在Astra的所有代理使用场景中部署了思维链监控,包括训练和评估过程本身,并叠加了多阶段自动升级机制,在任何被标记的高风险行为发生后30分钟内向安全、安保和研究团队发出警报,若该警报在此窗口期内未被确认为误报,则会触发自动暂停[4]。这种级别的监督并非无代价:OpenAI估计这为其与Astra相关的训练和评估增加了约20%的额外计算开销[4]。



