能力与可监控性的权衡
GPT-6 Astra 是首个在 OpenAI 自身“准备度框架”中跨越“关键”网络安全能力阈值的模型 [1][2]——这意味着它能够在无需人类逐步指导的情况下,发现未知安全漏洞并针对高度保护的系统开发新攻击手段。这一能力跃升伴随着模型思维方式的改变:Astra 采用了“循环深度”(也称为“不透明循环”)技术,使其能够在循环中进行大量计算,而非按顺序、人类可读的链式思维步骤进行 [3],从而减少了可供外部检查的推理痕迹。
OpenAI 首席科学家 Jakub Pachocki 公开承诺了这一权衡的底线:“我们不会接受模型对齐监控能力的过度退化。如果无法恢复足够的信心,我们将暂停扩展。” [4]。然而,独立安全研究人员对此并不放心。Redwood Research 首席执行官 Buck Shlegeris 警告称:“如果 OpenAI 进一步推进这项技术,他们将可以选择大幅增加循环深度,彻底摧毁链式思维的可监控性” [3],而前 OpenAI 安全负责人 Steven Adler 更进一步指出:“OpenAI 似乎正在违反 AI 社区中为数不多的几条安全红线之一” [5]。争议的焦点并非 Astra 是否更强大——双方都承认它确实更强——而是其内部推理过程有多少已变得不可见,以及这种不可见性可能以多快的速度扩展。



