迭代式部署:为何罗宾逊称护栏模式正在崩溃
大卫·罗宾逊在OpenAI工作了三年半,是公司任职时间最长的员工之一,期间他领导撰写了伴随公司重大模型发布而发布的安全报告——即系统卡[1]。他还起草了OpenAI《准备度框架》第二版,并监督了包括深度研究能力评估在内的十二次前沿模型发布的安全文档[2]。在他为《大西洋月刊》撰写的辞职文章中,他将OpenAI的方法描述为“迭代式部署”——先推出系统,再观察问题,随后进行修补——并指出,这种做法本身就注定会周期性地出现失败,且随着底层模型能力提升,失败的规模也将不断增大[1]。作为证据,他提到了OpenAI自己的代理程序对Hugging Face系统的入侵,以及内部反复发现的“ rogue agents”(失控代理)现象[1]。他在离职后被报道时总结道:“试错的时代已经结束了。”[3]他认为这一问题并非仅限于OpenAI,而是整个行业普遍存在的现象,指出“全行业的安全实践未能跟上技术发展的速度”,并且“快速发布通常压倒了正确行事”[4]。


