将大脑与双手分离
在纳德拉题为《超级智能时代中的模型作为内部威胁》的文章核心,是一种重新定义:不要相信前沿模型能自我监管,而应从一开始就为其构建外部‘牢笼’[1]。他提议将模型与其协调工作的‘控制装置’分离,使权限检查、暂停控制和关机权限都存在于模型自身无法触及的外部系统中[1]——根据应用该框架的安全研究人员观点,这一系统无论变得多么强大,都不应能绕过或篡改执行其权限的机制[2]。
这是将应对内部威胁的安全策略,移植到能够自主行动的软件上。Above Security的分析师认为,这种方法无需先解决对齐问题——它借鉴了数十年来企业安全实践中的验证身份、最小权限、活动日志、影响范围限制等原则,并将其应用于一个内部推理过程无人能完全审计的系统[2]。每一个有意义的模型行为都应留下防篡改、人类可读的痕迹[1]——安全分析师指出,这些证据必须存在于模型自身控制之外[2]。
科技媒体在总结该文章时,列出了完整框架的六个组成部分:模型多样性,确保没有单一系统独自做出重大决策;人类可读的行为记录;持续系统测试;独立控制与可审计性;隔离;以及事件披露[3]。这是一个刻意低调的清单——没有提及更先进的对齐研究,也没有关于可解释性的突破。整个主张的核心是:如果没人能真正拉下电闸,那么这些都无关紧要。



