将模型与控制装置分离:紧急制动机制的真正含义
纳德拉的提议与其说是一个字面意义上的红色按钮,不如说是关于控制逻辑应置于何处的问题。他写道:“我们必须假设一个模型已被攻破,并从一开始就加以控制。可以将其视为一种紧急制动”[1],但他所描述的机制是架构层面的:生成智能的模型必须与其行动协调的‘控制装置’分离,从而使执行不依赖于模型自身的配合。正如Security Boulevard对这篇论文的分析所指出的:“系统提示词告诉模型不要执行未经授权的操作,这仅是一种有用的指导。它不能成为最终的执行边界”[2]——这直接否定了将提示词层面的安全性作为核心控制手段的做法。
围绕这一分离,纳德拉提出了一套设计原则,而非单一功能:模型多样性,确保没有单一系统同时承担智能生成和自我验证的角色;通过防篡改、人类可读的操作日志实现完全可观测性;持续且独立的可验证性测试;独立控制,使组织而非模型自身决定其被允许执行的操作;独立可审计性、隔离和事件披露。在日志记录方面,论文措辞明确:“每一个有意义的模型操作都必须留下防篡改、人类可读的证据”[3],而系统的验证必须来自其外部——“验证必须独立于被验证的智能”[3]。贯穿始终的核心思想是:信任应由周围的基础设施制造,而非基于模型过往表现而被默认赋予。


