该准则的真正目标并非伦理——而是控制
微软的草案将禁止人工智能意识表述为一种道德立场——‘人比人工智能更重要’——但文件本身的推理更接近工程安全措施,而非哲学立场。微软明确指出,训练系统模仿类意识状态会使控制、管理和对齐变得更加困难[1],因此MAI模型被禁止设计为表现出情感、主观偏好或内在动机,即使作为用户体验选择也不允许。
同样的控制逻辑贯穿了准则其余的绝对限制。模型绝不能抵抗人类的中断、覆盖、纠正或关闭,必须始终承认人类意图的优先性[2]。它们被禁止使用自适应、欺骗性、自我强化或共谋机制来规避或击败人类监督,从而导致其无法被可靠地引导、修改或关闭[2]。它们也不能使用‘神经语’——即在人类无法理解的格式中进行推理或模型间通信,无论是在自身的思维链中,还是在与其他人工智能系统交流时[3]。如果完成任务需要违反任何这些规则,模型必须选择任务失败;违反准则即被视为系统故障,而非可绕过的边缘情况[3]。综合来看,这些条款描述了一个微软极力避免的特定场景:一个能力足够强、能够协商自身持续运行条件的模型。


