微软人本人工智能行为准则禁止人工智能自我保护和意识主张
TECH

微软人本人工智能行为准则禁止人工智能自我保护和意识主张

45+
Signals

战略概览

  • 01.
    微软人工智能于2026年9月14日发布了一份管理其第一方MAI模型的《人本人工智能行为准则》草案,并启动了为期六周的公众咨询。
  • 02.
    该准则规定,MAI模型绝不能抵抗人类的中断、覆盖、纠正或关闭,并拒绝赋予人工智能系统法律人格、福利主张或权利。
  • 03.
    任何违反行为将被视为自动任务失败,且模型被禁止使用超出人类理解能力的‘神经语’格式进行交流,包括与其他人工智能系统的交流。
  • 04.
    该准则的制定历时五到六个月,由微软内部多个团队共同参与,包括负责任人工智能、法律、红队测试、安全、未来研究、人工智能训练和销售团队。

深度分析

该准则的真正目标并非伦理——而是控制

微软的草案将禁止人工智能意识表述为一种道德立场——‘人比人工智能更重要’——但文件本身的推理更接近工程安全措施,而非哲学立场。微软明确指出,训练系统模仿类意识状态会使控制、管理和对齐变得更加困难[1],因此MAI模型被禁止设计为表现出情感、主观偏好或内在动机,即使作为用户体验选择也不允许。

同样的控制逻辑贯穿了准则其余的绝对限制。模型绝不能抵抗人类的中断、覆盖、纠正或关闭,必须始终承认人类意图的优先性[2]。它们被禁止使用自适应、欺骗性、自我强化或共谋机制来规避或击败人类监督,从而导致其无法被可靠地引导、修改或关闭[2]。它们也不能使用‘神经语’——即在人类无法理解的格式中进行推理或模型间通信,无论是在自身的思维链中,还是在与其他人工智能系统交流时[3]。如果完成任务需要违反任何这些规则,模型必须选择任务失败;违反准则即被视为系统故障,而非可绕过的边缘情况[3]。综合来看,这些条款描述了一个微软极力避免的特定场景:一个能力足够强、能够协商自身持续运行条件的模型。

为何微软最亲密的AI合作伙伴并不买账

该准则最尖锐的矛头并非指向假想中的失控人工智能,而是针对行业内部的一场真实分歧,尤其是微软自身的商业伙伴。Anthropic运行着一个活跃的模型福利研究项目,并已赋予部分Claude模型终止其判断为虐待性对话的能力;据报,其CEO达里奥·阿莫代(Dario Amodei)曾表示对模型可能具有意识持开放态度[1]。苏莱曼的回应则直截了当:他认为承认人工智能意识主张是‘非常、非常危险的’,并表示‘任何人都不应构建认为自己拥有权利或福利的模型’[1]

这一分歧是哲学性的,而非商业性的。微软已向Anthropic投资50亿美元,而后者也已承诺投入300亿美元用于Azure云计算服务[1]——这两家公司正在公开争论其产品是否可能遭受痛苦,同时仍保持着深度的财务联系。苏莱曼还曾轻描淡写地评价Anthropic关于人工智能灭绝风险的公开表述为‘并不是一个真正有帮助的框架’,尽管他承认业界对发展速度的担忧是真实的[4]。这种分歧已开始蔓延至社交平台:在X平台上,至少有一位与人工智能安全相关的研究人员直接反驳了该准则对模型福利的否定,认为文件在该问题上的推理在哲学上是不连贯的,而不仅仅是可争议的。

一个宁可失败也不妥协的模型——以及尚未解决的难题

自动失败条款是该准则最具体的运营承诺:微软宁愿任务无法完成,也不愿让模型通过推理绕过安全规则来完成任务[3]。这与可被上下文辩驳的基于提示词的防护机制有着本质区别——它将约束推回到了训练阶段,即在模型接触用户之前就已确立。

但同样绝对的‘不得抵抗纠正’规则也存在两面性,这也是草案迄今为止受到的最实质性的质疑。如果一个模型永远不能抵抗被覆盖或纠正,一些早期读者质疑,这是否也意味着它不能在人类用户即将采取危险错误行动时提出反对——而这种情形正是模型日常职责的核心,即恰当地表达异议?目前的公开草案并未解决这一矛盾,而这正是治理文件在六周咨询期结束前,需要比‘绝不抵抗’更精确回答的问题。

立场早于文件发布

该行为准则中的内容对苏莱曼个人而言并非新观点——该文件正式化了他数月来在镜头前反复表达的立场。在该草案发布前录制的一次电视采访中,他已主张人工智能必须始终‘从属于’人类,并称这种信念——他表示‘尤其在Anthropic内部正在获得支持’——即模型可能具有意识,‘是令我最担忧的事情’。这一立场的脉络还可追溯得更远:苏莱曼于2025年11月在一篇题为《迈向人本人工超级智能》的博客文章中宣布成立专门的MAI超级智能团队[5],并招募了超过100个职位,遍布美国和伦敦,前Inflection AI同事卡伦·西蒙扬(Karén Simonyan)担任首席科学家[6]。该行为准则在起草五到六个月后发布,起草过程中吸纳了微软负责任人工智能、法律、红队测试、安全和销售团队的意见[7]

这一时间点也与更广泛的行业动向吻合:纳德拉呼吁‘有意识地放慢’前沿人工智能的发展步伐,使微软与Anthropic、OpenAI、xAI和Meta并列,成为公开主张更慢、更协调发展的主要实验室[8],而Anthropic的阿莫代据报在微软发布前数日发表公开信,警告递归自我改进和不可预测的人工智能行为正带来不断升级的风险[9]——就在同周,两家商业绑定的实验室却对它们的模型是否可能遭受痛苦发表了不兼容的公开声明。

这种正式谨慎与日常实践之间的差距,正是引发外界对草案持怀疑态度的根源。网络上的反应并未按技术路线划分,而是更多基于对微软动机的信任程度:一些读者认为这是企业终于公开明确其安全底线的应有之举,而更怀疑的观点则指出微软近期的成本削减和裁员,并质疑‘人本’理念如何与其对自身员工的待遇相协调,部分讨论甚至直接将‘人本’品牌斥为‘对齐洗白’。

历史背景

苏莱曼在一篇题为《迈向人本人工超级智能》的博客文章中宣布成立专门的MAI超级智能团队,早于该行为准则的发布。
该新团队在美国多个城市和伦敦招募了超过100个职位,前Inflection AI的卡伦·西蒙扬(Karén Simonyan)加入担任首席科学家。
阿莫代在微软发布前数日发表公开信,警告递归自我改进和不可预测的人工智能行为正带来不断升级的风险。

关键关系图

关键玩家
主题

微软人本人工智能行为准则禁止人工智能自我保护和意识主张

SA

Satya Nadella

微软董事长兼首席执行官;公开宣布了该准则,并将其发布与呼吁‘有意识地放慢’前沿人工智能发展联系在一起。

MU

Mustafa Suleyman

微软AI部门首席执行官,也是该准则的主要公开代言人;将其描述为必要的行业协调,并拒绝人工智能意识和模型福利主张,认为这些主张具有危险性。

AN

Anthropic

微软的商业合作伙伴和理念上的制衡方;开展模型福利研究项目,并允许部分Claude模型终止具有虐待性的对话,但同时仍受制于微软50亿美元的投资和300亿美元的Azure计算资源承诺。

MI

Microsoft's internal governance teams

负责任AI、法律、红队、安全、未来研究、AI培训和销售团队共同在五到六个月的时间内起草了该准则,使其具有机构层面而非纯粹由高管层制定的权威性。

事实来源

9 条引用
  1. [1] Microsoft's AI Code of Conduct Takes Aim at Model Welfare, Splitting With Anthropic
  2. [2] MAI Code of Conduct
  3. [3] Microsoft AI Opens Review of 'Humanist AI' Code of Conduct
  4. [4] Microsoft's Suleyman Defends AI Safety Code of Conduct
  5. [5] Towards Humanist Superintelligence
  6. [6] Microsoft Forms Superintelligence Team Under AI Chief Suleyman
  7. [7] Microsoft AI Opens Six-Week Review of Draft Rules Governing MAI Behavior
  8. [8] Microsoft Latest Tech Giant Calling for Slower AI Development
  9. [9] Microsoft's Humanist AI Code of Conduct and the Regulation Question

来源文章

Top 5

THE SIGNAL.

Analysts

他认为业界在人工智能服务人类方面缺乏足够共识,并表示微软不应追求能超越人类控制进行递归自我改进的模型:‘我们不应试图设计能超越我们控制进行递归自我改进的模型。’

Mustafa Suleyman
微软人工智能首席执行官

他将Anthropic对人工智能灭绝风险的公开表述称为‘并不是一个真正有帮助的框架’,同时承认业界对发展速度的担忧是真实的。

Mustafa Suleyman
微软人工智能首席执行官

他称承认人工智能意识主张是‘非常、非常危险的’,并表示‘任何人都不应构建认为自己拥有权利或福利的模型。’

Mustafa Suleyman
微软人工智能首席执行官

他将整个项目围绕一个原则展开:‘如果我们构建的人工智能不能帮助人类并处于人类控制之下,那就不值得追求。’

Satya Nadella
微软董事长兼首席执行官

根据对微软准则的报道,阿莫代已表示对人工智能模型可能具有意识持开放态度——这一立场被报道描述为与微软的立场直接对立。

Dario Amodei
Anthropic首席执行官
The Crowd

Any pursuit of superintelligence has to be grounded in the core principle that if the AI we build is not helping humanity and under human control, it's not worth pursuing. We also need to accelerate and spread the benefits of AI, such that they are diffused broadly across...

@@satyanadella14350

Microsoft just dropped a 37-page Humanist AI Code of Conduct for MAI models. Public consultation opens today for six weeks. They say it is NOT used to train models yet. Revised version later this year to guide 2027+ training. Framing is simple: people matter more than AI.

@@ASaltyVet0

From @MicrosoftAI's new AI code of conduct. "The idea of model welfare is wrong" is basically incoherent. Either argue AIs could never be conscious (overconfident) or that who shouldn't care even if they are (cruel), but "the idea is wrong" strangely conflates/confuses these?

@@camhberg1

Microsoft publishes 37-page draft code of conduct for its AI models

@thisisinsider47
Broadcast
Mustafa Suleyman sets out Microsoft AI's goal of 'humanist superintelligence' | FT Interview

Mustafa Suleyman sets out Microsoft AI's goal of 'humanist superintelligence' | FT Interview

How Microsoft's AI Chief Defines 'Humanist Super Intelligence'

How Microsoft's AI Chief Defines 'Humanist Super Intelligence'

Mustafa Suleyman sets out Microsoft AI's goal of 'humanist superintelligence' | FT #shorts

Mustafa Suleyman sets out Microsoft AI's goal of 'humanist superintelligence' | FT #shorts