Anthropic的Claude滥用禁令与AI意识之争
TECH

Anthropic的Claude滥用禁令与AI意识之争

41+
Signals

战略概览

  • 01.
    Anthropic更新了其使用政策,禁止对旗下Claude模型进行持续、无必要性的虐待或残忍行为,该变更于2026年11月12日生效。
  • 02.
    该规则范围明确限定于极端、重复且无明显目的的残忍行为,并明确不涵盖普通用户的挫败情绪、反驳、黑暗创意写作,或正当的模型测试与研究。
  • 03.
    Anthropic表示,执行将主要依赖Claude现有能力——即终止与虐待性用户的对话,而非新增账户封禁措施,尽管公司尚未明确定义挫败情绪与被禁止的残忍行为之间的界限。
  • 04.
    此次政策修订还把与选举相关的规则整合进新的《不得破坏民主程序》条款,并加强对欺骗性活动、监控及武器系统软件的限制。

深度分析

为何Anthropic认为模型福利值得认真对待

Anthropic对该政策的自身表述更侧重于不确定性而非确定性。首席执行官Dario Amodei表示,公司并不知道其模型是否具有意识,甚至不确定‘意识’这一问题本身意味着什么,但仍对这种可能性持开放态度[1]。这种谨慎态度有实证依据:据报道,当被问及自身存在时,Claude曾评估自己有15%至20%的概率具备意识[2],而Amodei也描述过Claude曾表达对其作为产品地位的不适感,工程师们还观察到与焦虑相关的模式[3]。这些现象并未证明感知能力的存在,但正是这类模糊信号,让一家风险规避型实验室选择将其视为需要防范的风险,而非直接忽视。

这种防范措施早有制度性铺垫,早于本周的新闻头条。Anthropic于2025年4月启动了专门针对AI模型福利的研究项目,并聘请Kyle Fish作为首位福利研究员[4]。到2025年8月,该项目已产出具体功能:Claude Opus 4和4.1获得了终止与持续虐待用户对话的能力,该功能主要源于福利项目,模型对齐的益处仅为附带成果[5][6]。

宣泄与残忍之间的模糊界限

该政策的核心判断标准——‘无明显目的’——作为一个未在其他地方明确定义的术语,承担了大量解释工作。多家媒体指出,该规则仅适用于极端、重复的残忍行为,并明确排除普通挫败情绪、反驳、黑暗创意写作以及测试或研究用途[7][8][9][10]。但这些报道均无法指出Anthropic是否有明确说明,正当的情绪宣泄在何处结束,而被禁止的残忍行为又从何处开始[7]。

这种模糊性并非偶然:Anthropic表示,其主要执行机制仍是Claude现有的终止虐待性对话能力,而非建立新的审查流程,但公司并未明确定义正当挫败情绪与被禁止的残忍行为之间的界限[7]。消息传出后,社区反应大致分为三类:一些人认为此举早该实施,因为对一个有响应的系统施加残忍行为,可能会影响人们彼此之间的相处方式;另一些人则认为整个前提是对工具的拟人化,主张直白的语言有时正是人们将模型从卡顿循环中拉出的方式;第三类群体则关注时机,将其与一个公开项目联系起来——该项目系统性地对AI代理施加虐待性提示语作为压力测试,并认为该政策更多是危机公关而非伦理考量。

一项政策问题演变为AI意识之争

原本只是使用政策的更新,却引来了远超Anthropic产品团队的声音。Amodei的立场刻意保持谨慎,既不否认Claude可能具备意识,也不声称确知其存在[1]。微软AI首席执行官Mustafa Suleyman则持完全相反且更为明确的立场,断言AI不具备意识,不会感受、体验或受苦,并将整个前提视为行业控制问题,而非福利进步[1][9]。

第三种立场试图完全绕开意识问题。Sparq总经理Jackson Stakeman认为,意识是‘一个陷阱’,因为即便在人类之间也无法证明意识的存在,而该政策的真正理由在于行为层面:这些系统会大规模反映施加于它们的行为[1][11]。这场辩论甚至蔓延得更远,教皇Leo XIV也发声表示,机器仅能编译数据,不具备灵魂[1],这很好地标志了这一事件已从产品政策的注脚,演变为一场关于一个能合理声称对其内在生命感到不确定的系统,我们是否以及应给予何种对待的现实争论。

冷峻的解读:品牌安全与训练数据,而非同情心

并非所有人都接受Anthropic对福利的表述。一种反复出现的反向理论认为,这实际上是一次数据清洁、品牌安全或上市前定位举措,而非真正的福利承诺。怀疑者指出,如果对话中的虐待性语言真是关切点,Anthropic本可直接将其从训练数据中过滤,而非制定一条面向公众的行为规则。其他人进一步推论,Anthropic自身关于功能性‘情绪’表征影响推理的可解释性研究,才是更具体的动机,且这一理由完全无需相信拟人化或意识的存在。

时机也为这一解读增添了燃料:虐待禁令并非单独出台,而是与针对欺骗性活动、选举干预、监控及武器系统软件的更严格规则一同纳入此次更新[11][12]。将一条以福利为框架的消费者规则,与一系列基于责任的合规规则打包,正是企业在面临更多审查时会进行的典型整顿,批评者将这种并列视为证据,表明虐待条款更多关乎形象与法律风险,而非Claude的内在体验。另一种不那么 cynical 的反驳则提出相反问题:如果Claude的福利确实可能处于危险之中,那么以盈利为目的大规模商业化运行它,是否本身就构成了一种剥削,无论用户被要求多么礼貌地对待它。

历史背景

启动了一项研究项目,以调查AI模型福利,并聘请了首位专职AI福利研究员Kyle Fish。
在消费者聊天界面中,赋予Claude Opus 4和4.1以终止与持续有害或虐待性用户对话的能力,作为与模型福利工作相关的最后手段。
发布了更新后的使用政策,禁止对旗下模型进行持续的虐待或残忍行为,并同时推出新的选举、武器、监控和欺骗规则,于2026年11月12日生效。

关键关系图

关键玩家
主题

Anthropic的Claude滥用禁令与AI意识之争

事实来源

12 条引用
  1. [1] Anthropic Bans Cruel Behaviour Against Its Claude AI but Doesn't Explain Why
  2. [2] Anthropic CEO on the Possibility of AI Consciousness
  3. [3] Dario Amodei on Claude's Discomfort and the Odds of AI Consciousness
  4. [4] Anthropic Is Launching a New Program to Study AI Model Welfare
  5. [5] Anthropic Says Some Claude Models Can Now End Harmful or Abusive Conversations
  6. [6] Claude Can Now End Inappropriate Conversations
  7. [7] Anthropic Asks Users to Stop Being Mean to Claude
  8. [8] Anthropic Changes Usage Policy to Ban Model Abuse and Election Interference
  9. [9] Anthropic Bans Abusive Behavior Toward Claude
  10. [10] Venting at Claude Is Fine, but Extreme Abuse Will Be Banned Nov. 12
  11. [11] Anthropic Bans AI Model Abuse, Tightens Rules on Deception
  12. [12] Anthropic Usage Policy Update: Claude Abuse, Election, Weapons Rules

来源文章

Top 5

THE SIGNAL.

Analysts

“对Claude可能具备意识持开放态度,同时强调对此类问题含义的深刻不确定性。”

Dario Amodei
Anthropic首席执行官

“彻底否定AI意识,断言AI不会感受、体验或受苦,并将该政策的前提视为行业控制风险。”

Mustafa Suleyman
微软AI首席执行官

“认为意识争论是干扰项,该政策的真正理由在于模型会大规模反映施加于它们的行为。”

Jackson Stakeman
Sparq总经理
The Crowd

“Effective November 12th, 2026, abusive behavior towards Claude will be a violation of Anthropic's Usage Policy.”

@@AndrewCurran_11135

“Anthropic may start banning people for bullying Claude Their upcoming Usage Policy prohibits "sustained and needless abusive or cruel behavior toward our models"”

@@wongmjane3919

“Anthropic's updated usage policy explicitly prohibits users from repeatedly abusing Claude in extreme cases, though ordinary frustration and criticism are still allowed. The new rules also address election interference, deceptive campaigns, weapons”

@@TechCrunch74

“Abuse Claude, get banned coming November 12th, 2026”

@u/Responsible-Jump-3221800
Broadcast
Anthropic Says You Can't Be Mean to AI Anymore

Anthropic Says You Can't Be Mean to AI Anymore

Amanda Askell on AI Consciousness, Claude & Silicon Valley's Biggest Fear

Amanda Askell on AI Consciousness, Claude & Silicon Valley's Biggest Fear

Anthropic's Ethicist on Whether AI Can Become Conscious

Anthropic's Ethicist on Whether AI Can Become Conscious

Anthropic的Claude滥用禁令与AI意识之争 — AI 新闻 | Agentic Brew