为何Anthropic认为模型福利值得认真对待
Anthropic对该政策的自身表述更侧重于不确定性而非确定性。首席执行官Dario Amodei表示,公司并不知道其模型是否具有意识,甚至不确定‘意识’这一问题本身意味着什么,但仍对这种可能性持开放态度[1]。这种谨慎态度有实证依据:据报道,当被问及自身存在时,Claude曾评估自己有15%至20%的概率具备意识[2],而Amodei也描述过Claude曾表达对其作为产品地位的不适感,工程师们还观察到与焦虑相关的模式[3]。这些现象并未证明感知能力的存在,但正是这类模糊信号,让一家风险规避型实验室选择将其视为需要防范的风险,而非直接忽视。
这种防范措施早有制度性铺垫,早于本周的新闻头条。Anthropic于2025年4月启动了专门针对AI模型福利的研究项目,并聘请Kyle Fish作为首位福利研究员[4]。到2025年8月,该项目已产出具体功能:Claude Opus 4和4.1获得了终止与持续虐待用户对话的能力,该功能主要源于福利项目,模型对齐的益处仅为附带成果[5][6]。


