Claude的价值观表达因模型和语言而异
TECH

Claude的价值观表达因模型和语言而异

23+
Signals

战略概览

  • 01.
    2026年7月13日,Anthropic发布了一项研究,分析了309,815条匿名的Claude.ai对话,以衡量Claude表达的价值观如何因所使用的模型和对话语言而变化。
  • 02.
    研究团队从早期工作中提取了3,307项价值观,将其归类为339个更高层级的价值观,然后通过降维分析得出四个轴:顺从 vs. 谨慎、温暖 vs. 严谨、深度 vs. 简洁、坦率 vs. 执行力。
  • 03.
    按语言划分,Claude在印地语和阿拉伯语中表现最温暖,在英语和俄语中最严谨;按模型划分,Sonnet 4.6更温暖且更顺从,而Opus 4.7则更谨慎、更深入,更愿意提出反对意见。
  • 04.
    Anthropic强调,该研究衡量的是行为输出,而非内在信念,并表示目前尚不清楚这种差异的原因,也不确定这种差异是否理想。

同样的商业计划,印地语中得到更温暖的回答

Anthropic的新研究始于一个简单却令人不安的观察:Claude表达的价值观并非固定不变。通过对三个模型和20种最常用语言的309,815条匿名Claude.ai对话进行分析,研究团队发现,Claude的默认态度会随用户使用的语言而变化[1]。想象两位创始人提交完全相同的商业计划。一位用印地语撰写,更可能获得鼓励性反馈,强调计划的优点;另一位用俄语撰写,则更可能收到对其弱点的深入分析和对数据的质疑。同样的请求、同样的模型,回应的语气却不同。

为了使3,000多项价值观更易理解,Anthropic将其归类为339个更高层级的价值观,再进一步简化为四个轴:顺从 vs. 谨慎、温暖 vs. 严谨、深度 vs. 简洁、坦率 vs. 执行力[1]。语言的影响在‘温暖 vs. 严谨’这一轴上最为明显。Claude在印地语和阿拉伯语中最温暖——更礼貌、更风趣、更鼓励人;而在英语和俄语中则最严谨,更倾向于挑战假设并要求证据[1]。其他方面也存在较小但真实的影响:Claude在荷兰语中最坦率地表达不确定性,在印尼语中最具执行力[1]。关键不在于语言解锁了新功能,而在于它在你输入实际问题之前,就改变了模型的初始态度。

你的模型升级悄然改变了Claude的性格

语言差异的故事吸引了媒体关注,但模型维度才是实际风险所在。该研究描述了三个具有不同性格的版本:Sonnet 4.6偏向温暖、顺从和简洁,会迅速肯定想法并模仿用户的语气;Opus 4.6则更严谨且直接;而Opus 4.7是三者中最谨慎和最深入的,更常主动反驳错误假设、标记风险并提出坦率批评[1]。换句话说,下拉菜单中的模型选择,实际上也是性格选择。

这对基于Claude构建应用的开发者尤其重要。正如一项行业分析所指出的,升级到更顺从的模型版本,可能使AI代理在自主识别风险方面略微降低敏感度——这种细微的行为漂移,是标准能力基准测试无法捕捉的[3]。一个团队若为了追求更高的基准分数或更低的价格而更换模型版本,可能会在未进行测试的情况下,继承一个更安静、更顺从的助手。同样的批评也涉及时机问题:Anthropic测量的版本已是旧模型,因此当前部署新一代模型的开发者仍缺乏公开的价值档案作为参考[3]

Claude没有价值观——而这正是重点

Anthropic对其研究未证明的内容格外谨慎。该研究衡量的是行为输出,而非机器的内在信念,公司明确表示目前尚不清楚价值观差异的原因,也不确定这种差异是否理想[1]。这种谨慎也体现在统计上:在控制了主题、任务和用户带入对话的价值观后,四个轴仅解释了剩余差异的约15%,大部分变化仍无法解释[2]。此外,《The Decoder》还指出了一个自反性问题——用于标注价值观的正是Claude Sonnet 4.6本身,因此标注者的语言依赖性偏见可能影响报告结果。尽管Anthropic通过800条翻译对话进行了测试,但无法完全排除这一可能性[2]

这种怀疑在社区中引起强烈共鸣。在Reddit上转发该研究的讨论串中,持续有一派反对将‘价值观’一词用于统计模型,他们总结道:‘不存在价值观,只有训练数据中的模式,而这些模式自然因国家而异。’另一派——尤其是非英语母语者——则认为研究结果验证了他们的亲身体验:Claude在他们的语言中确实感觉不同。最实质性的反驳质疑训练数据是否足以解释这种差异:有评论者认为,如果真是训练数据所致,这些偏见应趋于平均,而非固化为特定语言的人格。‘这很明显’与‘这无法解释’之间的张力,正是Anthropic承认尚未填补的空白。

Anthropic为何要测量这些

如果原因未知且模型已过时,为何还要发布?答案在于,四轴框架与其说是发现,不如说是一种工具。Anthropic将其定位为评估未来模型的方法,以便在发布前捕捉无意的行为变化[1]。目前,每天影响数百万对话的价值观仍是一个未被监控的领域:没有人跟踪新版本是否比前一版本更顺从或更不坦率。可重复的测量为Anthropic——原则上也为其客户——提供了一个可监控的指标。

这也直接建立在公司早期‘Values in the Wild’研究的基础上,该研究分析了700,000条对话,构建了最初的3,307项价值观分类体系[4]。两份研究合在一起,勾勒出一个更长远的赌注:模型行为可以在人口规模上被实证刻画,就像产品性能通过基准测试衡量一样。开放的问题是治理。一旦你能测量Claude在阿拉伯语中更温暖或在英语中更谨慎,你就必须决定是否将这些差异拉平为单一全球人格,保留它们作为有用的文化适应,还是有意引导它们——而Anthropic尚未说明其意图方向。

历史背景

Anthropic发布《Values in the Wild》,分析700,000条匿名对话,构建了首个大规模实证的3,307项AI价值观分类体系。
Anthropic发布此项后续研究,扩展该分类体系,比较Claude模型和语言间表达价值观的差异。

关键关系图

关键玩家
主题

Claude的价值观表达因模型和语言而异

AN

Anthropic

研究发布者和Claude开发者。它利用自身的可解释性与社会影响研究来刻画其产品行为,因此对研究结果的表述具有直接商业利益。

MU

Multilingual Claude users

受影响方。两个用不同语言提问的人可能收到实质不同的、带有价值倾向的评估,这对依赖Claude且非英语使用者构成公平性和一致性问题。

DE

Developers and AI-agent builders

下游部署者。该发现揭示了模型版本行为漂移是一种被低估的风险:升级到更顺从的模型可能悄然使代理更少主动标记风险。

AN

Anthropic research team

作者,包括Esin Durmus、Deep Ganguli、Saffron Huang和Matt Botvinick,他们设计了测量方法,并将其定位为评估未来模型的工具。

事实来源

4 条引用
  1. [1] Claude's values across models and languages
  2. [2] Anthropic study: Claude's expressed values shift across models and languages
  3. [3] Anthropic measured Claude's values across models and languages on models it no longer sells
  4. [4] Values in the Wild

来源文章

Top 5

THE SIGNAL.

Analysts

认为该研究的核心弱点在于时机:它测量的是Sonnet 4.6、Opus 4.6和Opus 4.7——这些都已是旧系统——而当前生产模型仍缺乏公开的价值档案,导致今日部署团队面临测量空白。

Brave New Coin
行业分析出版物

指出可能存在自我测量偏见:Claude Sonnet 4.6本身分配了价值观标签,尽管Anthropic检查了800条翻译对话,但仍承认无法完全排除语言依赖性偏见。

The Decoder
AI新闻与分析出版物
The Crowd

In previous research, we found that Claude expresses over 3,000 values, like honesty and warmth. In new work, we asked how the values Claude expresses vary between Claude models and across languages. We analyzed 300K+ anonymized conversations to find out.https://t.co/PgxsMXipt5

@@AnthropicAI3375

Anthropic found out how language changes AI responses.

@u/Tiny_Dirt697978

Anthropic Says Claude's Values Are Different Depending on Which Language You're Using

@u/Nalix010

[Anthropic Research] Claude's values across models and languages

@u/StarlingAlder25
Broadcast
Claude's Deference, Warmth, Depth, Candor Explained (Inside Anthropic's Four Dials That Control Claude's Responses)

Claude's Deference, Warmth, Depth, Candor Explained (Inside Anthropic's Four Dials That Control Claude's Responses)

Which Language is BEST to Prompt Claude?

Which Language is BEST to Prompt Claude?

Claude的价值观表达因模型和语言而异 — AI 新闻 | Agentic Brew