Anthropic 强制实施的 Claude 文本水印
TECH

Anthropic 强制实施的 Claude 文本水印

45+
Signals

战略概览

  • 01.
    Anthropic 从 2026 年 8 月 2 日起,开始在其发布的所有 Claude 模型生成的文本中嵌入不可见的统计水印,并将该规则应用于全球用户,而不仅限于欧盟用户,以遵守《欧盟人工智能法案》。
  • 02.
    该水印是 Google DeepMind 的 SynthID-Text 方法的一种变体,利用密钥和最近上下文来影响 Claude 下一个选择的词语,Anthropic 表示这不会改变输出质量,且对读者完全不可察觉。
  • 03.
    所有订阅计划或 API 参数(包括高级和企业访问权限)均无法禁用水印;旧的、2026 年 8 月前的模型将在过渡期内陆续添加此功能。
  • 04.
    Anthropic 确认将推出供第三方使用的公开水印检测 API,但其表示任何匹配结果仅是一种概率性信号,表明 Claude ‘可能参与了’内容生成,而非作者身份的确凿证据。

深度分析

水印在底层是如何运作的

Anthropic 的实现方式是 Google DeepMind 于 2024 年在《自然》杂志首次发表的 SynthID-Text 技术的一种变体:模型不会让任意随机数生成器选择下一个词,而是使用密钥和前文内容来影响下一个词元(token)的选择 [1]。Anthropic 坚称这不会影响输出质量,且对人类读者而言,加水印的回复与未加水印的回复无法区分 [1]。但该公司后续披露的信息使这一说法变得复杂:该信号在短文本、事实密集或代码密集的文本中明显更弱,而彻底重写(每个词都被替换)可以完全去除水印 [2]。不过,并非所有人都认为质量必然下降:Reddit 上一篇获得最多点赞的反驳(u/Blothorn)认为,现实中的质量影响应非常轻微,因为算法刻意保持其诱导的偏差非常小。该话题下最受关注的技术解析之一将该机制重新描述为“在合理候选词之间进行的淘汰赛”,由相同的“密钥+上下文”方法决定种子顺序——并指出即使 Claude 仅用于校对人类已撰写的内容,该偏差仍然适用,因为最终出现在页面上的词语仍是由模型选择的。

一项区域性法律,却应用于全球

触发因素是《欧盟人工智能法案》第 50 条,其透明度义务自 2026 年 8 月 2 日起具有法律约束力,要求生成式 AI 提供商以机器可读方式标记内容为人工智能生成,否则将面临高达 1500 万欧元或全球营业额 3% 的罚款 [3]。公众对谁必须遵守该法的广泛困惑,很大程度上源于法案中“提供者”与“部署者”的区分:一篇广受关注的技术解析详细说明了该法律将标记义务施加于 Anthropic 本身(作为模型提供者),而非个别部署者或用户,这也是该公司选择将该功能内置到模型中并全球实施,而非将合规责任留给在欧盟内部部署模型的用户的原因之一。Anthropic 本可以将该功能地理围栏至欧盟流量,但它没有:水印适用于全球每一位 Claude 用户,这是区域性合规标准波及全球产品行为的一个典型案例 [3]。这包括高级和企业账户——没有任何订阅计划或 API 参数可以关闭它 [4]。并非所有人都认为这种范围在法律上是必要的:Reddit 用户指出,代码在第 50 条中基本被豁免为“短输出”,因此 Anthropic 仍选择对代码加水印,被一些人视为“懒惰式合规”,而非法律实际要求。

一种承认自己并非证据的检测信号

Anthropic 正在准备一个供第三方使用的公开水印检测 API,但其自身对该 API 能告诉你的内容的描述刻意保留:检测到的标记仅表示内容“可能被 Claude 评估或处理过,而非由 Claude 撰写” [5]。The Decoder 从技术角度报道了同样的局限性——该 API“只能标记 Claude 可能参与了文本的创建”,无法证明作者身份或 AI 贡献程度 [6]。结合此前提到的“彻底重写可消除标记”以及“短文本或代码密集段落几乎不携带标记”的观点 [2],可以发现,学校、雇主和平台可能将其视为确定性 AI 检测工具的东西,按 Anthropic 自己的说法,最多只是一个概率性提示。

校对陷阱

由于水印依附于词语选择,而非“从零开始撰写”,因此一个人完全自己撰写、仅让 Claude 进行校对或轻微编辑的文档,仍可能携带可检测的标记 [7]。TechCrunch 报道称,用户担心这会使他们在工作或课堂中使用 AI 的行为暴露,即使核心思想和初稿完全由人类完成 [7],Forbes 也指出了同样的模糊性——一份被标记的文档只能证明 Claude 接触过文本,而无法证明其贡献程度 [5]。地面反应更为尖锐:一个获得大量点赞的 Reddit 帖子的版主机器人将社区情绪总结为“一致反对”,并将质量下降、无用性和“耻辱标记”式的不公平列为最主要的抱怨,并引用 Anthropic 自己的 FAQ 提示“检测到的标记并非完全确凿”作为证据,说明该信号在任一方向上都不可靠。

市场的回应:取消订阅、移除工具与领先地位的丧失

该举措立即引发了可衡量的摩擦。至少有一位付费订阅者——一位每月 100 美元的 Max 订阅者——因对这一计划感到不适,明确因对隐蔽且不可选的水印感到不安而取消订阅 [8]。在 Anthropic 宣布后的 24 小时内,一个开源的“水印移除”工具出现在 GitHub 上并迅速爆红,据报道在两天内获得约 4100 颗星,到 8 月 17 日已达到 11700 至 11800 颗星 [9][11][12];对这波水印移除工具的广泛报道发现,几乎没有任何工具能真正证明其有效性 [10]。社区的怀疑更进一步:一位 r/claude 的评论者将该工具斥为“幻觉产生的垃圾”,根本未针对 SynthID 风格的水印,因为它只是让另一个 AI 重写输出——而这些文本本身最终仍会被水印。社交媒体反应强烈讽刺了 Claude 自身会拒绝帮助安装旨在剥离其自身标记的插件这一矛盾,一些评论者进一步指出,Anthropic 在训练其模型时使用了大量未标注来源的内容,现在却为其自身输出加水印以保留归属痕迹。商业上,时机看起来代价高昂:8 月 17 日,ChatGPT 以 88 分重新夺回 Implicator LLM Meter 榜首位置,终结了 Claude 在争议中保持的一周领先 [4],TechRadar 对此次发布的报道也提出了疑问:同样的欧盟规则是否最终会推动 OpenAI 和 Google 跟进 [13]

历史背景

在《自然》杂志发表了 SynthID-Text 水印方法,后被 Anthropic 用于 Claude 的实现。
Anthropic 与大约 190 个组织共同签署了《欧盟人工智能生成内容透明度行为准则》。
要求以机器可读方式标记人工智能生成内容的透明度义务已在欧盟范围内具有法律效力。
宣布将对其 AI 模型生成的文本加水印,并将该规则应用于全球用户,而不仅限于欧盟用户。
在 Anthropic 宣布后约 24 小时内,一个 GitHub 水印移除工具被发布。
有报道称,Claude 用户对水印可能暴露他们在工作或课堂中使用 AI 的行为感到愤怒。
确认将为第三方开发者推出可公开调用的水印检测 API。
ChatGPT 以 88 分重新夺回 Implicator LLM Meter 榜首,终结了 Claude 在水印争议中保持的一周领先。

关键关系图

关键玩家
主题

Anthropic 强制实施的 Claude 文本水印

事实来源

13 条引用
  1. [1] Claude Text Watermark
  2. [2] Anthropic Shares More Details About How Claude's New Watermarks Will Work
  3. [3] EU Compliance, Delivered Globally: Anthropic to Watermark Claude's Output Worldwide
  4. [4] Implicator AI Newsletter
  5. [5] Claude Will Now Leave a Watermark on Everything It Writes: What Does That Mean?
  6. [6] Anthropic Announces Watermark Detection API That Will Let Third Parties Detect Claude's AI Texts
  7. [7] Some Claude Users Are Mad That Anthropic's New Watermarks Will Catch Them Cheating at Their Jobs, Classes
  8. [8] Claude Subscribers Cancel Over Covert Watermarking
  9. [9] AI Pulse: A Claude Watermark Remover Shipped on GitHub Within 24 Hours
  10. [10] AI Watermark Removers Flood the Web, Almost None Can Prove They Work
  11. [11] Claude Watermark Remover GitHub Stars Surge
  12. [12] GitHub Tool Targets Claude Watermarks
  13. [13] New Models Will Mark AI-Generated Content From Day One: Claude Will Now Hide an Invisible Watermark Inside Ordinary Words

来源文章

Top 5

THE SIGNAL.

Analysts

认为任何超出服务读者需求之外影响词语选择的因素都是不正当的,水印算法必然有时会强制选择统计上更差的词语,从而在设计上降低了文本质量。

John Gruber
作家,Daring Fireball

坚持认为水印对读者不可察觉,且不影响输出质量,同时警告检测到的水印仅是一种概率性信号,而非作者身份的证明。

Anthropic
模型提供方(公司声明)
The Crowd

We’ve written an FAQ to answer some of the questions we've received about watermarking. In summary: • We’re implementing watermarking to comply with the EU AI Act. Other major model developers have signed the same Code of Practice and will also be implementing watermarking;

@@AnthropicAI4716

🚨 JUST IN: Claude models will now have invisible watermarks embedded in ALL text, and ALL metadata attached to files… https://t.co/TqBF55dRoK

@@ns123abc30481

Unsurprisingly, Claude refuses to install the watermark-removal plugin. There is probably nothing more to be said about that; it speaks for itself.

@@kimmonismus1520

Claude will watermark generated content, thank you EU

@u/N_P_K3700
Broadcast
Claude Now Watermarks Its Text. How Do You Even Do That?

Claude Now Watermarks Its Text. How Do You Even Do That?

Anthropic to watermark AI-generated text

Anthropic to watermark AI-generated text

Claude Is Hiding Watermarks in Your AI Text (What It Actually Means)

Claude Is Hiding Watermarks in Your AI Text (What It Actually Means)