Anthropic 的 Claude 文本水印技术
TECH

Anthropic 的 Claude 文本水印技术

29+
Signals

战略概览

  • 01.
    Anthropic 从 2026 年 8 月 2 日起开始在新版本 Claude 模型生成的文本中嵌入不可见、机器可读的水印,该技术适用于 Claude 应用、API、Claude Code、Claude Cowork 以及通过 AWS、Google Cloud 和 Microsoft Foundry 部署的云服务。
  • 02.
    该水印通过在生成过程中影响 Claude 的词元(token)和词语选择来实现;Anthropic 表示,这种水印对读者不可察觉,且不会改变文本的意义、质量或可读性。
  • 03.
    生成的文件(如图像)则采用 C2PA 来源元数据签名,而非内容内嵌的隐形标记,而这些元数据很容易通过格式转换、重新保存或截图被剥离。
  • 04.
    此次部署与《欧盟人工智能法案》第 50(2) 条关于 AI 生成内容透明度的行为准则直接相关,该准则自 2026 年 8 月 2 日起生效,违规者可能面临高达 1500 万欧元或全球年营业额 3% 的罚款。

深度分析

Claude 的隐形水印究竟如何运作,以及信号在何处失效

Anthropic 的水印并非事后附加的标记,而是内嵌于 Claude 写作时的选词机制中。该系统采用与 Google DeepMind 的 SynthID 同类的词元概率偏置方法,“在文本生成过程中直接将其编织进文本本身”,不会改变其意义、质量或可读性[1]。公众对此技术覆盖范围的误解部分源于 YouTube 创作者的评论:分析师 Kyle Balmer 反驳了社交媒体上流传的“所有 Claude 回复现在都带有可公开检测的水印”的说法,指出误解根源在于《欧盟人工智能法案》中“提供者”与“部署者”的区分——Anthropic 是承担合规义务的“提供者”,而大多数 Claude 用户只是“部署者”。检测机制通过重新运行相同的统计检查,判断一段文本的词语选择是否比随机概率更偏向隐藏模式。文件处理方式则完全不同:生成的图像和其他文件会附加数字签名的 C2PA 来源元数据,而非内容内嵌标记,而这些元数据极易通过格式转换、重新保存或简单截图被剥离[2]。信号在不同类型内容中的表现也不一致——代码的词元选择自由度极低,导致水印本就微弱,一旦经过自动格式化工具处理或截取片段,残留信号也可能被抹除[3]。Anthropic 自身团队也承认该系统尚属早期、不完善,坦言“可以编辑它,但这只是第一步”[3]。在 X 平台上,AI 检测公司 GPTZero 的 CTO 进行了独立测试,报告称该标记无法抵御高强度的改写或人类用自己的语言替换内容——这暴露了其作为持久来源信号的现实缺陷。

“红字”困境:语法修改与全程代写被一视同仁标记

该政策最大的实际缺陷在于,它无法区分由 Claude 全程代写的论文和仅用于语法检查的段落。Anthropic 自身的文档也承认这一点:“检测到的标记并不能证明 AI 作者身份。人们常使用 Claude 进行校对、翻译、摘要或文件转换”[3]。这种模糊性正是 r/ClaudeAI 社区大规模激烈讨论的导火索,版主总结称社区共识明确反对该政策,许多观点援引 Anthropic 自家支持页面的内容,指出检测到的标记并非完全确凿的证据。独立测试者 Andrea Saez 构建了自己的绿名单/红名单检测器来验证这些说法,发现其底层统计方法会对完全普通的散文产生误报,这与广为人知的“圣经被标记为 AI 生成”案例属于同一类错误模式[4]。这对特定群体而言并非假设风险:相关报道引用的研究发现,检测器将超过 61% 的非英语母语者撰写的论文错误地标记为 AI 生成[5]。学生和教育工作者正处在这场争议的最前沿——学生担心轻微编辑的作业因带有标记而被误判为学术不端,而一些学校可能倾向于将检测到的水印视为确凿证据,而非概率性信号[6],这种反弹强烈到 Claude 用户公开担忧该标记会在工作和课堂中暴露自己[7]

Anthropic 独掌密钥,批评者称这才是真正问题

第二类批评与准确性无关,而完全关乎谁拥有裁决权。投资者 Bill Gurley 在 X 上指出,只有 Anthropic 能读取的水印根本不符合传统意义上的“水印”:“‘水印’一词源于照片,是所有人都可见的。而这个标记只有 Anthropic 能识别。他们再次成了法官、陪审团和检察官。”Steven Sinofsky 是前微软 Windows 总裁,现任职于 a16z,他从企业历史角度提出类似观点——企业隐形文档指纹技术已尝试数十年,而用户总能找到绕过方法:“几十年来,企业被发现对文档进行指纹标记的次数非常高。指纹从未能长期存在。”这两项批评都指向同一个结构性问题:由于只有 Anthropic 持有验证标记所需的密钥,当争议发生时,该公司独自决定何为“AI 生成”,而没有任何独立方能核查其判断。这种单一保管者设计,正是 Andrea Saez 自身测试从另一角度揭示的信任问题的强化版——一项无法独立复现的检测主张,无论对错都难以问责[4]

Anthropic 正在构建的检测 API 可能会削弱其初衷

Anthropic 承诺将推出免费公开 API,允许任何人检查一段文本是否带有水印,但截至 8 月 12 日尚未上线[8]。这符合欧盟的意图——第三方验证正是透明度准则旨在实现的目标。但一个免费、无配额限制的检测端点,同时也成了一个免费的规避“神谕”:像“Four Cents”这样的水印移除服务,可向该 API 大量发送文档的改写变体,直到标记消失,从而以极低成本利用 Anthropic 自身的合规工具来击败其合规措施[8]。若将 API 设为付费访问,则又会削弱欧盟为所有人提供的第三方验证要求。在 r/ClaudeCode 上,对此矛盾的反应呈现分歧:评论者提到了一个开源的“水印移除”代码库和已在流传的更简单变通方法——将 Claude 的输出重新输入一个无水印的第二模型进行重写。但该讨论中得票最高的评论引用了学术文献(arXiv 2301.10226),提出相反观点:真正的移除意味着从头到尾重写文本,这对想跳过此步骤的人来说构成了真实障碍。实际结果是,该水印主要捕捉那些本就不想隐藏的人,而真正的规避虽仍可能,但需要付出真实努力,而非免费的一键技巧。

历史背景

推出了 SynthID,这是主要 AI 提供商中首个大规模部署的水印系统,最初应用于图像,后扩展至文本、音频和视频。
《欧盟人工智能法案》第 50 条对生成式 AI 提供商的透明度义务开始生效,直接触发了 Anthropic 的全球水印部署。
公开宣布对 Claude 生成的文本和文件附加 C2PA 元数据,适用于所有新模型且全球无例外,无退出选项。
用户反弹加剧,担忧水印会暴露其在工作和学校中使用 AI 的行为;Anthropic 在同日确认将推出免费的自助文本检测 API。

关键关系图

关键玩家
主题

Anthropic 的 Claude 文本水印技术

事实来源

8 条引用
  1. [1] Anthropic pledges to embed watermarks to help discern AI slop in sop to EU
  2. [2] EU compliance, delivered globally: Anthropic to watermark Claude's output worldwide
  3. [3] Anthropic Claude Invisible Watermarks and C2PA, August 2026
  4. [4] Putting Claude's watermarking to the test
  5. [5] Claude watermark punishes the wrong people
  6. [6] Claude watermarks put AI-assisted work under a new microscope
  7. [7] Some Claude users are mad that Anthropic's new watermarks will catch them cheating at their jobs, classes
  8. [8] Four Cents strips Claude watermark as Anthropic detection API confirms evasion oracle

来源文章

Top 5

THE SIGNAL.

Analysts

认为水印对除 Anthropic 外的所有人隐形,使该公司成为 AI 生成内容的唯一裁决者,与真正的公开水印相比存在明显缺陷。

Bill Gurley
投资者,Benchmark

认为 Anthropic 选择了一种隐形且未经用户同意的标记方式,超出了欧盟规则的严格要求,并预测该指纹在实践中无法存续,呼应了数十年来企业文档指纹尝试失败的历史。

Steven Sinofsky
a16z 董事合伙人;前微软 Windows 总裁

认为水印制造了扭曲的激励结构:合法的轻度使用者与让 AI 全程代写文档的用户携带相同的可检测标记,而恶意行为者可通过改写轻易剥离标记。

Ivan Jackson
评论员,writehuman.ai

构建了自己的统计绿名单/红名单检测器来测试 Claude 水印的声明,发现该方法在普通文本上不可靠,会产生误报,类似于有记录的‘圣经被标记为 AI 生成’的案例。

Andrea Saez
独立分析师/博主

解释 Claude 的水印遵循了业界通用的 KGW 方法(对已生成的词元和密钥进行哈希,重新加权至‘绿色’词元集,从中采样),并报告其自身测试发现该水印无法抵御高强度的改写或人类文本替换。

Alex Cui
CTO,GPTZero
The Crowd

🚨 JUST IN: Claude models will now have invisible watermarks embedded in ALL text, and ALL metadata attached to files…

@@ns123abc30400

JUST IN: Claude will now invisibly watermark AI-generated text so it can be detected after being copied & pasted.

@@Polymarket24409

Claude's watermark probably doesn't work how you think. As the CTO of GPTZero, I'll explain how Anthropic, Google and OpenAI are building text watermarking in this brief explainer and whether it can be defeated. Almost all forms of watermarking that are fast and cheap enough for a frontier lab have the same formula, following the KGW method: In generation, take the n tokens generated so far plus a secret key to produce a hash, use that hash to reweight the probability of the next token toward a 'green' word set, and sample from there. Detection reruns the hash to check whether tokens were disproportionately drawn from the green set. In my testing, the watermarks don't survive intense paraphrasing (especially word choice + syntax attacks combined) or human text substitution.

@@alexcdot5941

Claude will watermark generated content, thank you EU

@u/N_P_K3600
Broadcast
Invisible watermarks are coming to Claude's AI-written text

Invisible watermarks are coming to Claude's AI-written text

Claude Is Hiding Watermarks in Your AI Text (What It Actually Means)

Claude Is Hiding Watermarks in Your AI Text (What It Actually Means)

Claude's New AI Models Are Watermarked

Claude's New AI Models Are Watermarked

Anthropic 的 Claude 文本水印技术 — AI 新闻 | Agentic Brew