Anthropic推出Claude文本水印
TECH

Anthropic推出Claude文本水印

38+
Signals

战略概览

  • 01.
    Anthropic现在通过一种改编自Google DeepMind的SynthID-Text的令牌选择方法,在Claude生成的文本中嵌入不可见的加密水印,该功能自2025年8月2日起对所有新发布的模型默认启用,并将很快推出公开的检测API。
  • 02.
    此次发布与《欧盟人工智能法案》第50条相关,该条款自2026年8月2日起生效,但Anthropic在加入约190个其他签署方共同签署欧盟透明度行为准则后,已在全球范围内对所有Claude平台实施该措施,且不提供退出选项。
  • 03.
    该水印不影响输出质量,且能抵御轻微编辑,但完全重写或大幅改写会将其清除——这一局限性使得对抗性移除工具在技术发布后数天内就开始被利用。
  • 04.
    公众反应两极分化:一些用户因担心轻微编辑会被误判为‘作弊’而公开取消订阅,另一些人则辩护称该标记是必要透明性的体现。

深度分析

机制原理及信号薄弱之处

Claude的水印是Google DeepMind于2024年发表在《Nature》上的SynthID-Text方法的一种变体,Anthropic已自动将其应用于2025年8月2日之后发布的所有Claude模型 [1][11]。Anthropic表示,水印对输出质量、创造力或可读性没有任何影响,带有水印的回复与未加水印的回复在阅读体验上无法区分 [3]

其底层机制是在生成每一步时引导模型选择某个词语,而非修改读者可见的内容:一个密钥结合最近上下文,在每个步骤中对多个合理的下一个词进行“淘汰赛”,而哪些词胜出会持续动态变化,因此不会永久偏好某个特定词或短语。持有相同密钥的检测器可以重新运行相同的评分过程,从而恢复文本留下的统计模式。Google自身对该方法的大规模测试(涵盖约2000万条Gemini实际响应)发现,点赞率差异仅为万分之一左右,延迟仅增加约0.5%,这解释了为何Anthropic能声称水印不影响输出质量。

不过,该信号并不均匀:短文本或事实密集型内容给予模型的替代词选择极少,因此此类输出的检测能力较弱 [3]。编辑抗性也遵循类似逻辑——水印可随复制粘贴保留,轻微编辑可能不会移除它,但若每个词都被替换的彻底重写,则会完全清除水印 [3]。TechCrunch直接指出轻度编辑的情况:如果内容仅被轻微修改,几乎所有的词都是人类作者自己的,水印几乎没有可依附的内容 [3]

一项合规截止日期演变为全球默认设置

触发因素是监管要求:《欧盟人工智能法案》第50条规定,向欧盟市场提供服务的AI供应商必须以机器可读形式标记AI生成内容,违规者将面临最高1500万欧元或全球营业额3%的罚款,该要求自2026年8月2日起具有强制执行力 [6]。Anthropic是约190个签署《欧盟人工智能生成内容透明度行为准则》的机构之一,该准则于2026年7月签署,早于上述截止日期 [2]。尽管如此,Anthropic并未将水印限制在欧盟流量范围内,而是将其推广至全球——包括Claude平台API、Claude.ai、Claude Code、Claude Cowork、Claude Tag,以及通过AWS、Google Cloud和Microsoft Foundry的部署——且未向任何用户提供退出选项 [2]。技术切换早于公告:自2025年8月2日起发布的所有Claude模型均已默认生成带水印文本,旧模型将在未来几个月内逐步支持 [1][5]

检测悖论:水印能证明什么,又不能证明什么

检测到的水印是一种概率判断,而非定论。the-decoder.com将Anthropic即将推出的检测API(仍在完善中)描述为可用于标记可能的AI参与,但明确承认其局限性:它只能表明Claude可能参与了文本创作,无法判断Claude是否撰写了全部内容,也无法判断文本是由人类还是其他AI模型生成的 [5]。这种水印所能证明的内容与人们期望其证明的内容之间的差距已引发摩擦——批评者警告,学校、雇主和平台可能会将标记结果视为确凿证据,尽管Anthropic自己强调标记仅表示内容‘可能经过Claude处理’ [4]。可靠性问题同样存在:2025年8月2日前发布的Claude模型生成的文本,或已被大幅重写的文本,可能完全不携带可检测的标记,这限制了该系统作为排除AI写作工具的有效性 [10]

规避手段已被商业化,用户反弹真实存在

允许第三方检查Claude水印的检测API,同时也成为攻击者击败水印的工具。报道称已有服务以每次约四美分的价格剥离水印,实质上利用检测器作为反馈循环来寻找无水印的改写版本 [9]。在Anthropic于8月15日发布技术说明的当天上午,GitHub上一个MIT许可的‘watermarks-remover’项目已获得超过1万颗星标,支持剥离Claude、SynthID-Text、OpenAI来源标记以及C2PA和EXIF文件元数据——这迅速而明显地反映出规避工具的巨大需求。用户间流传的技术估算认为实际重写阈值约为文档的四分之一:大约25%的文本需要被替换,才能使底层令牌模式崩溃到足以消除信号的程度,而使用不同模型进行重写则会嵌入该模型自身的水印。此外,一波欺诈性或含恶意软件的‘水印移除’应用也趁势涌现,利用这一需求牟利,预计随着更多供应商采用水印技术,该问题将进一步恶化 [8]

此次发布引发了真实的用户反弹:TechCrunch报道称,X平台上数十名用户声称因水印政策取消Claude订阅 [2],Reddit用户则意见分裂,一方认为这不公平地牵连了轻度编辑者(例如用Claude重组段落的学生),另一方则认为反对检测本身就很可疑 [4]。Fortune将这一根本矛盾描述为对‘AI垃圾内容’反弹的回应,却可能将合法的轻度使用与大规模低质生成混为一谈——一个笼统的‘AI’标签‘可能把生成上千条虚假新闻视频的人,与用Claude清理段落的写作者同等对待’ [7],正是这种张力促使一些用户称该政策是不公平地捕捉他们在学校或工作中‘作弊’的工具 [4]

历史背景

在《Nature》上发表了SynthID-Text水印方法,并开源了参考实现,随后在Gemini和Gemini Advanced中实际部署。
在第50条生效前签署了《欧盟人工智能生成内容透明度行为准则》。
《欧盟人工智能法案》第50条透明度要求开始具有强制执行力;Anthropic也将此设为所有新发布Claude模型默认支持水印的起始节点。
公开宣布将基于欧盟合规要求在全球范围内对Claude生成文本加水印,但实际应用范围更广,且不提供退出选项。
出现用户反弹,反对者认为水印可能将合法的轻度编辑使用暴露为AI生成内容,部分用户据称已取消订阅。
分享了有关水印及即将推出的检测API工作原理的更多技术细节,包括在编辑和短文本方面的局限性。

关键关系图

关键玩家
主题

Anthropic推出Claude文本水印

AN

Anthropic

Built and rolled out the text watermark and forthcoming detection API; signatory to the EU Code of Practice on Transparency of AI-Generated Content

GO

Google DeepMind

Originated the underlying SynthID-Text token-selection method, published in Nature (2024) and already deployed in Gemini

EU

European Union (AI Act Article 50)

Regulatory driver requiring machine-readable marking of AI-generated content for providers serving the EU market, with fines up to €15M or 3% of global turnover for non-compliance

CL

Claude users

Publicly split - some canceling subscriptions over fear of being falsely flagged for light editing, others defending the policy as transparency

TH

Third-party developers

Will gain access to Anthropic's detection API to build AI-content-detection features into their own apps

WA

Watermark-removal tool makers

Built adversarial tools stripping Claude/OpenAI/Gemini provenance marks within days of rollout; a wave of fraudulent and malware-laden 'removal apps' also emerged

事实来源

11 条引用
  1. [1] Claude's text watermark
  2. [2] Anthropic says it will watermark text generated by its AI models
  3. [3] Anthropic shares more details about how Claude's new watermarks will work
  4. [4] Some Claude users are mad that Anthropic's new watermarks will catch them cheating at their jobs, classes
  5. [5] Anthropic announces watermark detection API that will let third parties detect Claude's AI texts
  6. [6] EU compliance, delivered globally: Anthropic to watermark Claude's output worldwide
  7. [7] Anthropic Claude watermark AI text police AI slop
  8. [8] Lies And Scams Taint Watermark Removal Apps Now That Anthropic Started Watermarking Claude AI Outputs
  9. [9] Four Cents Strips Claude Watermark: Anthropic Detection API Confirms Evasion Oracle
  10. [10] Anthropic Claude Watermarks EU AI Act Code
  11. [11] Watermarking AI-generated text and video with SynthID

来源文章

Top 5

THE SIGNAL.

Analysts

报道称彻底重写会移除水印,而轻微编辑则可能不会:‘如果内容仅被轻微修改,那么几乎所有词语都来自人类作者,水印几乎没有(甚至完全没有)可依附的内容。’

TechCrunch
Watermark is technically sound but limited

将水印和检测API视为可用于标记可能AI参与的工具,但明确无法确立完整作者身份或区分不同AI模型:‘水印只能表明Claude可能参与了文本创作。’

the-decoder.com
Detection is probabilistic, not proof

认为笼统的‘AI’标签无法区分垃圾信息操作与用Claude轻度清理段落的人:‘这样的笼统‘AI’标签可能把生成上千条虚假新闻视频的人,与用Claude清理段落的写作者同等对待。’

Fortune
Watermarking risks conflating light use with mass low-quality generation

一些人认为水印不公平地牵连了轻度编辑者,比如用Claude重组段落的学生;另一些人反驳道:‘你唯一不想启用它的理由,就是想骗人。’

Reddit users (aggregated by TechCrunch)
Split between privacy/fairness concerns and pro-transparency support
The Crowd

We’ve written an FAQ to answer some of the questions we've received about watermarking. In summary: • We’re implementing watermarking to comply with the EU AI Act. Other major model developers have signed the same Code of Practice and will also be implementing watermarking;

@@AnthropicAI4493

Watermarking without quality loss is a bit unintuitive, doesn't feel like it should work. I made this artifact with Claude to help me understand how it works, sharing in case it's helpful. https://t.co/ALReoOH6tB

@@trq2123779

WATERMARK STRIPPER HITS 10,000 STARS DAYS AFTER ANTHROPIC SHIPS PROVENANCE Anthropic detailed how Claude's text watermark works last week. By this morning a MIT-licensed repo that strips it has 10,000 stars, targeting Claude, SynthID-Text and OpenAI marks, plus C2PA and EXIF in

@@AiBreakfast238

Claude will watermark generated content, thank you EU

@u/N_P_K3700
Broadcast
Claude Now Watermarks Its Text. How Do You Even Do That?

Claude Now Watermarks Its Text. How Do You Even Do That?

Anthropic to watermark AI-generated text

Anthropic to watermark AI-generated text

Claude Is Hiding Watermarks in Your AI Text (What It Actually Means)

Claude Is Hiding Watermarks in Your AI Text (What It Actually Means)