机制原理及信号薄弱之处
Claude的水印是Google DeepMind于2024年发表在《Nature》上的SynthID-Text方法的一种变体,Anthropic已自动将其应用于2025年8月2日之后发布的所有Claude模型 [1][11]。Anthropic表示,水印对输出质量、创造力或可读性没有任何影响,带有水印的回复与未加水印的回复在阅读体验上无法区分 [3]。
其底层机制是在生成每一步时引导模型选择某个词语,而非修改读者可见的内容:一个密钥结合最近上下文,在每个步骤中对多个合理的下一个词进行“淘汰赛”,而哪些词胜出会持续动态变化,因此不会永久偏好某个特定词或短语。持有相同密钥的检测器可以重新运行相同的评分过程,从而恢复文本留下的统计模式。Google自身对该方法的大规模测试(涵盖约2000万条Gemini实际响应)发现,点赞率差异仅为万分之一左右,延迟仅增加约0.5%,这解释了为何Anthropic能声称水印不影响输出质量。
不过,该信号并不均匀:短文本或事实密集型内容给予模型的替代词选择极少,因此此类输出的检测能力较弱 [3]。编辑抗性也遵循类似逻辑——水印可随复制粘贴保留,轻微编辑可能不会移除它,但若每个词都被替换的彻底重写,则会完全清除水印 [3]。TechCrunch直接指出轻度编辑的情况:如果内容仅被轻微修改,几乎所有的词都是人类作者自己的,水印几乎没有可依附的内容 [3]。



