Claude 的隐形水印究竟如何运作,以及信号在何处失效
Anthropic 的水印并非事后附加的标记,而是内嵌于 Claude 写作时的选词机制中。该系统采用与 Google DeepMind 的 SynthID 同类的词元概率偏置方法,“在文本生成过程中直接将其编织进文本本身”,不会改变其意义、质量或可读性[1]。公众对此技术覆盖范围的误解部分源于 YouTube 创作者的评论:分析师 Kyle Balmer 反驳了社交媒体上流传的“所有 Claude 回复现在都带有可公开检测的水印”的说法,指出误解根源在于《欧盟人工智能法案》中“提供者”与“部署者”的区分——Anthropic 是承担合规义务的“提供者”,而大多数 Claude 用户只是“部署者”。检测机制通过重新运行相同的统计检查,判断一段文本的词语选择是否比随机概率更偏向隐藏模式。文件处理方式则完全不同:生成的图像和其他文件会附加数字签名的 C2PA 来源元数据,而非内容内嵌标记,而这些元数据极易通过格式转换、重新保存或简单截图被剥离[2]。信号在不同类型内容中的表现也不一致——代码的词元选择自由度极低,导致水印本就微弱,一旦经过自动格式化工具处理或截取片段,残留信号也可能被抹除[3]。Anthropic 自身团队也承认该系统尚属早期、不完善,坦言“可以编辑它,但这只是第一步”[3]。在 X 平台上,AI 检测公司 GPTZero 的 CTO 进行了独立测试,报告称该标记无法抵御高强度的改写或人类用自己的语言替换内容——这暴露了其作为持久来源信号的现实缺陷。



