水印在底层是如何运作的
Anthropic 的实现方式是 Google DeepMind 于 2024 年在《自然》杂志首次发表的 SynthID-Text 技术的一种变体:模型不会让任意随机数生成器选择下一个词,而是使用密钥和前文内容来影响下一个词元(token)的选择 [1]。Anthropic 坚称这不会影响输出质量,且对人类读者而言,加水印的回复与未加水印的回复无法区分 [1]。但该公司后续披露的信息使这一说法变得复杂:该信号在短文本、事实密集或代码密集的文本中明显更弱,而彻底重写(每个词都被替换)可以完全去除水印 [2]。不过,并非所有人都认为质量必然下降:Reddit 上一篇获得最多点赞的反驳(u/Blothorn)认为,现实中的质量影响应非常轻微,因为算法刻意保持其诱导的偏差非常小。该话题下最受关注的技术解析之一将该机制重新描述为“在合理候选词之间进行的淘汰赛”,由相同的“密钥+上下文”方法决定种子顺序——并指出即使 Claude 仅用于校对人类已撰写的内容,该偏差仍然适用,因为最终出现在页面上的词语仍是由模型选择的。



