Claude 文本水印靠换词 会不会动语义
转述 Anthropic 语义水印机制与 Gruber 批评:绿/红词表偏置下一 token,长文可检、短文无力,且可能改变措辞。

Anthropic 为合规推进「给 Claude 生成内容打标」。John Gruber 在 Anthropic’s ‘Watermark’ Text Adulteration… 里指出:真正落地的不是藏不可见字符,而是推理时微调下一 token 的选词偏置(语义隐写)。支持页曾写「不可感知、不改意义/质量/可读性」;批评方认为选词偏置本身就会动措辞,谈不上零代价。
机制一句话
在每个生成点,词被动态划进「绿/红」名单;模型略偏好绿名单。持有密钥的一方可统计绿词是否偏多,从而概率判断「像不像打过该厂水印的文本」。字数越多置信度越高;太短则几乎无结论。密钥在提供商手里:Claude 检不出 Gemini 的标,反之亦然。
和「看不见字符」差在哪
不可见 Unicode 理论上可不改可见语义;语义水印改的是概率分布,同一问题可能换成近义词、句式或细节顺序。对多数聊天无感,对合同措辞、文学翻译、精确技术说明,任何系统性选词偏置都值得产品经理写进风险清单。Gruber 的核心指控是:官方先承诺不改质量,后文才解释实际是偏置采样。
对开发者意味着什么
API / Claude Code 是否同步启用、能否关闭、企业合同如何披露,以 Anthropic 当时生效文档为准。若你的流水线要「可复现同一措辞」,水印开启后的非确定性会再叠一层。检测权集中在厂商,第三方无法自建同等检测器。关注政策区(如欧盟标记要求)与关闭开关,而不是自己发明「去水印」脚本。