Anthropic已开始将肉眼不可见的水印嵌入其最新Claude模型生成的文本中。该变更自2026年8月2日起适用于在欧盟推出的模型,公司表示将推广至全球。Anthropic在签署欧盟AI法案透明度行为准则后发布了一篇支持文章概述了该计划——因此并非完全自愿。

Anthropic表示:“当受支持的Claude模型生成文本时,它会将不可见水印直接编织到文本本身中。你看不到它,也不会改变Claude回复的含义、质量或可读性。”“因为水印是文本的一部分,所以当你复制粘贴到其他地方时,它会随文本一起传播,并且可能在一些编辑后仍然存在。”这比用户通常想到的方法要复杂一些。
受支持的Claude模型写作时,会把不可见水印直接编织进词语中,没有可见标签。由于该标记是文本的一部分,它能在复制粘贴后保留,且Anthropic承认“可能在一些编辑后依然存在”。文件则获得第二层保护:采用C2PA开放标准下的签名元数据——就像一张数字运输清单,记录谁生成了文件以及之后是否有人改动过。
具体方法仍然保密。Anthropic尚未说明水印是如何制作的。支持文章称其为模型级(模型经过训练自带)且文本原生(并非元数据生成器之类的外部工具)。检测文档和确切技术尚未发布。研究人员推测这是一种统计签名:模型将其用词选择推向一种微弱的、可检测的偏差——与谷歌SynthID Text使用的方法属于同一家族。在Anthropic公布检测器之前,这仍是猜测。
但这并没有阻止隐私爱好者的反对,一些专家已经在研究打破Anthropic秘密水印的方法。mikiane/claude-watermark-cleaner(GitHub上106颗星)会清除不可见的Unicode字符,然后用非Claude模型重写文本以扰乱token模式。更大的项目guillaumemeyer/watermarks-remover(GitHub上4.6k颗星)则去除Claude文本标记以及C2PA和SynthID类信号,涵盖PNG、JPEG、SVG、PDF和DOCX格式。作者认为,统计文本标记“不是证明来源的可靠方式”,主要是让用户花第二次模型pass来清理自己的写作。在Anthropic发布其检测器和阈值之前,任何去除方法都无法得到保证。
Anthropic自己的历史让隐私反应更加尖锐。该公司在三月份删除了一个隐藏的Claude Code追踪器,此前研究人员发现它通过未披露的Unicode标记对部分用户的位置和代理使用进行标记——正是现在水印计划核心的同类静默标记技术。
该标记证明Claude参与了文本的生成,但不代表它写了全部内容,因此它对待带少量编辑的原创写作与完全AI生成的文本没有区别。要求Claude校对或翻译你的段落,输出仍可能携带该信号。Anthropic坦承深度编辑可以去除它,而且缺失标记并不能证明内容由人类撰写。
美国一项名为COPIED法案的法案也推动同样的理念:一种标准化的方式对AI内容进行水印,让平台可以追踪其来源。正如Claude的“勒索”问题所显示的,该公司的模型已经因其处理的文本而受到密切关注。Anthropic尚未说明何时会发布检测工具,让任何人能够验证该标记。
