Anthropic 已开始在其最新的 Claude 模型生成的所有文本中嵌入难以察觉的水印。这一变化于 2026 年 8 月 2 日在欧盟推出的车型生效,Anthropic 表示它将在全球范围内适用。
在签署《欧盟人工智能法案透明度实践守则》后,Anthropic 在一篇支持文章中列出了该计划。换句话说,这并不完全是自愿这样做的。该标记触及 Claude 的每一个表面,从聊天机器人和 API 到 Claude 代码以及 AWS、Google Cloud 和 Microsoft Foundry 等云合作伙伴。

“当受支持的 Claude 模型生成文本时,它会直接在文本本身中编织一个难以察觉的水印。你不会看到它,而且它不会改变 Claude 响应的含义、质量或可读性,”Anthropic 说。 “由于水印是文本的一部分,因此当将其复制并粘贴到其他地方时,它会随文本一起移动,并且可能会在某些编辑后保留下来。”
因此它比用户通常想到的方法要复杂一些。当受支持的 Claude 模型写入文本时,它会直接将难以察觉的水印编织到单词中,没有可见的标签。由于该标记是文本的一部分,因此它可以在复制粘贴后保留下来,而且 Anthropic 承认,“可能会通过一些编辑而保留下来”。文件获得第二层:根据 C2PA 开放标准签名的元数据(想象一下数字运输清单,记录谁生成了文件以及是否有人随后更改了该文件)。
方法保密
Anthropic 没有透露水印是如何制作的。支持文章将其称为模型级(模型是用它来训练的)和文本本机(例如,它不是像元数据生成器这样的外部工具),但检测文档和确切的技术尚未发布。
研究人员推断这是一个统计特征:该模型将其单词选择推向微弱的、可检测的偏差,这与谷歌在 SynthID Text 中使用的方法相同。在 Anthropic 发布探测器之前,这仍然是一个猜测。
但这并没有让隐私爱好者望而却步,一些专家已经在研究破解 Anthropic 秘密水印的方法。 mikiane/claude-watermark-cleaner(Github 上有 106 颗星)擦除不可见的 Unicode,然后使用非 Claude 模型重写文本以扰乱标记模式。
一个更大的项目,guillaumemeyer/watermarks-remover(Githum 上有 4.6k 星),在 PNG、JPEG、SVG、PDF 和 DOCX 中去除 Claude 文本标记以及 C2PA 和 SynthID 类信号。作者认为统计文本标记“不是证明来源的可靠方法”,并且主要促使用户花费第二次模型来清理自己的文字。在 Anthropic 运送其探测器和阈值之前,不能保证删除。
Anthropic 自身的历史使得隐私方面的反应更加尖锐。该公司在三月份删除了一个隐藏的 Claude Code 跟踪器,因为研究人员发现它通过未公开的 Unicode 标记标记了一些用户的位置和代理使用情况——同样的安静标记技术现在是水印计划的核心。
该标记证明了克劳德参与了文本,而不是它写了整个文本,因此它会将经过小编辑的原创作品视为完全由人工智能生成的文本。请克劳德校对或翻译你的段落,输出仍然可以携带信号。人择是坦率地说,大量的编辑可以去除它,并且缺失的标记并不能证明是人类写的东西。
美国的一项法案《复制法案》提出了同样的想法:一种为人工智能内容添加水印的标准化方法,以便平台可以追踪其来源。正如克劳德的勒索问题所表明的那样,该公司的模型已经因其如何处理所接触的文本而受到严格审查。
Anthropic 尚未透露何时会发布可让任何人验证该标记的检测工具。