Anthropic悄然为Claude AI输出添加隐形水印,开发者已尝试破解
Anthropic已开始在其最新Claude模型生成的所有文本中嵌入不可见水印。这一变更于2026年8月2日在欧盟发布的模型上生效,并计划推广至全球。Anthropic在签署欧盟AI法案透明度实践准则后,在一篇支持文章中公布了该计划——换言之,这并非完全自愿行为。该水印覆盖所有Claude交互界面,包括聊天机器人、API、Claude Code以及AWS、Google Cloud、Microsoft Foundry等云合作伙伴。
“当受支持的Claude模型生成文本时,它会将不可见的水印直接织入文本本身。你看不到它,它也不会改变Claude回复的含义、质量或可读性,”Anthropic表示。“由于水印是文本的一部分,当文本被复制粘贴到其他地方时,水印会随之传播,并可能在某些编辑后仍然存在。”因此,这比用户通常想象的简单方法更为复杂。当受支持的Claude模型撰写文本时,它会将不可见水印直接嵌入文字中,没有可见标签。由于水印是文本的一部分,它能在复制粘贴后幸存,并且Anthropic承认“可能在某些编辑后仍然存在”。文件则获得第二层保护:基于C2PA开放标准(一种数字运输清单,记录文件的产生者以及后续是否被篡改)的签名元数据。
方法保密,开发者已开始破解
Anthropic尚未公布水印的生成方式。支持文章称其为“模型级”(模型在训练中嵌入)和“文本原生”(非外部工具如元数据生成器),但检测文档和具体技术尚未公开。研究人员推测这是一种统计签名:模型通过微调词选择偏向一种微弱的、可检测的倾向,与Google在SynthID Text中使用的方法类似。但这仍只是猜测,直到Anthropic发布检测器。然而,这并未阻止隐私爱好者,一些专家已开始研究破解Anthropic秘密水印的方法。GitHub项目mikiane/claude-watermark-cleaner(106星)可以清理不可见Unicode字符,然后用非Claude模型重写文本以扰乱token模式。更大的项目guillaumemeyer/watermarks-remover(4.6k星)则能去除Claude文本水印,以及PNG、JPEG、SVG、PDF、DOCX格式中的C2PA和SynthID类信号。作者认为统计文本水印“不是可靠的原产地证明方式”,主要迫使用户多花一次模型推理来清洗自己的写作。在Anthropic发布其检测器和阈值之前,无法保证任何去除方法有效。
隐私争议与历史纠葛
Anthropic自身的历史加剧了隐私反应。今年3月,该公司在研究人员发现其通过隐藏的Unicode标记记录部分用户位置和代理使用后,删除了一个隐藏的Claude Code追踪器——这正是如今水印计划中使用的相同静默标记技术。该水印证明Claude参与了文本生成,而非完全由AI撰写,因此它会将一篇经过少量编辑的原创作品与完全AI生成的文本同等对待。让Claude校对或翻译你的段落,输出仍可能携带该信号。Anthropic坦诚重度编辑可以去除水印,且缺失水印不能证明文本由人类撰写。美国《COPIED法案》推动了类似理念:一种标准化的AI内容水印方式,使平台能够追溯其来源。正如Claude此前面临的勒索问题所示,该公司模型已经因处理文本的方式而受到严密审视。Anthropic尚未公布何时发布允许任何人验证水印的检测工具。
