SevenTnewS

AI 透明度

Claude 的隐形水印即将到来:彻底重写即可消除它

Anthropic 将为未来的 Claude 模型添加隐形水印,以满足欧盟《人工智能法案》关于标注 AI 生成内容的规定。它免费且无法追踪,但会遗漏逐字代码、短段落和完全重写的文本。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-21 · 阅读需 5 分钟

Claude 的隐形水印即将到来:彻底重写即可消除它

未来的 Claude 模型将内置文本水印。Anthropic 将其描述为一种估算 Claude 参与撰写某段文字可能性的方式,并表示这一改变的公开理由是欧盟《人工智能法案》(EU AI Act)。该法案自 8 月 2 日起要求面向欧洲市场提供服务的人工智能提供商对 AI 生成的内容进行标注。Anthropic 于 2026 年 7 月签署了欧盟《人工智能生成内容透明度行为准则》(EU Code of Practice on Transparency of AI-Generated Content),成为约 190 个签署方之一。由于目前还没有一种可靠的方法按地区限定适用范围,Anthropic 将在全球范围内应用这一水印。

比机制本身更有意思的是 Anthropic 在同一篇博文中承认的内容。水印的设计初衷是让任何持有密钥的人事后查验,而不是为了抵御执意要移除它的人。轻度编辑可能无法将其彻底清除,但若有人把每个词都替换掉、做一次彻底重写,水印就会消失。欧盟的标注要求,最终依靠的是一个假定各方配合的工具来满足。

水印原理:替换随机性,而非替换词语

语言模型每次从一组候选词中选出一个词来生成文本。当多个候选词都同样合理时,选择便由随机数决定。在 "The weather today was cold and..."(今天的天气寒冷而……)之后,下一个词不会是 "sugary"(甜腻的),但完全可能是 "overcast"(阴天)或 "grey"(灰蒙蒙的)。水印改变的是这种随机性的来源。Claude 不再使用任意的随机数生成器,而是利用密钥和前面几个词来决定选择。词语仍然是随机的,也仍然限于 Claude 本来就会考虑的候选范围;该方法绝不会把模型推向诸如 "nubilous"(阴云密布的)这种几乎没人会想到的生僻同义词。

结果是读者完全看不到水印。任何持有密钥的人都可以将文本中的词语序列与密钥本应生成的序列进行比对,从而给出 Claude 生成该文本的概率。Anthropic 的实现是 SynthID-Text 的一个版本,这是 Google DeepMind 在 2024 年《自然》(Nature)论文中发表的方法,属于一个可追溯至 Scott Aaronson 2022 年提案的技术家族。在 SynthID-Text 论文中,DeepMind 在一部分 Gemini 流量上测试了该技术,结果显示,与未加水印的模型相比,点赞和点踩评分没有统计学上的显著差异。

Anthropic 自己打了个比方:在一款棋盘游戏中,玩家掷骰子的结果改由一本圆周率数字表来提供,而不是真正的骰子。对参与者来说,游戏过程完全一样,但一位知道数字序列的旁观者事后能推断出圆周率才是随机性的来源。Claude 的文本也是如此, , 体验完全相同,出处却可以核验。

水印的盲区:逐字代码与轻度编辑的文本

Anthropic 对盲区直言不讳。随着段落变长,检测的可靠性会提高,但短样本包含的词选择太少,不足以建立置信度。事实性文本则让水印无从下手:在 "Isaac Newton's most famous work was called Principia"(艾萨克·牛顿最著名的著作名为《原理》)之后,下一个词只能是 "Mathematica",没有同样合理的替代。代码的情况也基本类似。逐字输出没有可供微调的空间,因此代码携带的水印通常少于普通散文;但注释等相对随意的位置仍然可以被标记。

校对是另一个漏洞。当 Claude 编辑人类的文本时,几乎所有的词仍然是作者写的,少数几处修改可能少到无法被识别。Claude 写得越多,做出的选择就越多,水印的空间也就越大。翻译文本会被完整地打上水印,因为每个词都是由 Claude 选择的。

水印回答的也只是一个很窄的问题。它能估算 Claude 在某个环节参与过的可能性,但无法区分"Claude 写了这段文字"与"Claude 大幅编辑过这段文字",更不涉及所有权或署名权问题。

零成本、不可追踪、检测 API 即将推出

这项改动被设计得廉价且安静。水印不会产生额外的 token,对速度的影响也微乎其微,因此提供和使用 Claude 的成本不变。它不携带任何身份识别信息:水印或密钥中没有任何内容能让任何人还原出用户、其所属机构或聊天记录的细节。

查验水印需要密钥,这正是 Anthropic 表示将很快提供水印检测 API 的原因,具体实现细节仍在制定中。这同样把水印与 Pangram 等 AI 检测软件区分开来, , 后者没有密钥,而是通过扫描措辞痕迹(即模型输出中出现的细微习癖)来工作。检测与生成之间仍然是场军备竞赛,而生成方总是后手行动,我们在AI 内容工厂一文中记录过这一动态。

文件则走另一条路。当 Claude 生成 PNG、JPG 或 SVG 等受支持格式时,它会附加一个内容凭证, , 即使用 C2PA 标准在元数据中添加的一小段经加密签名的说明,与相机厂商使用的标准相同。与文本水印不同,文件中没有嵌入任何内容。任何支持 C2PA 的工具都能读取这段说明,而它只记录 Claude 参与了生成。对于 2026 年 8 月 2 日之前发布的旧版 Claude 模型,欧盟法律设有过渡期,它们将在未来几个月内获得水印功能。

方法标记对象验证方式主要局限
文本水印(SynthID-Text)Claude 选择的词语使用密钥对序列进行模式校验彻底重写即可移除
C2PA 内容凭证Claude 生成的文件(PNG、JPG、SVG)任何支持 C2PA 的工具读取加密签名存于元数据而非像素中
AI 检测软件(Pangram 等)任意文本,无需密钥对措辞痕迹进行模式匹配无法查验水印本身

这能否满足欧盟要求背后的意图,则是另一个问题。水印是一种带有公开边界的合规工具。它适用于事后无人改动的大段松散文本;但在代码、对人类文字的轻度编辑,以及任何被人费心重写的段落上,它都会失效, , 而这些恰恰是合成内容最易传播的领域。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。