← 文章 / AI技术
Anthropic 新闻 3小时前 · 2026-09-02 18:51:21 · 5 阅读

Claude 文字水印的工作原理

公告

Claude 文字水印的工作原理

2026 年 8 月 14 日 How Claude’s text watermark works

未来的 Claude 模型生成的文本将带有水印。这是一种判断「Claude 是否参与了撰写这段文本」的可能性的手段。我们与其他几家主要 AI 提供商一道实施这一变更,以遵守欧盟《人工智能法案》(EU AI Act)。

在本文中,我们就收到的部分问题给出解答:我们选定的水印方法如何工作、它是否影响 Claude 的输出,以及我们为什么要做出这一变更。先简要总结如下:

  • 我们采用的水印方法不会对 Claude 输出的质量或内容产生任何实际影响;
  • 对读者而言,带水印与不带水印的文本将无法区分;
  • 文本中没有添加任何东西,也不存在隐藏字符;
  • 水印不需要额外的 token,也不会带来更高的费用;
  • 水印不携带任何身份识别信息,无法追溯到特定的人、组织或对话;
  • 水印并非 Claude 独有。自 8 月 2 日起,欧盟要求服务其市场的 AI 提供商对 AI 生成内容进行标记。其他主要模型开发商也已签署同一份行为准则,并将实施各自的水印。

什么是水印?

像 Claude 这样的大语言模型的工作方式是一次生成一个词。每当模型决定下一个词时,它会从一列候选词中选择,最终依据前文选出最合理或最可能的一个。以句子「The weather today was cold and…」为例:下一个词几乎不可能是「sugary」,但很可能是「overcast」或「grey」。在多数情况下,模型最终从后两个词中选哪一个,对读者来说并无太大影响——无论选哪个,句子的意思大体相同。在这类情况下,选择由一个随机数决定。

水印正是利用这类「无关紧要」的选择——它们在一段生成的文本中会出现很多次——在 Claude 的回复中留下一种模式。这一模式读者无法察觉,但任何持有编码该模式之密钥的人能检测到。启用水印后,选择依然是随机的,只是随机性的来源变了:不再是任意的随机数生成器来挑选下一个词,而是由密钥加上前面的几个词共同决定模型该选哪个词。也就是说,Claude 挑选的词仍然是随机的,但如今人们可以检查词序列,看它是否与 Claude 使用该密钥时会作出的选择相一致。如果一致,就可以给出「该文本由 Claude 生成」的概率。

重要的是,模型并不是从此就总偏向 overcast 或 grey。与不带水印的文本一样,可能这一句选 overcast、下一句选 grey,取决于前面的词。水印方法也不会逼 Claude 去选它本来根本不会考虑的词(例如,它不会让 Claude 选「nubilous」这样的词——那是 overcast 或 grey 的一个生僻1同义词,正常情况下 Claude 几乎肯定不会用它)。

水印对 Claude 的输出有什么影响?

水印不影响 Claude 输出的质量。在读者眼里,带水印的回复与不带水印的回复毫无区别(从这个角度看,AI 水印与钞票、其他实物以及某些数字文档上的同名技术差别很大——那些水印是被肉眼看到的)。

在内部测试中,我们没有观察到水印对 Claude 文本的内容、创意水平或可读性产生任何影响。在介绍我们所用技术的 SynthID-Text 论文中,Google DeepMind 对这一影响做了测试:他们让一部分 Gemini 流量使用带水印的模型,并对比点赞与点踩的评分,结果发现与不带水印的模型相比没有统计学上的显著差异。在一项对照研究中,人类评审并排比较带水印与不带水印的回答,也未看出质量差异。

一个有用的类比:想象你在玩大富翁(Monopoly)之类的游戏。每一轮,玩家根据掷骰子的结果在棋盘上随机前进若干格。假设我们决定不掷骰子来获取随机性,而是改用一本记录圆周率 π 数字的册子2:从一个随机选定的数字开始(比如小数点后第 1,012,845 位,恰好是 6),从那一刻起,每位玩家的下一次「掷骰」就直接取用序列中的下一个数字。

无论从哪个角度看,这些步子依然是随机的:随机性来自 π 还是来自每次掷骰,对玩家——乃至对游戏结果——都没有任何影响。但如果复盘时能看到全部走子序列(而且我们知道 π 的值),就能推算出这局游戏是否可能用 π 来决定走子。用了 π 的那一局,某种意义上就是被「加了水印」。

Claude 生成的文本也是同样的道理。水印不会改变阅读者的意义理解或体验,但如果你想在事后核查某段文本是否可能由 Claude 生成,水印让你能够做到这一点。

你们用的是哪种具体的水印方法?

Claude 的文字水印是 Google DeepMind 2024 年在Nature 论文中发表的 SynthID-Text 方法的一个版本。它属于一个可追溯到 Scott Aaronson 2022 年一项提案的方法家族,它们都遵循我们上文描述的同一条设计原则——水印只改变「在候选词中做选择」所用随机性的来源。

水印的有效性存在局限。使用我们的密钥,只能回答「这段文本有多大可能部分由 Claude 撰写」这一问题。它无法确认文本是否为人类所写,也无法判断文本是否由另一个 AI 写成(即便那个 AI 也用水印,密钥也不同;它甚至可能采用完全不同的水印方法)。水印检测在小样本上效果也不佳——词的选择少,可依据的信息就少。随着文本篇幅变长,对「Claude 参与」的判断置信度也会随之提高。

在事实性段落上,水印会更稀疏——因为在不降低文本准确性的前提下,可供选择的余地更小。例如句子「Isaac Newton's most famous work was called Principia…」:下一个词是不是「Mathematica」至关重要(它是唯一正确的答案),水印在此无事可做。校对同理。如果你交给 Claude 一段文字,要求它只改语法和标点、其他一概不动,那么水印只能藏在那寥寥几处修改里,可能少到无法被检出。

Claude 校对或编辑过人类文字的情况呢?

水印只作用于 Claude 自己选择的词。当 Claude 校对一个人写的文本时,返回的通常只经过轻度修改;由于几乎所有词都出自原作者,水印几乎没有(甚至完全没有)可以附着之处。视文本长度和 Claude 修改幅度而定,这些改动可能不足以让「Claude 的参与」被检测出来。Claude 写得越多,需要做的决定就越多,水印可施展的空间也就越大。

代码呢?

如前文所述,AI 水印利用的是「选哪个词都一样好」的决策点。凡是要求精确输出的地方——没有选择的余地,换一个词就会在事实上出错或让代码崩掉——水印就不会施加。

例如,一旦模型写下「2 + 2 =」,下一个 token 的最佳选择就非常明确(如果模型是在算这道加法,没有任何答案能与「4」同样好;如果它是在谈乔治·奥威尔的《一九八四》(Nineteen Eighty-Four),也没有任何答案能与「5」同样好)。水印的「轻推」在这里不会施加。出于同样的原因,代码在绝大多数情况下必须精确,其水印密度通常低于其他形式的文本。

话虽如此,在代码内部确实存在任意选择特定词或术语的地方,水印仍然可用,比如代码注释。但顾名思义,它对实际生成的代码的影响可以忽略不计。

这对用户意味着什么?

这会让模型变慢或变得更贵吗?


不会。水印对模型速度的影响微乎其微,而且由于不产生额外 token,模型的服务与使用价格不变。

水印能追溯到我或我的组织吗?

不能。水印作用于 Claude 及其输出,不标识任何与个体用户有关的信息。无论水印还是其密钥中,都不存在任何能让他人还原用户、其组织或其与 Claude 对话内容的信息。

你们为什么要给 Claude 的输出加水印?

我们实施水印是为了遵守欧盟《人工智能法案》。2026 年 7 月,Anthropic 与其他几家主要 AI 模型提供商以及共计约 190 家签署方一道,签署了欧盟《AI 生成内容透明度行为准则》。该准则要求 AI 系统提供商使用对 AI 生成文本进行「标记」的方法。上线之初我们在全球范围应用水印,因为我们尚无按地区划定适用范围的可靠办法。我们会继续评估不同方案,并在有进展时分享更新。

其他问题

如何检测一段文本是否由 Claude 撰写?

我们正以私测预览(private preview)形式发布一个检测 API。目前它面向欧盟法律规定的合格组织开放(例如监管机构、执法部门、媒体、事实核查机构、独立研究者、教育机构以及欧盟公民社会组织),同样也向有义务核验水印以满足该法案合规要求的企业开放。我们计划逐步扩大检测 API 的访问范围。你可以在此登记使用意向。

图片和其他文件呢?

当 Claude 生成受支持类型的文件(如 .png、.jpg 或 .svg)时,它会在文件元数据中附带一份数字内容凭证——一段经密码学签名的小注释,声明该文件由 Claude 制作或处理。这是一个名为 C2PA 的开放行业标准,相机制造商和图像编辑软件也用它来记录图像来源。任何支持 C2PA 的工具都能读取它;我们也会提供自己的工具,拖入文件即可查验。

这种元数据标签与水印截然不同。文件本身没有任何改动——凭证既不嵌入也不隐藏。与文本一样,凭证只说明 Claude 参与了该文件的制作,不包含任何身份识别信息。

人们不能直接改写文本来绕过水印吗?

某种程度上可以。轻度编辑大概率无法完全去除水印;而逐词替换的彻底重写则可以。当然,在后一种情况下,这段文字还能否被称为「AI 生成」,本身就有争议了。

水印究竟能证明什么?

水印只能判断 Claude 可能在某个环节参与了内容制作。它无法区分「这段是 Claude 写的」与「这段是 Claude 深度编辑过的」。

翻译文本也带水印吗?

带。Claude 产出的翻译会带有水印,因为在这种情况下每个词都是 Claude 选择的。

旧版 Claude 模型呢?

欧盟法律为 2026 年 8 月 2 日之前发布的 Anthropic 模型设置了过渡期,我们正在为这些模型补充水印,并将在未来几个月内陆续推出。

这与 Pangram 之类的 AI 检测软件有何不同?

AI 检测软件用的是另一套方法,因为提供这类服务的公司并没有我们的密钥。这类服务会查看文本中的种种特征,比如 AI 措辞中常出现的或明显或隐晦的「马脚」。例如,AI 模型似乎偏爱「this isn't [X], it's [Y]」这样的句式,而且「quietly」一词的使用频率高得出乎意料。识别这些模式与检测水印有本质区别。

这会改变输出的所有权或法律责任归属吗?

不会。水印只是帮助检测内容是否可能由 Claude 生成或处理,不涉及所有权或作者归属,也不改变用户在我们条款下的权利。只有当 Claude 参与了内容或文件的处理时,我们才会应用水印。


2026 年 9 月 1 日更新:补充了水印检测 API 的最新信息。

脚注

  1. 或者你可以说「nubilous」——这个词恰好也是「obscure」(生僻)的同义词。
  2. 严格说来 π 是可预测的,但取自 π 中段任意位置的数字串,与掷十面骰得到的序列无从区分。另外,先不纠结大富翁的骰子只有 1 到 6、而 π 的一个数字可以是 0 到 9——这个类比并不完美。
原始来源: Anthropic 新闻

评论 (0)