Anthropic 解释 Claude 不可见文本水印的工作原理
Anthropic 阐明了计划如何为 Claude 生成的文本添加不可见水印,以符合欧盟的 AI 透明度规则。周五,Anthropic 宣布 Claude 的文本标记系统是“SynthID-Text 方法”的一个版本——这是一种由 Google DeepMind 开发的开源水印技术,利用词语概率创建可检测的模式。
除了支持 Claude 处理图像的 C2PA 外,Anthropic 还引入了这一水印功能,以满足欧盟《人工智能法案》的要求。该法案要求合成音频、图像、视频和文本必须包含机器可读标记,以便检测内容是否为人工生成或被篡改。Anthropic 表示,文本水印不会增加用户的使用成本,也不会对 Claude 输出的质量或内容产生实际影响。以下是 Anthropic 对其工作原理的解释:
以句子“The weather today was cold and...”(今天天气很冷且……)为例。下一个词不太可能是“sugary”(甜的),但很可能是“overcast”(阴天)或“grey”(灰色的)。在大多数情况下,模型最终选择这两个词中的哪一个对读者来说差别不大——句子的含义基本相同。在这种情况下,选择由随机数决定。
水印利用此类低风险选择——在生成的文本中会多次出现——在 Claude 的回复中留下一种模式。这种模式对读者是不可见的,但持有编码密钥的人可以检测到。当使用水印时,选择仍然随机,但随机数的来源不同。水印不是使用任意的随机数生成器来选择下一个词,而是使用密钥和前几个词来决定模型应该选择哪个词。
正如 Anthropic 指出的,欧盟的 AI 透明度要求同样影响其他主要 AI 开发商,因此 Claude 并非唯一引入文本水印的模型。自 2024 年起,Google 的 Gemini 聊天机器人就支持了 SynthID-Text 方案;虽然 OpenAI 在其 AI Act 合规路线图中尚未详细说明 ChatGPT 的文本水印计划,但该产品也将受制于相关法律要求。