OpenAI 将在欧盟为 ChatGPT 文本添加水印,API 用户可自选关闭
OpenAI 正在为 ChatGPT 生成的文本添加隐形水印,以符合欧盟法规。但与 Anthropic 不同的是,全球的 API 客户都可以选择关闭这一功能。
据报道,欧盟《AI 法案》要求 AI 提供商以机器可读的格式标注生成文本。OpenAI 的应对方案是 textGrain——一种在模型的选词中嵌入隐形统计信号的技术,原理与 Claude 的 SynthID 水印类似,后者基于 Google 的开源技术。
OpenAI 表示,未来几周内将为欧盟地区的 ChatGPT 和 Codex 用户启用水印功能。与 Anthropic 对 Claude 的强制水印不同——后者覆盖全球所有访问方式——OpenAI 的 API 水印在全球范围内均为可选项。此外,微软 Azure 等云合作伙伴也将在未来几周内提供这一功能。
文本一经编辑,检测率大幅下降
OpenAI 称,在内部测试中,textGrain 的表现持平甚至超过了其他方案,包括 Google 的文本版 SynthID。该公司还计划将这项技术开源,供他人在此基础上开发。
检测率在很大程度上取决于文本长度和主题。在将检测器的目标误报率设为 1% 的情况下,对于 400 token 左右的心理学文本,水印识别率约为 95%;文本缩短到 200 token 时,识别率降至约 80%。
OpenAI 表示,数学类内容的检测率要低得多,因为模型在选词上的自由度更小。更长的文本可能会增强统计信号、提高检测率,但效果仍取决于具体内容。OpenAI 并未提供可用于验证这一推测的数据。

文本编辑也会增加水印检测难度。OpenAI 表示,若将 400 token 段落的 10% 单词替换为同义词,检测率会从约 92% 降至 66%;若替换 25% 的单词,检测率会进一步降至 17%,使水印极易被规避。这一弱点可能反而有利于 OpenAI。如果其水印变得更难移除,那些不希望被检测到使用 ChatGPT 的用户可能会转而使用开放权重模型。

一份技术报告深入解析了 textGrain 的工作原理。Anthropic 尚未公布 Claude 水印的检测率,尽管该公司声称其系统对编辑具有较强韧性。
OpenAI 表示水印不会损害输出质量,并引用了其前沿模型 Astra 的测试数据。该公司称,在包括 GPQA Diamond、BrowseComp 和 DeepSWE 在内的八项基准测试中,无论开启还是关闭水印,模型性能均无显著差异。这些结果并未证明水印是否影响写作质量,而批评者也对此曾对 Claude 的水印提出过质疑。
OpenAI 同时表示,检测到水印无法说明文本中包含了多少人工创作或编辑。它不能确立所有权、划分责任、识别用户,也无法证明文本内容是否准确。反过来,未检测到水印也不能证明该文本由人类撰写,原因可能是篇幅过短、经过编辑或翻译,又或者文本来自检测器尚未支持的模型。
OpenAI 暂时限制检测工具的访问权限
初期只有部分研究人员和专业机构可以获得 textGrain 检测工具的访问权限。他们需要通过1申请表提交申请。OpenAI 将根据欧盟《行为准则》逐案授予访问权限。Anthropic 在其检测 API 中也采用了类似的2做法。
该工具仅报告是否检测到 OpenAI 水印。它不会识别用户,也不会透露用户的提示词或对话内容。
OpenAI 称,限制访问权限是因为检测器可能会标记未加水印的文本,或漏检已有水印的文本。该公司计划在“相信检测结果能被负责任地解读时”扩大访问范围,但尚未说明具体时间。
现有的图像和音频验证工具仍然面向公众开放,包括3openai.com/verify 和4内容来源 API(Content Provenance API)。
Footnotes: 1 [application form](https://openai.com/form/content-provenance-api/) 2 [approach with its detection API](https://the-decoder.com/anthropic-announces-watermark-detection-api-that-will-let-third-parties-detect-claudes-ai-texts/?cmpscreencustom=1) 3 [openai.com/verify](https://openai.com/verify/) 4 [Content Provenance API](https://developers.openai.com/api/docs/guides/content-provenance)