TechRadar 6小时前 · 2026-09-18 20:28:31 · 3 阅读
AI 水印可能导致 LLM 守护栏行为不可预测,给欧盟 AI 法案带来挑战
- AI 水印旨在证明文本的真实性
- 新研究发现它还会改变 LLM 的行为——而且是往坏的方向
- 受欧盟 AI 法案影响,更多模型将带上水印,副作用也随之而来
Lasso 最新的研究显示,在测试 Google DeepMind 的 SynthID-Text 后发现,AI 水印可能在无意中改变 LLM 的行为。
Lasso 的研究人员发现,SynthID-Text 会影响模型是否拒绝有害请求、对 prompt injection 的抵抗力,以及 AI agent 选择哪些工具等等。
但从本质上看,SynthID-Text 这类水印技术的用途只有一个:在文本中嵌入机器可读的标记,以区分内容是 AI 生成还是人类撰写的。
Latest Videos FromTechRadar观看完整视频:研究人员发现 AI 水印会在无意中改变 AI 行为
Lasso 总结道,"水印过程既会影响模型说什么,也会影响 agent 做什么",并把这种副作用称为"sampling drift"(采样漂移)。
论文指出最令人担忧的一点是:即便没有攻击,水印也会改变部分模型的拒绝决策,让它们更愿意回答潜在有害的提示。如果再叠加 prompt injection,后果会被进一步放大。
尽管存在这些意外后果,Anthropic 近期还是宣布未来的 Claude 将采用与 Google DeepMind 类似的 AI 水印技术,并强调主要动因之一就是符合欧盟 AI 法案的要求。照此趋势,AI 水印将在更多模型提供商中普及,这类问题会变得更加常见,引发更多安全担忧。
最终,Lasso 建议开发者不要盲目地把水印套用到现有配置上,而是应重新运行 benchmark、安全评估等各类测试,排查是否出现意外后果。
拉斯奥总结道:“每当引入水印、或其配置与密钥发生变更时,都必须重新评估安全性。不应将这项研究视为反对使用 AI 水印进行溯源的理由。”
这项研究也为 AI 水印提供了一个新视角。迄今为止,研究人员主要关注水印是否能被有效地施加和检测,鲜少有人揭示出如此侧重于安全后果的影响。
原始来源: TechRadar