【工学科普】防 “偷”AI!大模型的安全招
点击蓝字 关注我们





大语言模型水印是怎么生成的


“这篇学术论文是 AI 代写的吗?”“这条热点新闻会不会是生成式造假?”当大语言模型(LLMs)在文案、科研、新闻等领域崭露头角,一段精彩的文字到底是人类的智慧结晶,还是大语言模型的“手笔”成为了世界第十一大未解之谜。

图1 2025年国内外AI大模型排行
而大语言模型水印技术,恰似给AI生成内容定制的“隐形身份证”,既能悄悄解开“是人还是AI创作”的谜题,还能在版权保护、内容溯源等场景中大展身手。

图2 MarkLLM(LLM的水印开源技术)
给大语言模型“打水印”主要是通过在文本生成过程中植入不可察觉的统计特征来实现的,其中输出水印技术的应用最为广泛。比如Google开发的多模态人工智能大模型Gemini采用的就是输出水印技术。

图3.1 Gemini给图像加了水印和未加水印的对比图 来源:The Verge网站
生成输出水印的核心机制是在不影响文本流畅性的前提下,通过计算上下文哈希值从而生成绿色列表,然后依据该列表进行偏置采样的闭环操作,为大语言模型植入仅水印检测方可识别的“统计指纹”。

图3.2 输出水印方法
Step 1. 上下文哈希生成:让水印“绑定具体输入”
给模型输入的话(比如“今天天气如何”),先把这句话里每个词的“隐藏语义信息” 揉成一个独一无二的“数字串”(这就是哈希值),再把这个数字串剪短成固定长度的“密码”(动态密钥)。比如你问“今天天气如何”,会算出一个密码;问“明天是否下雨”,就会算出另一个完全不一样的密码。接下来选哪些词当“水印专用词”(绿色列表),全靠这个密码来定——密码不一样,选的专用词也不一样。
Step 2. 绿色列表筛选:定义“水印的统计载体”
根据第一步生成的“动态密钥”,再使用伪随机数生成算法从大模型认识的所有词汇表中筛选出“绿色列表”,未被选中的即为“红色列表”。

图4 绿色列表筛选的流程图
Step 3. 偏置采样:强制植入“统计特征”
在给模型定好“绿色词”(要优先选的)和“红色词”(要少选或不选的)后,就开始对它们进行“偏心调整”——绿色词就多给它被选中的机会,而红色词则降低或者直接剥夺它被选中的权力。

图5 大语言模型水印有无状态下的
文本与检测指标对比

大语言模型水印的检测方法


了解了水印的生成方式后,我们可以发现——人类在创作时使用的语言是随机的,而AI生成文本时会因为给定的逻辑偏好选择特定的词汇。检测算法则是依靠统计文本中“绿色列表词汇”出现的频率来判断文本是否由AI生成。
Step 1. 低熵 “噪音过滤”:剔除低熵词汇对检测的干扰影响
所谓低熵词汇,就是在文本生成时确定性极高,几乎不存在其他选择的词汇。例如“1+1=”的后面生成“2”、“2008年北京”的后面生成“奥运会”、“喜羊羊与”的后面生成“灰太狼”。一言以蔽之,排除低熵词汇影响的本质就是避免让“必然生成词汇”干扰“绿色列表词汇”的统计准确率。

图6 利用豆包展示低熵词汇的“确定性”
Step 2. 绿词“概率称重”:频率转化为判定概率值
由于人类在创作时使用的语言是随机的,所以可以近似看为使用的词汇均匀分布在红绿列表词汇中,而AI则更倾向于生成“绿色列表”中的词汇。利用这一特点,根据密钥和上下文获取每个词汇属于绿色词汇还是红色词汇后,就可以通过计算绿色词汇数量的期望构造z统计量,判断z-score的值是否超过阈值(文本中含有水印的分数临界值)来判定水印是否存在。

图7 z分数的计算和判断
Step 3.水印全流程保障:质量评估四维度
我们可以把评估指标总结为四个方面:成功率(Success Rate)、文本质量(Text Quality)、鲁棒性(Robustness)、不可伪造性(Unforgeability)。水印检测的成功率就像通过扫码判断能不能成功付款,要看它可不可以准确认出自己的水印。文本质量则是考察添加了水印的AI文本读起来是否前言不搭后语。万一有人想在水印上做手脚,被篡改后的水印能不能被认出来,这就要靠鲁棒性把关。而不可伪造性则是检测有心之人能否伪造水印的关键。

图8 评估水印质量的四个方面

大模型水印技术的应用


在版权保护方面,当大语言模型被非法复制并用于商业用途,模型的开发者可以通过检测输出内容中的水印,来追踪非法使用者,并通过法律手段来保护自己的知识产权。
在内容溯源方面,水印可助力企业追溯 AI 协作材料的生成模型、便利流程管理,也能让科研领域明确 AI 辅助实验文本的模型版本,确保内容来源可追溯。
但当前大模型水印技术尚未发展成熟,其检测结果仍存在局限性,不可作为唯一依据完全依赖。

图9 生成式人工智能服务管理暂行办法

图片素材来源于网络,如有侵权请联系
参考文献:
[1]秦中元,王田田,刘伟强,张群芳.大语言模型水印技术研究进展[J].信息网络安全,2025,25(02):177-193.
[2]刘述,储志强,张俊霞,张雷,李红阳.大语言模型生成水印的研究[J]信息技术与信息化,2024,2024(05):203-205.
[3]付志远,陈思宇,陈骏帆等.大语言模型安全的挑战与机遇[J]信息安全学报,2024,9(05):26-55.
[4]Kirchenbauer, J., Geiping, J., Wen, Y., Katz, J., Miers, I., Goldstein, T.. A Watermark for Large Language Models [C]. 国际机器学习会议(ICML),2023.

