信息安全研究 ›› 2026, Vol. 12 ›› Issue (E1): 153-157.

• • 上一篇    下一篇

一种鲁棒的多比特大语言模型水印方法

谢铮涵,吴梦婷   

  • 出版日期:2026-09-04 发布日期:2026-09-04

  • Online:2026-09-04 Published:2026-09-04

摘要: 随着LLM的广泛应用,其生成内容的版权保护与溯源问题日益凸显,水印技术成为关键的解决方案之一。然而,当前主流的KGW系列水印方法易受基于前缀分析的攻击,存在水印规则被窃取与失效的风险。为此,文章提出一种基于隐藏信息的多比特LLM水印方法。该方法利用预设的隐藏信息生成水印矩阵,并通过引入随机噪声实现动态变化,从而避免依赖固定的上下文特征,显著增强了水印的隐蔽性与抗攻击能力。水印通过轻微扰动模型输出的logits分布实现嵌入,无需额外训练,对模型生成质量影响甚微。实验结果表明,该方法在多种LLM上的水印提取假阳率低于0.07%,并能有效抵御基于放射性的水印中和攻击,同时保持文本困惑度无明显上升。本文为LLM提供了一种隐蔽、鲁棒且易于部署的水印保护方案。

关键词: 人工智能, 大语言模型, 隐蔽信息, 多比特水印, KGW

中图分类号: