系统:运行中
← 返回所有攻击
GOVERNANCE MEDIUM NEW

AI 文本水印一经改写便消失——难以充当法庭证据

2026 年 7 月的一项研究测试了 KGW、Unigram 与 SynthID 在改写下的表现:几乎所有被检出的水印都被抹除,且没有一种达到司法证据的标准。

2026-07-21 // 6 min affects: synthid, kgw-watermark, unigram-watermark, llm-text-provenance

这是什么?

2026 年 7 月 20 日,一篇题为 AI Watermark Evidence Fails Forensic Readiness: An Empirical Evaluation 的论文(arXiv:2607.16010)对一个被反复引用的政策假设进行了检验。各国政府越来越多地要求 AI 生成的文本携带水印:欧盟《人工智能法案》要求标记”足够可靠且稳健”,加州 SB 942 法案要求披露”永久或极难移除”。这两项规定都建立在同一个从未被验证的前提之上——即水印检测能够产出足够可靠、可用于法庭或合规审计的证据。

该研究直接用三种知名的文本水印方案——KGW、Unigram 以及 Google DeepMind 的 SynthID——来检验这一前提,结果表明前提并不成立。一个只要有人稍加改写段落即可移除的水印,并不是可靠的来源标识;而一个会在人类撰写的文本上误报的检测器,也不适合充当证据。

工作原理

文本水印会按照一种可被统计检测的模式偏置模型对 token 的选择,从而使后续的检测器能够估计某段文字是否来自被加水印的模型。该方法只有在这一模式能够经受住对文本的普通处理、且检测器几乎不会在真正由人撰写的内容上触发时,才能奏效。

论文强调了这两方面要求。在稳健性方面,作者在每种方法下针对 15 个多样化的提示进行了 846 次有效的改写试验。所有最初被检出的 KGW 与 Unigram 段落,在经过一轮改写后都失去了水印——条件移除率为 100%——而 SynthID 也仅略好,为 98.3%。这无需任何攻击代码:改写是人人可用的普通编辑操作。在可靠性方面,即使不经任何篡改,假阴性率本就很高:KGW 约 70%,Unigram 约 83%,SynthID 约 80%。SynthID 的配置还把 5.4% 经改写的人类对照文本误标为”AI 生成”,并呈现出 18.6% 的”悖论”率——甚至有 80% 未受损的自家加水印输出落入不确定的判定盲区,而非给出明确结论。

为将其转换为法律用语,作者依据美国法院用于衡量科学证据的五项 Daubert 因素逐一评估每种方法。三种方案没有一种能满足其中两项以上。一项相关的信息论分析 Watermark Forensics for Generative ModelsarXiv:2607.13003,2026 年 7 月 14 日)从理论上得出了同样的结论:检测边界根本不足以达到法庭所要求的确定性。

为什么重要

水印正被写入法律,仿佛它已是成熟的来源认证机制,而事实并非如此。如果检测器大多数时候都返回假阴性,那么”没有水印”几乎说明不了什么:一份真正由 AI 生成的文档,经过简单改写即可被当作人类所写。如果检测器在真正由人撰写的文本上有百分之几的概率触发,那么”存在水印”就可能错误地指控一个自己动手写作的人。当输出被用于裁定著作权纠纷、学术诚信案件、选举虚假信息调查,或《人工智能法案》下的留存审计时,任何一种失效模式都会造成严重后果。

这对任何构建或采购来源溯源工具的人都有连带影响。一家声称”AI 生成内容已加水印且可检测”的供应商,其承诺远比听起来要弱;而将水印核查当作合规控制的机构,可能依赖于一个连初级移除攻击都能击破的信号。这一议题也与更广泛的监管工作相连,例如欧盟《人工智能法案》对高风险智能体系统的分类:一条规则的效力,取决于本应执行它的技术机制。

防御

不要把单一的文本水印当作来源证明——无论是哪个方向。阴性结果不应为一份文档开脱,阳性结果也不应给一个人定罪;两者都是概率性的,且都会在正常编辑下退化。在来源确实重要的场合,应优先采用在生成时刻捕获的、经加密绑定的签名式来源信息(content credentials 与清单),而非事后的统计检测,并组合多个独立信号,而非依赖单一检测器——证据框架 Verifiable Provenance and WatermarkingarXiv:2605.21002,2026 年 5 月)表明,只有经过校准的多方法组合才能接近充分性阈值,且仅对较弱的对手有效。在报告检测器输出时,应附上实测的假阳性率、假阴性率与明确的不确定区间,让决策者看到错误率,而不是一个赤裸的”是/否 AI”标签。应假定有动机的对手会改写、翻译或让文本经另一个模型往返处理,并在依赖自身流程之前,正是针对这些变换进行测试。对合规团队而言,应坚持任何水印要求都必须配以经独立测量、有据可查的稳健性与错误率阈值,并阅读该领域的真实现状——2026 年 7 月的 Survey on LLM WatermarkingarXiv:2607.10103)提供了一份很好的概览——而不是假定该技术已经满足了围绕它所写就的法律条文。

状态

项目详情
披露AI Watermark Evidence Fails Forensic Readiness,arXiv 预印本于 2026 年 7 月 20 日公布
性质对文本水印稳健性与可靠性的实证评估,并对照法律可采性
受测方案KGW、Unigram、SynthID
稳健性一次改写后的条件移除率:KGW 与 Unigram 为 100%,SynthID 为 98.3%(846 次有效试验)
可靠性基线假阴性率约 70%(KGW)、约 83%(Unigram)、约 80%(SynthID);SynthID 误标 5.4% 的人类对照,悖论率 18.6%
法律测试三种方法均未满足五项 Daubert 因素中的两项以上
监管背景检验了”可靠且稳健”(《人工智能法案》)与”永久或极难移除”(加州 SB 942)这两项假设

上述数字来自一篇仅测量三种方案特定配置的预印本,并不能推广到所有水印部署。应将其视为”文本水印尚未达到司法级别”的有力信号,而非对任何单一产品的最终定论。

Sources