水印的悖论:textGrain 用 95% 检出率证明了自己的脆弱

一条新闻的两面 10 月 5 日,OpenAI 发布了面向欧盟 AI Act 的文本溯源方案 textGrain:未来几周内,欧盟地区符合条件的 ChatGPT 与 Codex 文本输出将嵌入隐形统计水印;API 用户全球可选开启、默认关闭;检测器初期仅向审核通过的研究者和专业机构开放,技术将开源。 这条新闻的表象是「合规落地」,但真正值得深挖的,是 OpenAI 同时公布的那组对抗性评测数据。一家公司在新功能发布时主动告诉你它有多不耐用——这在当下的 AI 行业里相当罕见,也比水印本身更有信息量。 textGrain 是什么:写在词选里的签名 textGrain 不是可见的标记,而是一种「熵校准水印」(entropy-calibrated watermarking)。它的原理可以粗略理解为:模型在生成每个 token 时本来有一个概率分布,水印算法用一把密钥对这个分布做细微的重新整形——偏向某些词、远离另一些词。单次偏移小到读者完全无感,但一段文本里几百次这样的微小偏移叠加起来,持有密钥的检测器就能从纯文本中读出统计信号。 这条路并不新。学术界(Kirchenbauer 等人 2023 年的 soft watermarking)早已铺路,Google DeepMind 有 SynthID-Text。OpenAI 的技术报告与宾夕法尼亚大学、耶鲁的研究者合著,官方称 textGrain 在评测中「达到或超过包括 SynthID 文本版在内的其他方案」。 关键的工程取舍在于:水印强度和文本质量是一对天然矛盾。加得猛,模型会为了携带信号而偏离最优词选,输出质量下降;加得轻,检测就容易失败。textGrain 选择「熵校准」——在高熵(模型本来就有很多等价好选项)的位置多动手脚,在低熵(几乎没得选)的位置少动或不。这解释了它性能数据的形状。 诚实到近乎自曝的评测数据 OpenAI 给出的数字值得逐条看: 在 1% 误报率下,400 token 文段检出约 95%,200 token 约 80%; 同样是 400 token,把 10% 的词替换成同义词,检出率从 92% 跌到 66%;替换 25%,跌到 17%; 数学类内容检出率显著更低——因为数学文本的词选自由度本来就小,水印没有下手的空间; 翻译过的文本同样难以检测。 换句话说:水印在「合作场景」下表现良好,在「对抗场景」下接近失效。 一个想洗掉水印的人,不需要懂密码学,只需要把文本丢给另一个模型说「帮我改写一下」,10% 的同义词替换就能把检出率砍掉三分之一。而改写恰恰是 AI 时代成本最低的操作。 ...

2026年10月6日 · 1 分钟