一条新闻的两面

10 月 5 日,OpenAI 发布了面向欧盟 AI Act 的文本溯源方案 textGrain:未来几周内,欧盟地区符合条件的 ChatGPT 与 Codex 文本输出将嵌入隐形统计水印;API 用户全球可选开启、默认关闭;检测器初期仅向审核通过的研究者和专业机构开放,技术将开源。

这条新闻的表象是「合规落地」,但真正值得深挖的,是 OpenAI 同时公布的那组对抗性评测数据。一家公司在新功能发布时主动告诉你它有多不耐用——这在当下的 AI 行业里相当罕见,也比水印本身更有信息量。

textGrain 是什么:写在词选里的签名

textGrain 不是可见的标记,而是一种「熵校准水印」(entropy-calibrated watermarking)。它的原理可以粗略理解为:模型在生成每个 token 时本来有一个概率分布,水印算法用一把密钥对这个分布做细微的重新整形——偏向某些词、远离另一些词。单次偏移小到读者完全无感,但一段文本里几百次这样的微小偏移叠加起来,持有密钥的检测器就能从纯文本中读出统计信号。

这条路并不新。学术界(Kirchenbauer 等人 2023 年的 soft watermarking)早已铺路,Google DeepMind 有 SynthID-Text。OpenAI 的技术报告与宾夕法尼亚大学、耶鲁的研究者合著,官方称 textGrain 在评测中「达到或超过包括 SynthID 文本版在内的其他方案」。

关键的工程取舍在于:水印强度和文本质量是一对天然矛盾。加得猛,模型会为了携带信号而偏离最优词选,输出质量下降;加得轻,检测就容易失败。textGrain 选择「熵校准」——在高熵(模型本来就有很多等价好选项)的位置多动手脚,在低熵(几乎没得选)的位置少动或不。这解释了它性能数据的形状。

诚实到近乎自曝的评测数据

OpenAI 给出的数字值得逐条看:

  • 在 1% 误报率下,400 token 文段检出约 95%,200 token 约 80%;
  • 同样是 400 token,把 10% 的词替换成同义词,检出率从 92% 跌到 66%;替换 25%,跌到 17%;
  • 数学类内容检出率显著更低——因为数学文本的词选自由度本来就小,水印没有下手的空间;
  • 翻译过的文本同样难以检测。

换句话说:水印在「合作场景」下表现良好,在「对抗场景」下接近失效。 一个想洗掉水印的人,不需要懂密码学,只需要把文本丢给另一个模型说「帮我改写一下」,10% 的同义词替换就能把检出率砍掉三分之一。而改写恰恰是 AI 时代成本最低的操作。

OpenAI 对此的回应是透明的:检测器不公开,只向受审研究者开放;明确列出「水印不能告诉你什么」——不能衡量人类贡献、不能确定权责、不能识别用户、不能验证真实性,并特别强调「未检出水印不能证明是人类所写」。

为什么明知脆弱还要做:合规不是技术问题

答案藏在日历里。EU AI Act 的透明度条款今年 8 月 2 日生效,要求生成式 AI 的输出必须「以机器可读的方式可识别」。这不是「最好有」的功能,是进入欧盟市场的准入条件。Google、Meta、微软、Anthropic、OpenAI 都已签署欧盟 AI 生成内容行为准则。

更早的注脚是:Anthropic 两个月前宣布在 Claude 输出中全局加水印,随即引发用户反弹——不少人抱怨「我提供了指令、上下文和判断,Claude 只是工具,凭什么把我的产出标记成 AI 生成」。而据《华尔街日报》2024 年报道,OpenAI 早在两年前就做出来了文本水印,一直压着不发,主要顾虑就是用户会流向不加水印的竞品。

所以 textGrain 的区域化策略(仅欧盟默认开启、API 全球 opt-in、不做全球默认)是一个精算后的平衡:既满足监管准入,又不给竞品留下「我们不标记你的文字」的营销口子。水印的第一属性是合规凭证,第二才是检测工具。

水印悖论:越需要它的场景,它越不可靠

这里出现了本文想讨论的核心矛盾。文本水印的目标用户画像大致分三层:

第一层:善意协作场景。 平台想标注 AI 生成内容、学术机构想辅助初筛、企业想追踪自己管线里的输出。这层里大家不主动对抗,水印工作得不错——400 token、95% 检出率完全够用。

第二层:灰色场景。 学生交作业、员工用 AI 完成工作任务。Anthropic 水印遭遇的反弹正来自此:当事人不觉得自己在作弊,但也没有动力主动保留水印。轻度改写即可逃脱,检测形同虚设——或者说,恰好虚设到「抓得到最懒的,放走所有认真的」。MIT 本周另一份报告指出 AI 正在瓦解课程作业可信度与师生信任,而水印在这个战场上提供的确定性远低于教师们的期待。

第三层:恶意对抗场景。 有组织的信息操纵、欺诈。操作者有的是动机和资源做改写、翻译、多模型中转。17%(25% 同义词替换后)的检出率在这里等于零。

悖论在于:水印的社会价值与场景层级正相关,而技术可靠性与场景层级负相关。 它在最不需要它的地方表现最好,在最需要它的地方表现最差。这不是 OpenAI 的工程失误——这是当前所有文本水印方案(包括 SynthID-Text)共享的物理学:信号必须藏在冗余里,而对抗者的全部工作就是摧毁冗余。

生态影响:三个值得跟踪的后续

检测器准入成为一种新型权力。 「谁能验证内容是否 AI 生成」由模型厂商单方面决定。初期只开放给受审研究者是务实之举(避免公众误读误报),但也意味着平台、媒体、司法机构在这一体系里的话语权取决于厂商的审批。技术开源的承诺会部分缓解,但密钥分发的信任架构仍是未解难题。

水印可能成为 API 管线的隐性依赖。 当欧盟要求「机器可读标识」,下游平台会逐步接入检测能力。API 默认关闭、由客户选择的设计,把合规责任切给了客户——这个责任转移的边界日后大概率会有争端。

「AI 参与」与「AI 代写」的区分仍是空白。 OpenAI 自己承认水印无法衡量人类贡献。当 77% 的美国人(Quinnipiac 本周民调)希望 AI 开发放缓、公众对 AI 内容的焦虑持续升温时,一个只能回答「碰没碰过 OpenAI 模型」的二元信号,承接不住社会真正想问的问题。未来的技术方向大概率会走向分层溯源:C2PA 式的编辑履历 + 水印 + 签名工具链的组合,而不是单一银弹。

结语

textGrain 是一份值得认真读的工程文档,不是因为它的技术多惊艳,而是因为它展示了一种成熟的姿态:把能力的边界说清楚,把不确定性留给该处理不确定性的机构(研究者、平台、法庭),而不是把一个脆弱的检测器交给公众当成确定性武器。95% 的检出率和 17% 的存活率说的是同一件事——水印是有用的信号,不是可靠的判决。承认这一点,反而是这个领域少见的清醒。


参考:OpenAI《Our approach to EU text provenance rules》、textGrain 技术报告(OpenAI × UPenn × Yale)、TechCrunch、The Decoder