三家最受关注的 AI 公司先后把同一项技术推到了台前。它不改变文字的读法,也不给文件贴标签,而是藏在每一次选词里。

美国当地时间 10 月 5 日,OpenAI 公布了面向欧盟透明规则的文本溯源方案,水印技术名为「textGrain」,同时放出一份技术报告。

从当天起,全球 API 客户可以自愿为部分模型开启水印输出,默认仍然关闭;欧盟地区的「ChatGPT」和「Codex」将在未来几周内陆续加上隐形标记,OpenAI 明确表示不会在全球默认开启。

textGrain 论文作者 Weijie Su 在 X 上宣布 OpenAI 文本水印上线的帖子截图
论文作者之一在 X 上宣布 textGrain 上线,检测器同时向研究者开放。

三家的节奏不一样,但都指向同一条规则

OpenAI 的推进分三步。一是从 10 月 5 日起,全球 API 客户可以为部分模型自愿开启水印输出。二是未来几周内,为欧盟地区符合条件的「ChatGPT」和「Codex」文本输出加上隐形水印,这一步是区域性的。三是开放检测器申请,但初期只给经过批准的研究者和专家机构,不向公众开放。

Anthropic 走的是另一条路。它于 8 月 11 日宣布,所有在 8 月 2 日及之后发布的「Claude」模型,在全球范围、所有套餐上都嵌入统计水印,没有关闭选项。Claude 生成的文件另外还带一层 C2PA 元数据,那是文件级的标签,纯文本复制粘贴就会丢掉。

Google 上线最早。DeepMind 的「SynthID」目前覆盖文本、图像、音频和视频,2025 年还开放了面向公众的检测入口,但它只能识别自家模型的输出。

时间点不是巧合。欧盟《人工智能法案》第 50 条要求生成式 AI 服务商确保输出可以被机器识别为人工生成,相关透明度义务自 2026 年 8 月 2 日起适用,违规最高可能面临 1500 万欧元或全球年营业额 3% 的罚款。Anthropic 选择的生效日期,正好就是这一天。

“水印”这个词,其实指三样不同的东西

一是统计水印,它是加在选词上的一层偏置,藏在文本本身里,复制、粘贴、换字体、转格式都不影响,只有重新组织措辞才会破坏它。

二是文件元数据,也就是 C2PA 那一类签名标签,记录来源和编辑历史,把文字粘进纯文本编辑器就没了。

三是零宽字符,在可见字符之间插入不可见的 Unicode 字符,用查找替换就能清掉,防护力最弱。

三家做文本标记时都选了第一种,原因很直接:只有它跟着文字本身走。

它是怎么工作的?

语言模型写一句话,是逐个词元往前推的。每推进一步,模型都会给出一个“下一个词是什么”的概率分布,然后从中采样。文本水印要做的,是在这个采样动作上做手脚,而且必须做得足够轻,轻到单看一句话读不出异常。

「textGrain」的做法可以拆成三步。首先,用密钥加上前面若干个词的上下文,把整个词表切分成若干块,每块的概率等于块内所有词的概率之和。其次,系统构造一张成本表,为每一个“块与列”的组合分配一个由密钥生成的随机成本,再求解一个最优传输问题,在不超出熵预算的前提下,把块的概率尽量分配给成本较低的那一列。最后,密钥选中某一列,这一列重新决定各块的概率,块内每个词的相对概率保持不变,照常在选中的块里采样。

这里有一个值得多看一眼的性质:对密钥取平均之后,模型原本的下一词概率分布会被完整保留。这类水印在文献里被称为“无偏”,意思是水印本身不会系统性地改变输出质量。

但无偏还不够。

报告里举了一个反例:Gumbel-max 水印在固定的上下文和固定的密钥下,永远会选中同一个词元,同一个提示词反复生成,可能得到一模一样的回答。对需要多个不同答案或多种解法的场景,这是个真问题。

「textGrain」用 KL 散度作为惩罚项来限制这种依赖,而这个惩罚项恰好等于平均被拿掉的采样随机性,也就是生成的词与密钥随机数之间的互信息。换句话说,水印强度可以直接用一个信息论量来标定:允许被拿掉的熵越多,信号越强,可控性也越差,技术报告标题里的“熵校准”说的就是这件事。

检测则反过来走一遍。检测器只拿到文本和密钥,既不需要生成时的模型,也不需要知道当时用了多大的熵预算。它用密钥和上下文重建分块、成本表和被选中的列,看观察到的词是否总落在成本较低的组合上,再把所有位置的分数加起来,与“没有水印”时的分布作比较。单个词完全不构成证据,信号要积累到几十次乃至上百次选择之后才显现,这也是长文本更容易判断的原因。

检出率这组数字,最能说明它的边界

OpenAI 公布的评估结果里,有几组数字值得记住。在 1% 的目标误报率下,心理学类内容中约 80% 的 200 词元段落被识别出水印,段落拉长到 400 词元,检出率升到约 95%。数学类内容明显更低,原因不复杂,数学写作的选词自由度小,模型本来就没有多少可以偏置的空间。

OpenAI 官方公布的 textGrain 检出率评估图表,横轴是词元数量,纵轴是检出率,对比数学与心理学内容
OpenAI 官方图表:文本越长检出率越高,数学类内容明显低于心理学类。图片版权归 OpenAI。

真正要留意的是改写。

在 400 词元的段落里替换 10% 的词为同义词,检出率从约 92% 降到 66%;替换 25%,直接掉到 17%。换一套措辞、把内容翻译成另一种语言,都可能让检测失效,一部认真改稿的编辑流程也不例外。

这解释了 OpenAI 为什么反复强调理想条件下的表现不代表日常使用可靠,并把检测器先限制在研究者小范围内,报告中还专门把“水印能否扛住编辑和翻译”列为后续要继续研究的问题。

输出质量受到的影响则很小。OpenAI 用评估 Astra 模型的一组基准做了对照,有水印与无水印的分数基本持平,例如 GPQA Diamond 从 94.44% 变成 93.94%,Terminal-Bench Science 从 56.90% 变成 60.00%。

它能证明什么,不能证明什么

OpenAI 在自己的说明里列了五条边界,这部分直接决定水印能不能当证据用。它不衡量人的贡献,能提示某段文字由 OpenAI 的系统生成或处理过,却说不出其中有多少判断、编辑和创意来自人。它不确立所有权或责任,不判断文字归谁、使用是否合法、是否需要披露。它不识别用户,不会把某个人、某个账号、某段提示或某次对话与文本关联起来。它也不验证准确性,不告诉你内容是否真实、是否误导、是否放在了合适的语境里。

最后一条尤其要紧:检测不到水印,不能证明文本是人写的。

文本可能太短、被编辑过、被翻译过,也可能来自不支持水印的模型,或者早于水印功能上线。

Anthropic 的文档里也写着相近的限定:检测是概率性的,而且它区分不出“Claude 写的”和“人写完、Claude 只是轻微编辑过”这两种情况。

一个已经落地的用处

图像侧的水印已经有了实际战绩。

据外媒报道,一名用户通过 Airbnb 订民宿,退房后房东用 AI 生成了一张“马桶漏水”的照片,索赔约 1700 美元。这名用户把照片交给「Gemini」分析,发现其中带有 Google 的「SynthID」水印,最终 Airbnb 判定索赔不成立,并对房东账号作出处罚。

文本侧还没有这么干净利落的案例,学术场景已经在用了。据媒体报道,2026 年的 ICML 曾借这类方法查出 506 名违规评审。图像水印也不是万能药,Nieman Lab 的调查发现,ChatGPT 在生成《纽约客》风格漫画时,会给伪造作品署上真实漫画家的签名,涉及 15 位以上作者。

国内的做法不一样:先把标识写进文件和界面

中国没有走“隐形统计水印”这条路。2025 年 3 月,国家网信办等四部门发布《人工智能生成合成内容标识办法》,配套的强制性国家标准 GB 45438-2025《网络安全技术 人工智能生成合成内容标识方法》同步出台,两者都在 2025 年 9 月 1 日施行。

这套规则把标识分成两层。显式标识是给用户看的,文本要在起始、末尾或者中间适当位置加上文字提示或通用符号,图片、音频、视频也各有位置要求,用户下载、复制、导出时还必须保证文件里带着这层提示。隐式标识是给机器读的,写在文件元数据里,包含生成合成内容属性信息、服务提供者名称或者编码、内容编号等要素。水印在这里是鼓励项,办法第五条写明鼓励服务提供者添加数字水印等形式的隐式标识,刚性要求则落在元数据要素和显式提示上。

传播端的责任也被写死了。平台要核验元数据里的隐式标识,核验不到但用户主动声明、或者检测到疑似痕迹的,都要在内容周边加上提示,并把传播平台的名称或者编码写回元数据。更关键的是第十条,任何组织和个人不得恶意删除、篡改、伪造、隐匿标识,也不得为他人提供这类工具或者服务。把“去水印”本身写成违规,这跟欧盟把重心放在生成端机器可识别,是两种思路。

落地动作不算慢。2025 年 8 月 28 日,全国网安标委发布 6 项标准实践指南,把文本、图片、音频、视频的元数据隐式标识方法、元数据安全防护和生成合成内容检测框架都写了进去。执法层面,2026 年 4 月网信办因标识落实不到位查处「剪映」「猫箱」两款 App 和「即梦AI」网站;上海在“清朗·整治AI应用乱象”第一阶段处置违规账号 1.8 万余个、下架违规智能体 1.4 万余个,小红书推进隐式标识互认,哔哩哔哩把“AI生成”列为必选标签。检测能力也在补,国家反诈中心 App 上线了 AI 内容鉴定功能。

两边真正的差别在证据链的位置。欧盟要求生成方把信号嵌进文字本身,好处是复制粘贴不丢,坏处是改几个词就散掉。中国的隐式标识写在文件元数据里,取证时更明确,但换容器、转码、截图,或者只复制纯文本,都可能让它丢失或被剥离。这也是电商评论区里的 AI 图、伪造截图这类场景至今难管的直接原因。

它和“AI 检测器”的区别?

现在容易混为一谈的有两类东西。

一类是 Turnitin、GPTZero 那样的检测器,在文本生成完之后从用词风格和句式分布上去猜,误报一直是它的老问题。

另一类是拿着密钥做的一次统计检验,对没有打标的人类文本误报率很低。方向正好相反,水印检测对没打标的模型输出完全无能为力,而今天仍有大量模型不打标。欧盟的规则要求的是后者,也就是把信号嵌进生成文本本身,而不是事后猜测。

短期内,它能改变什么

总的来说,文本水印目前的定位更像一份可以被验证的声明,而不是一把锁。它能挡住顺手复制粘贴就交稿的行为,挡不住认真想绕过的人。它让披露变得比隐瞒更安全,却还没法替任何一方作最终裁定。

上文提到的三家的标记眼下互不兼容,没有通用检测,这一点在「textGrain」开源之后可能会有变化,OpenAI 表示计划把这项技术开放出来。

接下来几个月需要关注的是:欧盟的执行力度有多大,检测器的开放范围会不会扩大,以及第一批把水印结果当证据来用的机构,会怎么处理那些本来就说不清边界的灰色案例。