人工智能
OpenAI 推出了文本水印:只有欧盟默认启用,而检出器只给获批的少数人
OpenAI 的水印技术 textGrain 自 10 月 5 日起在欧盟的 ChatGPT 和 Codex 上自动启用,其他地区仍为可选。它公布的检出率显示,这是一个经得起阅读、却经不起编辑的信号——而检出器只能申请获取。
MAI
OpenAI 在 10 月 5 日开始给自己的文本输出加水印,而它选择的发布方式,比这项功能本身说明了更多问题。水印对欧盟(EU)境内的 ChatGPT 与 Codex 用户自动生效;对全球的 API 客户则是可选项,默认关闭;而能够读出这个水印的检出器,不在获批名单上的人一律拿不到。这项技术名为 textGrain,OpenAI 在发布的同时公布了它的检出率。那组数字是整份公告中最有用的部分,因为它们如实说明了这个水印究竟能做到什么。
什么上线了,在哪里上线
按 OpenAI 的说法,textGrain 会向"模型的用词选择中嵌入一个不可见的统计信号"——当几个词同样适合一个句子时,模型会被引导偏向其中之一,形成检出器日后能够识别的模式。可见的输出不发生任何变化,OpenAI 表示其测试未发现有意义的质量下降。
| 适用范围 | 10 月 5 日的状态 |
|---|---|
| ChatGPT 与 Codex(欧盟) | 自动启用,"未来数周内"逐步推开 |
| ChatGPT 与 Codex(欧盟以外) | 不加水印 |
| API(部分模型,全球) | 可选启用,默认关闭 |
| 检出器 | 仅限申请;面向获批的研究者与专业机构,逐案审核 |
只有欧盟默认启用,这不是一个产品决定。欧盟《人工智能法案》(EU AI Act)第 50 条要求生成式系统的提供方以机器可读的形式标注合成内容,该义务已于 2026 年 8 月 2 日生效。OpenAI 是在提出这项要求的司法辖区内履行法律义务,对其余用户群则按原样不动。
数字才是重点
OpenAI 自己公布的数据以 1% 的误报率为条件衡量,呈现出的是一个经得起阅读、却经不起编辑的水印。
| 条件 | 检出率 |
|---|---|
| 200 个 token 的段落(用词自由度较高的散文) | 约 80% |
| 400 个 token 的段落(同上) | 约 95% |
| 将 10% 的词替换为同义词 | 92% → 66% |
| 将 25% 的词替换为同义词 | → 17% |
| 数学等用词受限的领域 | 明显更低 |
代码的情况更糟,OpenAI 直言其中的道理:相比普通散文,下一个词的合理选项更少,可供隐藏信号的余地也更小。一个在四分之一词汇被替换后就降到 17% 的水印,对任何有动机的人都不构成防线。把文本过一遍另一个模型,改写几句话,改掉人类编辑本来也会改的那些词,信号就没了。
这不是 OpenAI 藏着的缺陷。该公司明确表示,这个水印无法衡量人类的贡献比例,无法确立所有权,无法识别用户,也无法核实文本内容是否属实;水印的缺失同样不能证明某段文字出自人手。它能做的,只是告诉拥有检出器权限的机构:某一段未经编辑的文字,很可能出自 OpenAI 的模型。
检出器就是政策
值得争论的决定是不公开检出器。OpenAI 给出的理由是误报与漏报都真实存在,公开的检出器会招致滥用——这个说法站得住脚:把 1% 的误报率套用到一所大学的全部学生作业上,被冤枉的学生人数相当可观。但后果并不因此改变:来源核验成了机构的能力,而不是公众的能力。教师查不了,雇主查不了,法院查不了,读者也查不了。只有通过审核的研究机构可以查——前提是 OpenAI 批准它的申请。
和目前已落地的另外两种实现对比一下。Anthropic 在 2026 年 8 月宣布文本水印,并在模型层面实施,覆盖 Claude 的所有产品与所有出口,不提供开发者层面的关闭选项。Google 已经推出面向文本的 SynthID。三者之中,OpenAI 的版本最有条件性:法律要求的地方是强制,法律不要求的地方是可选,而且只能经由这家公司才读得出来。
这究竟算谨慎还是算便利,取决于你看重哪一侧的动机。善意的读法是:把一个弱信号交到公众手里,害处大于好处,OpenAI 把推广范围压到了这项技术能够诚实承担的程度。不那么善意的读法是:默认关闭的可选水印加上不公开的检出器,对 OpenAI 最大的那批客户——在 API 之上构建产品、并不希望自己的输出可被追溯的那批人——没有施加任何成本,同时又让布鲁塞尔满意。已经发布出来的东西,与这两种读法都相符。
唯一可能改变这一局面的承诺,是 OpenAI 表示有意将 textGrain 开源。方法一旦公开,独立检测在原理上就成为可能,争论的焦点便会从"我们是否被允许去核验"转向"核验本身是否管用"。而按已公布的数字看,后一个问题仍然更难回答。
Sources: OpenAI: Text provenance in the EU · The New Stack · Unite.AI · 9to5Mac