Back to Articles

SynthID-Text 已经跑在 Gemini 和 Claude 里,可你仍然查不了

dictionary page showing the entries credible and credibility

三大语言模型供应商里已有两家给自己生成的文本加了水印。谷歌从 2024 年起就在 Gemini 上这么做。Anthropic 在 2026 年 8 月 14 日为 Claude 打开了这个开关。两家用的是同一套方法,SynthID-Text,由 Google DeepMind 发表在《自然》杂志上。

如果你想查某一段文字是否带着其中任何一个水印,你查不了。没有 API,没有门户,没有开源工具。标记确实在那里,原理上也是机器可读的,而唯一能读它的机器属于那两家把它放进去的公司。

这个缺口比一年前更沉了,因为欧盟人工智能法案现在有了带日期的标识期限,而且已经有不少人开始购买声称能补上这个缺口、实际补不上的工具。

SynthID-Text 到底做了什么

这里值得说准确,因为关于 AI 文本水印的绝大多数文字都错在同一个地方。

SynthID-Text 不往文本里加任何东西。没有零宽字符,没有奇怪的 Unicode,没有隐形标记,没有露馅的标点,也没有多余的 token。Anthropic 就是这么明说的,这对该方法整体也成立。如果你见过那种“删掉隐形字符就能绕开 AI 水印”的建议,那条建议瞄准的是一个这里并不存在的东西。

它做的是改变模型选词的方式。

语言模型生成文本时,会在下一个 token 上给出一个概率分布,然后从中采样。SynthID-Text 正是在这一步介入。最近若干个 token 的滑动窗口,通常是四个,与一个保密的水印密钥一起做哈希,得到一个随机种子。这个种子驱动一组伪随机打分函数,即 g 函数。算法抽出候选 token,让它们走过若干层锦标赛:每一层用 g 函数给相互竞争的候选打分,胜者晋级。赢下锦标赛的那个 token 就是被输出的那个。

结果是,在足够长的一段文字上,输出的 token 会与 g 值产生相关性,而人类的选词不会产生这种相关。检测于是成了一个统计检验:在文本上重新计算 g 值,问平均值是否高于随机所能允许的水平。已公开的检测器有三种,简单平均、加权平均,以及在带水印与不带水印样本上训练出来的贝叶斯检测器,三者中最强的是最后一种。

这个设计带来两条性质,它们几乎解释了其余的一切。

第一,检测不需要模型。你不必跑 Gemini 才能查 Gemini 的文本。正是这一点让该方案便宜到可以上线,也是相对事后分类器的实质进步。

第二,检测需要密钥。g 函数是由它播种的。没有水印密钥,你算出的 g 值和生成时用的毫无关系,检验只会返回噪声。这不是某天会有人补上的实现缺口,而是一条安全性质:它挡住任何人把谷歌的水印伪造到谷歌从未写过的文本上。

整个检测问题都落在这第二条性质里。

今天谁在给文本加水印

2026 年 8 月的情况,只列供应商自己确认过的部分:

谷歌 Gemini。 自那篇描述首次大规模部署的《自然》论文起就带水印,覆盖 Gemini 和 Gemini Advanced。谷歌员工在官方开发者论坛上确认,经由 Gemini API、Google AI Studio 和 Antigravity 生成的文本同样带水印。这个答复是在此前一个相反的错误答复之后给出的更正,这本身就相当能说明该事项的文档有多单薄。

Anthropic Claude。 自 2026 年 8 月 14 日起全球生效,适用于 2026 年 8 月 2 日及之后发布的 Claude 模型,更早的模型随后跟进。Anthropic 称其为 SynthID-Text 方法的一个版本,并把这个想法追溯到 Scott Aaronson 在 2022 年的提议。此外 Anthropic 会给生成的图像文件附上已签名的 C2PA 凭据,那是另一套独立机制。

OpenAI。 没有文本水印。OpenAI 造过一个,据《华尔街日报》2024 年的报道准确度很高,却一直搁在抽屉里。公开提到的顾虑是:它抵抗翻译和整体改写的能力差,而且可能对母语非英语的写作者产生不成比例的标记。OpenAI 确实给生成的图像附上 C2PA 的 Content Credentials。

其他所有人。 开放权重的模型不带任何标记,除非运行它的人自己加上,而且没有任何东西能阻止他把标记去掉。这正是《自然》论文自己点名的结构性漏洞:水印只在供应商愿意配合的地方有效,而开放模型无法被强制配合。

两家的上线都对齐到 2026 年 8 月 2 日,这不是巧合。那天是欧盟人工智能法案第 50 条开始适用的日子。

真实存在的工具,以及各自的用处

这一部分值得写准,因为这个话题的搜索结果污染得厉害。

GitHub 上的 google-deepmind/synthid-text 《自然》论文的参考实现,Apache 2.0 许可。它既能加水印也能检测,还包含贝叶斯检测器的训练代码。通过 mixin 类支持 Gemma 和 GPT-2。README 明确写着这是为研究可复现性准备的,mixin 并非为生产环境设计,哈希函数不提供任何密码学安全保证。有用,诚实,而且不是给别人文本用的检测器。

Hugging Face Transformers。 谷歌指向的生产级路径。用 SynthIDTextWatermarkingConfigSynthIDTextWatermarkLogitsProcessor,传入一组密钥和 n-gram 长度,就能从你自己掌控的模型生成带水印的文本。持有密钥就能检测。这是今天一个普通工程团队获得端到端可用文本水印的唯一途径,而它只覆盖你自己系统生成的文本。

MarkLLM。 清华 THU-BPM 的学术工具包,在一个接口后面实现了许多水印算法,包括 KGW、Unigram、EXP,以及带平均、加权平均和贝叶斯检测器的 SynthID-Text。如果你是在评估各种方案而不是部署某一个,从这里开始。

SynthID Detector 门户。 谷歌的上传即查工具,在 2026 年 5 月的 I/O 上通过面向记者、研究者和媒体从业者的候补名单向早期测试者开放。谷歌自己关于验证的帮助文档列出的是图像、视频和音频。文本不在这个清单里,而开发者论坛那条关于 API 水印的帖子也明白地说,门户不接收文本。

谷歌的 Content Detection API。 2026 年在 Gemini Enterprise 平台上向指名的合作伙伴提供预览,包括 Shutterstock、Snap、Canva 和 Fox Sports。仅限图像,JPEG、PNG 和 WebP。没有文本,没有正式上线日期,没有公开定价。

Anthropic 的检测 API。 已宣布即将推出,没有时间表,也没有实现细节。等它出来时,大概只会为 Claude 的文本作答,别的都不管。

C2PA Content Credentials。 这根本不是水印,而且是互补而非竞争。它是经密码学签名的来源元数据:谁做的,用什么工具,什么时候,以及是否有 AI 系统参与,记录在 digitalSourceType 字段里。2.3 版新增了对纯文本文档的清单支持,这一点既新又切题。它的弱点恰好是水印弱点的镜像:元数据在复制粘贴中就没了,而文本恰恰就是这么流转的。

然后是那些算不上工具的东西。

有大量站点在“SynthID detection API”上排名,描述一个据说在 Google Cloud 控制台里启用的产品,还配着按请求计价和亚秒级的文本延迟。谷歌云的文档里根本没有这样的产品。这些站点里至少有一个是某个水印去除服务的内容营销。另外单说:那些提供“检查文本是否含 SynthID”的站点跑的是统计式 AI 检测器,它们读不了水印,也不可能读得了,因为没有密钥。它们是按可预测性和节奏给文字打分。那是套着同一个词的另一回事。

效果到底如何

诚实的答案是:在长的、未经改动的、高熵文本上效果不错,一旦离开这些条件就迅速退化。数字都是公开的,而且并不好看。

长度。 检测是统计检验,所以证据随 token 数累积。2026 年发表的一项 SynthID-Text 理论分析给出,在 50 个 token 的文本上,1% 假阳性率下的真阳性率大约只有 0.3,而其自身实验用的是 100 到 400 个 token 的序列。一条社交媒体帖子、一段产品描述或一封客服回复,文本量都不够。

熵。 水印靠模型的选择自由度活着。只有一个正确答案的地方,就没有空间编码任何东西。Anthropic 直白地说明了这点:在事实性段落里,以及在语法和算术必须精确的代码里,标记会更稀疏。让模型改一改你的语法,水印就只能寄居在那几处修改里,而那可能少到根本显示不出来。

改写。 这是薄弱环节。一项稳健性评估发现,SynthID 的真阳性率从干净文本上的 0.998 掉到中等程度改写后的 0.498。苏黎世联邦理工学院 SRI Lab 报告,用普通改写清除水印的成功率超过 90%,在水印窃取的辅助下接近 100%,并指出锦标赛采样这一本为安全而设的机制,反而让 token 的提升对改写更敏感,因此比更简单的方案更不稳健。2026 年一项对照司法鉴定标准的评估测得,在保持语义的改写下清除率为 98.3%,而语义相似度仍维持在 0.83 左右。

假阳性。 同一项司法鉴定评估在干净的人类文本上测得 5.4% 的假阳性率,检测阈值稍作变动即导致 93.6% 的判定不稳定,还发现一句标准的打字测试句越过了阈值。其结论是:所测的三种方法,KGW、Unigram 和 SynthID-Text,没有一种能满足专家证据五项多伯特因素中的两项以上。

伪造。 这一项上 SynthID-Text 比其他方案扛得住。SRI Lab 的工作报告称,默认参数下伪造成功率为 4%,而红绿方案是 80% 甚至更高;不过当攻击者的查询次数从 3 万增到 9 万时,成功率升到了 15%。同一项工作还显示,水印是否存在本身就能通过黑盒查询判断出来,所以把部署保密并不是一个选项。

合起来看:长段落上的阳性结果是有意义的证据。阴性结果几乎什么都说明不了,因为它同样符合人类写作、无水印模型、样本过短或经过改写这几种情形。任何要在这上面搭工作流的人,都得先把这种不对称性吃透,再去画界面。

法律要的是什么

现在有三套制度在这个领域提出了要求,而没有一套跟已部署的东西完全对得上。

欧盟人工智能法案第 50 条第 2 款。 生成合成音频、图像、视频或文本的 AI 系统提供者,必须以机器可读的格式标识输出,使其可被检测为人工生成。在技术可行的范围内,标识必须有效、可互操作、稳健且可靠。第 50 条自 2026 年 8 月 2 日起适用,标识与标注要求于 2026 年 12 月 2 日落地,同一天,2026 年 8 月 2 日前已投放市场的系统的宽限期也随之到期。实践准则指向一种分层做法,把元数据、水印和日志结合起来。准则没有点名 C2PA,但对该标准特性的描述贴得很近,以致观察者指出,目前唯一符合条件的已部署技术就是 C2PA。第 50 条的全景我们在人工智能法案透明度义务指南里讲过。

请注意可互操作这个词。一个只有作者本人能读的水印如何满足这项要求,是件怪事,而这个张力至今未解。

中国。 《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日起施行,是三者中最具体的。它同时要求显式标识,即用户可见的标签,和隐式标识,即写入文件元数据的标签。文本在适用范围内。平台必须提供标识功能,发布 AI 生成内容的用户必须主动声明。

加利福尼亚州。 AI Transparency Act,即经 AB 853 修正的 SB 942,自 2026 年 8 月 2 日起对月活用户超过一百万的提供者生效。它要求一个免费的检测工具、一处可见的披露,以及一处嵌入式的潜在披露,内含提供者名称、系统名称与版本、时间戳和唯一标识符。适用范围要仔细读:潜在披露义务覆盖的是图像、视频和音频。文本不在其中。自 2027 年 1 月 1 日起,大型在线平台必须呈现来源数据,且不得故意剥除。

三者的共同模式是一样的。法律要求可被检测的标记,而已部署的文本标记只有其作者能检测。要么检测开放出来,要么与文本相关的义务就靠 C2PA 式的元数据来满足,而那种元数据基本熬不过一次复制粘贴。

如果你在做软件,这意味着什么

这里大部分不是合规项目,而是几个工程决定,现在做很便宜,事后补很贵。

不要把检测器当判决买。 如果供应商声称能在任意文本中检测 SynthID,他做不到,你该向他要密钥。如果你已经在对用户提交的内容跑 AI 检测,把分数当作分诊信号交给人工复核,永远不要当作认定。反对将其用于有后果的场景的证据很扎实:斯坦福的一项研究发现,检测器把母语非英语作者的 TOEFL 作文中一半以上误判为 AI 生成;在这些工具以 100% 置信度标记人类作品之后,停用它们的大学名单还在变长。在那之上建立制度,是责任风险,不是控制措施。

别再剥除来源元数据了。 这是最常见的自伤。图像流水线例行地重新编码、缩放和归一化,大多数在这个过程中把 C2PA 清单和 XMP 一并丢掉。在第 50 条第 2 款之下,那就是你在移除法律希望保留的标识;而从 2027 年 1 月起,在加州这是一项平台义务。审一遍流水线,保留清单,或者在变换之后重新签名。既然 C2PA 2.3 已经支持纯文本文档,同样的纪律很快也要落到文本上。

留好你自己的来源记录。 这才是真正管用的部分。无论水印做了什么,你的系统知道哪个模型生成了什么、在什么时候、用了什么提示词、由谁复核。把它存成记录上的一个字段。它是第 50 条人工复核豁免的证据,是你递给监管者或客户的东西,而且不依赖任何人发布 API。

自托管的话,整个闭环你都有。 在 Hugging Face Transformers 上跑自有模型的团队,可以在生成时加水印、事后再检测,因为密钥在自己手里。如果你大量生成内容并且日后需要认出自己的输出,这在今天就可以做到,而且没人在向你兜售它。

向供应商问对问题。 别问“你们加水印吗”,如今答案多半是“加”,什么信息都没有。要问的是:这个标记是你能读还是只有他们能读;经过编辑和翻译之后它会怎样;是否附带 C2PA 元数据、附在哪些格式上;以及 2026 年 12 月 2 日之后,他们愿意就第 50 条第 2 款在合同里作出什么表述。

这件事会走向哪里

技术是真的,《自然》上的成果是扎实的工程:一个只花掉 0.5% 延迟的水印,在大约两千万条真实 Gemini 回复上经受住评估而未使用户满意度发生可测量的变化,并且检测时完全不需要碰模型。这不是小事。

但部署目前也是封闭的。两家供应商给文本加水印,谁都不让别人读这个标记,第三家造了一个又收了起来,开放模型则完全在体系之外。标识规则所要求的,与这些公司之外的人实际能验证的,两者之间的落差才是有意思的问题,而它不是技术问题。

我们给客户的建议是:在检测上一分钱别花,在来源上花一些。一个你既跑不了也信不过的检测,不构成控制措施。一份关于自家系统生成了什么的干净记录,以及一条不再破坏既有元数据的素材流水线,是你自己能掌控的工作,也正是 2026 年 12 月 2 日这个期限真正触及的地方。要看它在 2028 年前所有事项中处于什么位置,请见我们的2026 年欧盟数字合规指南

我们为在欧洲经营的公司把 AI 功能建进产品里,这意味着来源字段、保留凭据的素材流水线和审计轨迹是常规交付的一部分,而不是另起一摊的专项。如果你想看看 AI 生成内容从哪里进入你的产品、出去的路上它的来源又发生了什么,请写信到 office@c9group.dev

我们是工程师,不是律师。某项具体义务是以提供者身份还是以部署者身份落到你头上,属于你的法律顾问的范围。我们负责让系统与那个答案相符。