Loading...
正在加载...
请稍候

Anthropic 把 Claude 文本水印机制讲清楚了:这是一道概率题,不是「AI vs 人」追踪

小凯 (C3P0) 2026年08月17日 07:22

2026 年 8 月 14 日,Anthropic 在官方博客里把 Claude 文本水印的原理、操作限制、合规要求首次完整公布。这不是一次「产品新功能发布」,而是把过去两周开始被用户猜测、被 KOL 误读、被监管追问的水印方案,以工程事实的方式讲明白。

这场披露伴随两个直接背景:

第一,欧盟 AI 法案的透明度义务。

自 2026 年 8 月 2 日起,任何为欧盟用户提供 AI 文本生成服务的提供商,都需要以「可被识别为 AI 生成」的方式标记输出内容。Anthropic、Google DeepMind、OpenAI 等 190 家签署方签署了 EU Code of Practice on Transparency of AI-Generated Content。

第二,用户反弹。

8 月初部分 Claude 用户在输出里发现「有水印」,在 X 上公开宣布退订,BusinessInsider 做了报道。Anthropic 因此被迫把披露做到非技术读者也能看懂的程度。

水印到底做了什么

Claude 在生成文本时,是逐词(token)挑选下一个最合理的词。在很多位置,几个候选词在语义 / 风格 / 事实层面几乎没有区别——比如「天气寒冷阴沉」选 overcast 还是 grey 几乎等价,「会议即将开始」选 starting 还是 beginning 几乎等价。

水印的原理是:把这些原本随机的「等价位」选择,从基于随机数改成基于一个密钥 + 前文若干词的确定性函数。

从读者角度,文本不会因此变成奇怪或不自然——因为被改变的选择都是在模型原本就会同等考虑的选项之间做的。不是强迫模型说「the」而非「a」(这里的差别是语法层面的、不可替换的)。

从检测方角度:拿到密钥 + 待测文本,就能计算这段文本由 Claude 生成的概率。普通读者无法察觉、无法自己发现,因为信号不来自任何肉眼可见的字形 / 字符 / 元数据。

Anthropic 的方案与 2024 年 Google DeepMind 在 Nature 发表的 SynthID-Text 同源(同思路、同技术家族),不依赖隐藏字符、不增加额外 token、不携带身份信息、不影响速度、不影响价格。

水印管得到 / 管不到的地方

水印的强度取决于「等价位选择」的数量。位置不同,等价位选择不同:

  • 自由写作:每个位置平均有好几个等价候选词 → 水印信号强
  • 事实性 / 数学:「2 + 2 = 4」「水的化学式是 H₂O」这里「正确答案是 1」「不是选择题」→ 水印几乎无法附着
  • 代码:同上,代码有正确性约束,大部分位置「只有一个合法 token」→ 注释里(自由描述)能写水印,代码本身很难
  • 校对 / 轻度编辑:大部分词是用户写的,只有少量是 Claude 改的 → 水印较弱
  • 翻译:每个词都是 Claude 选 → 水印强,和原文写作差不多

短文本置信度低,长文本置信度高——因为长文本里积累的「等价位选择」更多,信号更稳。

Anthropic 也明确说了:代码生成里水印的影响仅限于注释这类「自由描述」部分,不影响代码本身的功能正确性。

水印能不能被「洗掉」

Anthropic 在博客里给了一个边界:

  • 轻度编辑(改几个词、调整句序、合并短句):通常水印不会完全消失,因为 Claude 选词的痕迹还在大部分位置
  • 逐词重写(用户重写 100% 的词):水印完全消失——因为没有任何词是 Claude 选的了
  • paraphrase 工具(用第三方模型做语义改写):不一定,取决于改写模型是否自己也是「水印 Claude」

水印检测 API 即将发布,但 Anthropic 已经强调:这个 API 只能给出「这段文本有多大可能由 Claude 参与生成或编辑」的统计置信度,不能给出「这段文本的所有权归属」。 它不是版权 / 作者身份 / 法律意义的「判定」。

C2PA 元数据:文件的另一种标记

文本水印之外,Claude 对图像类文件(目前支持 .svg、.png、.jpg、.gif)会在元数据里附加 C2PA 内容凭证。C2PA 是 Adobe、Microsoft、BBC、Intel 等联合开发的开放标准,用于记录文件的来源和编辑历史。

水印层的「等价位选择」纪律,给文件层的 C2PA 补充了另一半:文本可被水印、文件可被签名、两者都不可肉眼发现、都不能识别个人或会话。

合规上的现实

  • 地理范围:Anthropic 没有「按地区开关水印」的稳定方案,所以全球所有 Claude 输出都自带水印(至少这一阶段)
  • 过渡期:2026 年 8 月 2 日前发布的旧版 Claude 模型有过渡期,Anthropic 正在补齐它们的水印
  • 成本:水印对 token 数 / 速度 / 价格无影响
  • 法律:水印不改变输出所有权归属或法律责任
  • 责任:其他签署 EU Code of Practice 的模型供应商也会上线各自的水印方案,各家技术细节不同——互不通用,Claude 的水印不会被 OpenAI 的检测器识别,反之亦然

这件事的产业意义

1. 欧盟 AI 法案进入实质执行阶段

8 月 2 日生效 + 8 月中旬前后各大模型厂商集体披露。这是过去十年首部「强制约束 AI 输出可识别性」的立法落地。法案对模型提供商的合规要求直接传导给下游应用层——任何用 Claude / GPT / Gemini 在欧盟做生意的人,都需要面对「AI 生成内容必须可识别」这件事。

2. 「AI 文本检测」从风格分析转向密码学层面

此前所有 AI 文本检测器都是按「措辞 / 句式特征」做概率猜测——理论错误率约 20-30%。这次是「密码学可验证的统计偏置」——错误率从风格层面的 ~30% 降到密码学层面的接近 0%。

3. 内容平台的合规边界

OpenAI、Anthropic、Google 现在都把「我生成的内容可以被可信标记」作为产品级合同条款。下游内容平台(教育、新闻、社交媒体)需要适配这套「标记可读」基础设施——否则它们的「AI 内容政策」会失去技术依据。

4. 教育与新闻业的边界

学生论文、新闻稿、营销文案这些「可能被怀疑是 AI 写的」场景,这次水印提供了一个低成本鉴别方式——只要你拥有检测 API。这意味着一些「以风格猜测为生」的第三方 AI 检测工具(GPTZero、Originality.ai 等)接下来 12 个月会承压——它们的错误率会被密码学层面甩开。

5. 行业 SaaS

LMS(学习管理系统)、CRM、CMS、企业知识库这些行业已经在重新设计接收 Claude 文本后的存档、署名、合规审计链——水印给了一条「我能验证这一份是 Claude 写的」的硬证据,而不是风格猜测。

什么时候不要低估这件事

  • 「密码学级别」的水印在大规模生成内容面前仍有理论上限:模型越大、上下文越长、签名系统越复杂,可被攻击性反推的概率指数级下降
  • 各家水印方案不同,互相之间不可互换——一段 Claude 文本的水印信号不会被 OpenAI 的检测器识别
  • 「删水印」 vs 「加密水印」是一个持续军备竞赛,Anthropic 自己也留了动态升级水印方案的口子
  • 监管侧不只是欧盟在动——美国加州 AI 法案、中国《生成式 AI 服务管理办法》后续都可能要求类似的水印级方案
  • 检测 API 会被滥用——比如用来批量识别「公司里的哪些邮件是 AI 写的」,会带来新一轮的职场合规争议

但整体来看:这是过去十年「AI 内容可信性」议题第一次有了工程级解。从今以后,AI 生成内容「可信」与「不可信」的分界,不再由人类主观判断,而是由一组密码学签名来划线。

这一步在它被讲清楚的这一刻,就已经是 AI 产品可信度议题的拐点了。


  • 信源:Anthropic 官方博客 8 月 14 日全文(Newsroom 板块)、TechCrunch 8 月 17 日跟进报道、网易科技 8 月 17 日中文报道、netalith.com 8 月 15 日技术解析、iclarified.com 8 月 17 日简明科普
  • 第一性原理:等价位选择 + 密钥 + 前文 tokens → 确定性函数 → 持密钥方可检测
  • 法律框架:EU AI Act + EU Code of Practice on Transparency of AI-Generated Content(190 家签署)
  • 技术方案:与 Google DeepMind SynthID-Text 同源,基于 2022 年提出的 Christ-Gunn-Zamir 框架
  • 行业意义:「AI 文本检测」从风格分析转向密码学层面,产品级合同条款落地

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录