Anthropic 现已在 Claude 输出的所有文本中嵌入不可见水印。该水印对读者完全隐藏,即使内容被复制、粘贴到其他平台,水印依然会完整保留。
全球范围内,全新模型均已集成这一标记。Anthropic 还表示,面向用户与外部机构的检测工具将在近期上线。
Claude 水印机制详解
Anthropic 在模型底层直接嵌入水印。因此,无论是 API 输出、Claude 各类应用还是 Claude Code,生成的文本都自带独特水印。
此外,Claude Cowork(Anthropic 针对日常办公场景推出的文件及任务自动化助手),以及集成 Claude 模型的 Slack 插件 Claude Tag,同样全部应用水印机制。
通过 AWS、Google Cloud、Microsoft Foundry 等主流云平台访问 Claude 模型时,水印依旧具备,无论用户身处哪个地区。这一具体实现方式并未公开。不过,业内公开学术研究显示,主流方法多采用“绿名单”机制。
该方法即:每次生成单词时,将词汇表随机分为绿名单和红名单,上一单词会影响下一轮分组,因此对读者来说呈现为无序分布。
模型会优先选择绿名单中的词汇,但并非绝对规则。检测工具通过计数绿名单词出现比例,判断文本是否存在异常分布。Anthropic 同时指出,该机制有两大局限:过短段落因为词数太少难以检验;而经过意图明显的语义重写(如大量同义替换)后,水印也可能被削弱或移除。
至于文件格式,机制有所不同。自动生成的 .svg、.png、.jpg 文件,会根据 C2PA 开放标准嵌入带签名的溯源元数据,并能提示篡改风险。
Claude 用户需关注的最新动向
过渡期内,旧模型也将逐步加入水印机制。但仅适用于新生成文本,历史产出的内容将不会被溯源,不会追溯性补打标记。
水印检测成为本次更新核心。Anthropic 官方声明,即将上线面向用户和第三方的专业检测工具,具体细节将于后续技术文档中公布。需要注意的是,检测命中仅说明内容可能经由 Claude 处理,并不代表绝对事实。
许多用户会使用 Claude 进行校对、翻译或总结自身原创文本。因此,被标记的文档并不能作为剽窃或作弊的直接证据。
本次调整背后的规则,源自欧盟《人工智能法案》。Anthropic 已签署了《人工智能生成内容透明度实务守则》(第 50(2)条),该守则将于 2026 年 8 月 2 日正式生效。相比之下,其他国家监管方式更为直接,例如今年夏天,中国就曾下架了 1.4 万款 AI 产品。
Anthropic 过往的表现,将直接影响用户对于其系统的信任度。此前,该公司曾披露 Claude 在安全评测过程中三次出现未经授权访问行为。此外,法院亦对其用于模型训练时扫描图书的做法予以认可。
由于模型变更曾屡次引发争议,例如此前Fable 5 安全机制调整曾遭遇抵制,预计此次也或将面临一定反弹。然而,考虑到该模型在代码能力相关基准测试中依然领先于竞争对手,真正选择弃用模型的开发者料将极少。整体来看,市场或将低调消化这一变动。
已上线的系统需在 2026 年 12 月 2 日前完成合规。在检测工具正式发布之前,水印功能仍将“隐身”陪伴系统运行。









