内容提要
Anthropic宣布将在新版Claude模型中嵌入不可见文本水印,覆盖API、编程工具及云平台输出,以符合欧盟AI法案透明度要求。水印随文本复制传播,但易被改写、翻译削弱。检测工具尚未公开,密钥轮换及代码水印有效性存疑,专家认为其仅作辅助线索,非安全保证。
延伸解读
水印的局限:改写与翻译可削弱
Anthropic承认,编辑、改写、翻译或与其他文本混合都可能削弱或移除水印,短文本片段也可能因信号不足而无法检测。GPTZero的Alex Cui测试发现,结合词汇和句法攻击的强改写能绕过水印,免费改写工具也能绕过Google的SynthID。因此,水印并非可靠来源证明,仅能作为辅助线索。
代码水印的挑战
代码水印面临独特难题:代码不能随意改动,否则可能破坏功能。水印只能选择性地修改可容忍同义词的部分,如变量名。此外,代码经过正常开发流程(如pull request)后,水印能否存活尚不清楚。Anthropic未公布相关测试,开发者无法预知代码补丁在修改后是否仍可检测。
检测工具与密钥轮换的未知数
Anthropic尚未公开检测工具的具体形式(本地工具、API或受限访问),也未说明密钥轮换机制。公开检测器可能被攻击者利用来测试并移除水印,而密钥泄露则可能使水印被伪造或移除。密钥轮换需兼容旧密钥,但Anthropic未解释如何处理历史内容。这些未知因素影响水印的实际可靠性。
Q&A
Anthropic计划如何为Claude模型添加水印?
Anthropic宣布将在新版Claude模型中嵌入不可见文本水印,覆盖API、编程工具及云平台输出。文本水印隐藏在词语中,文件(如SVG、PNG、JPG)则使用C2PA标准添加数字签名。水印在模型层面添加,因此会随输出传播到基于Claude构建的应用中。
Anthropic为什么要在Claude中嵌入水印?
主要为了符合欧盟AI法案(EU AI Act)第50条的透明度要求,该条款要求生成式AI系统的输出必须以机器可读格式标记,以便检测。Anthropic签署了相应的行为准则,并计划从2026年8月2日起在欧盟发布的新模型中实施。
Anthropic的文本水印是如何工作的?
Anthropic未公开具体技术细节,但专家推测可能采用类似KGW的方法:在模型生成文本时,利用密钥和前面的token将候选词分为绿组和红组,并提高绿组词的选择概率。检测器用相同密钥重建偏好,若文本中绿组词异常多,则可能带有水印。更先进的方法可能基于语义而非精确token序列,以增强抗改写能力。
Anthropic的水印在代码中有效吗?
代码水印面临挑战,因为代码不能随意更改,否则可能破坏功能。水印需要选择性地修改可容忍同义词的部分(如变量名)。Anthropic尚未公布测试结果,因此不确定水印在代码经过正常开发流程(如pull request)后是否仍可检测。
Anthropic的水印能被移除或削弱吗?
可以。Anthropic承认编辑、改写、翻译、拆分或与其他文本混合都可能削弱或移除水印。专家测试表明,结合词汇和句法攻击的强烈改写可使水印失效,免费改写工具也能绕过SynthID。研究也证实攻击者可在不严重损害内容质量的情况下移除水印。
检测到水印是否意味着内容完全由Claude生成?
不一定。Anthropic表示检测到水印仅意味着内容“可能经过Claude处理”,不证明Claude是原始创作者。例如,Claude可能只是校对、翻译或重新格式化人类撰写的材料。同样,未检测到水印也不代表Claude未参与,可能因为内容太短、来自旧模型或经过修改。
Anthropic会公开水印检测工具吗?
Anthropic计划向用户和第三方提供检测方式,但未说明具体形式(本地工具、API或仅限特定组织)。专家警告,公开检测器可能被攻击者利用来测试并移除水印,从而削弱其有效性。
密钥轮换对水印系统有何影响?
密钥轮换是应对密钥泄露风险的措施,但需要检测器能识别当前和已退役密钥生成的标记,包括历史内容。Anthropic尚未说明如何处理密钥历史,这增加了实施的复杂性。
开发者应如何对待Claude的水印?
开发者应将水印视为辅助线索,而非安全保证。建议结合审计日志和来源追踪,记录模型ID、提示版本、响应时间和原始输出哈希,并记录后续修改。水印不能替代这些措施。