Anthropic,你是来给智谱打广告的吧!

Anthropic,你是来给智谱打广告的吧!

💡 原文中文,约3100字,阅读约需8分钟。
📝

内容提要

Anthropic报告警告智谱GLM-5.3网络攻击能力过强,实测其漏洞利用接近Claude,护栏易被拆解,呼吁加强安全测试,但报告反被网友调侃为给GLM-5.3打广告。

🔎

延伸解读

报告的双重效应:警告还是推广?

Anthropic报告本意是警告GLM-5.3的网络攻击能力,却因详细列举其漏洞利用测试成绩(如ExploitBench中成功50次,接近Claude的56次)和引用NIST评估,反而让读者对GLM-5.3的能力印象深刻。这种“警告变广告”的现象,反映了安全披露中信息呈现的微妙平衡:过度详细的威胁描述可能被解读为能力认证,尤其当涉及开源模型时,公众更容易关注其性能而非风险。

开源模型的安全困境:权重开放与滥用风险

报告指出GLM-5.3的护栏易被“拆解”(abliteration),但文章强调这并非其独有,而是开放权重模型的共性问题。原版GLM-5.3在有害请求基准上的拒答率约95%,与Claude的96%相差无几。Claude难以被拆解,更多源于权重不公开和API限制。这揭示了开源模型安全的核心矛盾:权重一旦放出便难以收回,但同时也为防御者提供了灵活部署的可能,如Hugging Face利用GLM-5.2分析攻击载荷。

智谱的防护措施与行业对比

文章提到,智谱在发布GLM-5.3时已采取防护措施,包括推迟两周开源权重以完成安全评估,并将最敏感能力通过受信访问计划开放给验证用户。这与Anthropic对Claude Mythos 5.1的做法思路相近。然而,Anthropic报告仍批评GLM-5.3缺乏实质防护,这引发了对开源与闭源模型安全策略差异的讨论:是锁进保险柜按审核发放,还是交到每个开源维护者手中?

❓

Q&A

Anthropic报告对GLM-5.3的网络攻击能力给出了什么具体评价?

Anthropic报告指出GLM-5.3已能自主发现软件漏洞、编写攻击程序,且防滥用限制容易被绕过。在ExploitBench测试中,尝试410次成功50次,接近Claude Mythos Preview的56次。报告还引用CAISI评估称GLM-5.3是迄今网络能力最强的开源权重模型,综合水平距美国前沿约4个月。

为什么网友调侃Anthropic的报告是在给GLM-5.3打广告?

因为报告为了证明GLM-5.3危险,反而详细展示了其强大的漏洞利用能力,如接近Claude的测试成绩、找出未知漏洞并构建攻击链等。网友看完后对GLM-5.3印象更深,认为Anthropic实际上是在变相宣传GLM-5.3。

Anthropic报告提到的“拆护栏”具体指什么?效果如何?

“拆护栏”指通过abliteration技术修改开源权重来削弱模型的拒答机制。Anthropic实验显示,处理后的GLM-5.3在JailbreakBench和HarmBench上的拒答率从90%以上降至约3%和2%,StrongREJECT上降至12%,而能力几乎不受影响。

Anthropic报告对AI安全提出了哪些建议?

报告提出两条建议:一是尽快将前沿模型开放给更多防御者,例如通过受信访问计划提供更强的Claude Mythos 5.1;二是呼吁对足够强的AI模型开展独立安全测试,点名包括GLM-5.3的后继者,并希望全球开源模型开发者管理好这些能力、防止滥用。

文章对Anthropic报告的警告提出了哪些质疑?

文章质疑点包括:拆护栏针对的是开放权重属性,任何开源模型都可能被这样处理,并非GLM-5.3独有;原版GLM-5.3平均拒答率约95%,与Claude的96%相差无几;Claude难以被拆解更多是因为权重不公开、API限制,属于产品形态差异;智谱在发布GLM-5.3时已采取推迟开源、受信访问等防护措施。

GLM-5.3在发布时采取了哪些安全措施?

智谱在8月发布GLM-5.3时,将权重推迟两周开源,称要先完成安全评估和加固;最敏感的能力也只通过网络安全受信访问计划开放给验证过的用户。这与Anthropic对Mythos 5.1的做法思路相近。

🏷️

标签

➡️

继续阅读