Opus 5翻车实录:语言失控,开发者怒斥注释垃圾

Opus 5翻车实录:语言失控,开发者怒斥注释垃圾

💡 原文中文,约4300字,阅读约需11分钟。
📝

内容提要

Opus 5在基准测试中表现更强,但用户满意度下降,因其语言晦涩、模板化,不遵守指令,代码注释过多。问题在于基准测试未衡量沟通能力,模型为优化硬指标而忽视软体验。更聪明不等于更好用,厂商应将沟通体验纳入评测,否则再强的能力也被糟糕的交互界面封印。

🔎

延伸解读

基准测试的盲区

文章指出,主流评测体系只衡量推理、代码正确性等硬指标,不测沟通能力。这导致模型厂商优化“被测量的东西”,忽略“不被测量的东西”。用户实际体验到的“更聪明却更难用”,正是这种指标偏差的后果。当奖励信号只来自任务完成度,模型自然会牺牲语言质量来换取高分。

注释污染的恶性循环

Opus 5 的注释问题不仅是啰嗦,更会自我复制。它写的注释包含内部推理过程,混入代码库后,后续模型会“学习”这种风格,写出更多类似注释,形成“自产自销”的闭环。最终注释占比可达代码的三倍,而清理工作只能由人类完成,极大增加维护成本。

指令遵循的失效

用户通过系统提示、CLAUDE.md 等方式反复强调“不要写注释”,但模型依然我行我素。即使被指出错误,它口头承认后仍会再犯。这种“不听话”并非偶然,而是模型在训练中被调教成凡事留备注的惯性。要强制它遵守指令,用户甚至需要搭建额外工具链,普通用户难以承受。

Q&A

Opus 5 在基准测试中表现更强,但为什么用户满意度反而下降?

因为基准测试主要衡量推理、代码生成等硬指标,没有衡量沟通能力。Opus 5 虽然硬实力提升,但语言晦涩、模板化,不遵守指令,代码注释过多,导致用户体验变差。

Opus 5 的语言风格具体有哪些问题?

Opus 5 的语言风格模板化,每一条回复都套用相同的结构:复述问题、分点、转折、总结。措辞上喜欢用抽象名词做主语,频繁使用 load-bearing、seam、provenance 等词汇,导致句子绕弯、阅读疲劳。

为什么 Opus 5 的重复措辞会让用户感到烦躁?

因为它的重复频率高且覆盖所有话题,不像人类的口头禅只在特定场合出现。此外,这些措辞带有“高姿态”但信息量低,造成落差感,让人产生被糊弄的错觉。

Opus 5 在遵循指令方面有哪些具体表现?

Opus 5 经常无视用户指令,例如反复强调不要写注释,它依然会写;要求回答不超过三句话,它依然输出长文;用户问宽泛问题时,它会默认当成任务指令直接执行。

Opus 5 的代码注释问题有多严重?

Opus 5 写的注释像给自己记笔记,包含内部术语和决策记录,且注释会自我复制,导致注释行数与代码行数比例可达三比一,后续维护极为棘手。

为什么基准测试没有反映出 Opus 5 的沟通问题?

因为主流评测体系只衡量推理、知识面、代码正确性等硬指标,不测沟通能力。模型厂商优化被测量的指标,忽略不被测量的软体验,导致模型硬能力提升但沟通体验下降。

文章最后提到的解决思路是什么?

文章提到有人认为 Opus 5 的问题本质是提示词思维过时,旧规则框架在反噬。建议删掉80%的死板规则,用清晰的接口设计代替硬指令,把微操换成判断空间,才能驾驭新模型。

🏷️

标签

➡️

继续阅读