内容提要
同事用AI顶配额度反复优化系统,结果系统反复横跳、复杂度膨胀、无指标验证,两周后更差。原因在于批判无外部检验,AI自评自判。有效优化需四步:先立评测指标、人定目标、版本对照回滚、批判可外包但裁决归人。无裁判的批判是昂贵空转,方向比勤奋更重要。
延伸解读
批判循环为何会“反复横跳”
文章指出,没有外部基准的批判只是换个角度的偏好。AI 在缺乏明确目标时,会基于自身偏好生成建议,导致同一模块被反复拆合。这提醒我们,AI 的批判性输出并不等于正确,需要外部标准来约束和验证。
复杂度通胀的隐蔽倾向
AI 批判的产出物天然偏向复杂化,因为“加东西”显得深刻,“删东西”不显功力。两周内系统从三层变成七层抽象,就是这种倾向的体现。这提示我们在使用 AI 优化时,要警惕其倾向于增加复杂度而非简化,需人为控制抽象层级。
指标真空:没有记分牌的优化
同事无法回答优化后快了多少、稳了多少,因为没有设定指标。文章强调,没有记分牌的比赛,打得再热闹也没有比分。这警示我们,任何优化都必须先建立可量化的评测指标,否则无法判断改进是否有效,甚至可能越改越差。
AI 优化的收敛条件
文章提出让 AI 优化收敛的四件事:先立评测集和硬指标、目标函数由人定、每轮留档并回滚、批判可外包但裁决归人。这些是工程学老规矩,但 AI 时代违反它们的代价更高,因为瞎折腾按 token 计费。方向比勤奋更重要。
Q&A
为什么同事用AI反复优化系统后,系统反而变得更差了?
因为AI的批判没有外部检验,它自己提批判、自己评好坏、自己宣布更优,导致系统反复横跳、复杂度膨胀,且没有指标验证,最终两周后系统更差。
AI优化系统时,为什么会出现反复横跳的现象?
因为没有外部基准,AI的批判只是换个角度的偏好,今天说拆,明天说合,后天又说拆,导致同一段代码被反复修改。
为什么AI批判容易导致系统复杂度膨胀?
因为AI批判的产出物天然偏向复杂化,加接口、抽基类、引入新模式显得深刻,而删东西不显功力,所以每轮优化都会增加一层抽象。
让AI优化真正收敛需要哪四件事?
①先立评测指标,用数字说话;②目标函数必须人来定;③每轮留档,输了回滚;④批判可以外包,但裁决必须由人来做。
为什么说“批判可以外包,裁决不能”?
因为AI擅长生成大量批判,但哪条批判值得听、这版算不算更好,必须由人来拍板。如果让AI自己当裁判,就像裁判下场踢球,比分没有意义。
文章最后把“不断批判它,它最终能达到最优”这句话补完整,是怎么补的?
补完整为:“不断批判它,它最终能达到最优”——成立的前提是:批判有记分牌,裁决有人。没有裁判的批判,只是昂贵的原地打转。