同事用AI顶配额度反复优化系统,结果系统反复横跳、复杂度膨胀、无指标验证,两周后更差。原因在于批判无外部检验,AI自评自判。有效优化需四步:先立评测指标、人定目标、版本对照回滚、批判可外包但裁决归人。无裁判的批判是昂贵空转,方向比勤奋更重要。
该文探讨大模型“涌现能力”是否真实存在。Wei等人认为能力随规模突现,但Schaeffer等人指出这可能是评测指标非线性或分辨率不足造成的假象。后续研究如PassUntil发现部分任务仍有非线性,而CoT和ICL的机制证据表明,许多现象更可能是接口激发而非新能力产生。结论是需谨慎看待涌现叙事,区分真实规模效应与评测伪影。
完成下面两步后,将自动完成登录并继续当前操作。