AI自我改进RSI的死穴:反馈回路增益超载,越过安全边界直接振荡

AI自我改进RSI的死穴:反馈回路增益超载,越过安全边界直接振荡

💡 原文中文,约3500字,阅读约需9分钟。
📝

内容提要

递归自我改进受控制论小增益定理约束:反馈回路增益超过安全边界会导致振荡崩溃。Rohrs反例说明,模型忽略现实动态就会失控。核心瓶颈是可信现实反馈的生成速度,稳定决定速度上限。应限制单次修改、保留安全退路、警惕满分测试集。外部验证能打破死循环,但其错误率影响尚不明确。

🔎

延伸解读

高增益与稳定性:数学上的死对头

文章指出,递归自我改进的反馈回路增益一旦超过安全边界,系统就会像音频啸叫一样振荡崩溃。小增益定理要求环路增益乘积严格小于一,但自我改进的叙事往往追求高增益,一次评估带来巨大跃迁。这种高增益与高稳定性在数学上直接对抗,意味着越追求快速自我提升,系统越可能突然失控。

Rohrs反例的警示:模型忽略现实动态的代价

上世纪八十年代,Rohrs用仿真实验证明,那些被数学证明为全局稳定的自适应控制策略,在对象存在轻微但现实的高频动态时,会直接失控。这提醒我们,AI自我改进若只依赖自身模型,忽略现实世界的复杂动态,即使短期表现完美,也可能在某个时刻突然崩溃,且崩溃前难以通过短期观察判断。

持续激励丧失:系统盲区恰是自信之源

文章解释,当输入信号缺乏变化时,自适应系统会停止学习,参数沿不受约束方向漂移。对应到AI,模型在训练数据覆盖范围内表现优秀,但面对分布外场景,自我评估会失灵。更危险的是,模型对自己最不了解的领域,反而可能给出过度自信的评分,并做出激进修改,因为空白意味着没有约束。

证据生成速度决定自我改进上限

递归自我改进能跑多快,取决于能多快生成可信、可验证的证据来证明改动有效。算力可以堆,但现实反馈无法压缩到零时间,需要接触现实、等待后果、经历多样场景。仿真虽能加速,但其假设边界无法覆盖真实世界的复杂性。因此,稳定才是速度上限,速度与安全是直接对抗的权衡。

Q&A

为什么AI递归自我改进会突然崩溃?

因为反馈回路的增益超过了安全边界。控制论的小增益定理指出,环路中各个环节的放大倍数乘积必须严格小于一才能保持稳定。当AI用自我评估作为反馈信号时,如果证据稀薄却想一步登天,增益就会飙升,导致系统在看似平稳后突然振荡崩溃。

Rohrs反例对AI自我改进有什么启示?

Rohrs反例表明,即使数学上证明稳定的自适应控制系统,面对真实世界中未建模的动态特性时也会失控。这启示AI自我改进不能忽略现实动态,否则模型越优化,越可能把系统推下悬崖。

如何防止AI自我改进系统失控?

可以采取三项措施:第一,当误差压到噪声地板以下时停止调整;第二,给参数系上绳子,限制单次修改远离已验证的检查点;第三,把跑满分的测试集当成坏掉的传感器,不再作为反馈信号。

为什么说稳定是AI自我改进的速度上限?

因为递归自我改进的速度取决于能多快生成可信的、可验证的现实反馈。算力可以堆,但验证改动在真实世界中是否有效需要接触现实、等待后果展开,这个物理摩擦不因算力增加而减小。所以稳定决定了速度上限。

外部验证能解决AI自我改进的死循环吗?

能部分解决。实验显示,在无外部验证的递归推理循环中,信息变化量会迅速衰减;在第三轮插入一次外部验证,信息变化量立刻回升28%并保持非零。但验证本身的错误率影响尚不明确,存在数据缺口。

AI自我改进中持续激励丧失会导致什么问题?

持续激励丧失是指输入信号变得单一重复,系统停止学习但参数会沿不受约束的方向漂移。在AI自我改进中,模型对自己最不了解的领域最可能给出过度自信的评分,从而做出激进修改,导致对真实世界的理解逐渐偏离。

🏷️

标签

➡️

继续阅读