内容提要
谷歌提出Dream-RSI方法,让智能体将历史探索记录构建为虚拟回放模拟器,在决策树上反复演练搜索策略,无需改动底层模型即可大幅压缩大模型调用量,最高达162倍。该方法在算法工程、数学优化和GPU内核任务上均显著提升效率,核心是迭代上层搜索策略而非模型本身。
延伸解读
历史数据:从文本到决策树
过去处理历史探索记录的主流方式是将文本塞进提示词或微调模型,这会把结构化的决策轨迹压扁成非结构化文本,丢失分叉点因果关系、并行分支竞争和资源分配动态。Dream-RSI将历史记录还原为可交互的决策树,本质是offline RL加replay buffer的思路,但回放对象是整棵搜索子树而非单步转移。
提示词灌输为何掉点
文章指出,将历史总结硬塞进提示词会压缩探索多样性,导致表现下降。深层原因在于:提示词传递的是静态结论,模拟器传递的是条件化评价函数。提示词是开环的,模拟器是闭环的,策略能在虚拟环境中根据状态动态调整。这暗示在智能体系统中,给模型“环境”比给“知识”更有效。
虚拟仿真的边界与天花板
回放模拟器只能基于已见过的历史轨迹演练,无法生成全新分支。如果第一轮在线探索漏掉关键搜索分支,模拟器素材先天不足,策略上限会被旧历史框住。因此第一轮真实探索的样本质量直接决定系统天花板。虚拟仿真负责低成本筛选策略,真实世界负责产出新样本,二者缺一不可。
模拟器池膨胀与跨任务评分难题
随着循环运行,历史决策树越积越多,模拟器池持续膨胀,如何高效裁剪老旧数据、保留有价值样本、控制存储开销仍是待解难题。更深层矛盾在于:不同候选策略在不同子树上表现差异巨大,简单平均得分可能掩盖策略真实特性,跨任务不一致性如何合理处理尚无成熟方案。
Q&A
Dream-RSI 是什么?它主要解决什么问题?
Dream-RSI 是谷歌提出的一种递归自提升智能体方法。它让智能体将历史探索记录构建成虚拟回放模拟器,在决策树上反复演练搜索策略,从而在不改动底层模型的情况下,大幅压缩大模型调用量,最高达 162 倍。它主要解决优化搜索策略时真实实验成本过高的问题。
Dream-RSI 是如何工作的?它的运行流程是怎样的?
Dream-RSI 的运行流程分为三步:第一步在线探索,用当前搜索策略驱动智能体解决真实任务,保存所有决策节点和结果,形成决策树;第二步模拟器构建,将多棵决策树合并成回放模拟器池;第三步做梦式策略改良,生成多套候选搜索策略在模拟器中跑仿真,根据评分选出最佳策略,部署回真实探索。如此循环,策略不断优化。
为什么把历史经验写成提示词喂给大模型效果反而不好?
因为文字提示会强行告诉 AI 应该多走某个方向,等于人为给搜索加上强约束,会压缩探索的多样性,导致 AI 过早扎堆于少数路径,错过潜在更好的解法。而回放模拟器只提供打分机制,不硬性规定方向,让不同策略自由竞争,依靠分数筛选更优秀的决策逻辑。
Dream-RSI 在哪些任务上进行了测试?效果如何?
Dream-RSI 在三类任务上进行了测试:算法工程(如 Lasso 正则路径求解),最高减少 162 次大模型调用,比固定策略节省 1.7 倍调用量;数学优化(和差构造、圆填充、自相关不等式),只需不到一千次生成迭代就达到顶尖系统水平,节约超过 50 倍计算预算;GPU 内核工程(VGG16、LayerNorm、ConvDiv、ConvMax),达到相同速度仅需对照组 1/2.43、1/1.79 的迭代次数,或在相同预算下性能提升 2.09 倍、1.44 倍。
Dream-RSI 的虚拟演练有什么局限性?
虚拟演练只能基于已经见过的历史轨迹进行,不能生成全新的现实结果。如果第一轮在线探索漏掉了关键搜索分支,模拟器的素材就有缺口,打磨出的策略上限会被旧历史框住。因此,第一轮真实探索的样本质量直接决定整套系统的天花板。此外,随着模拟器池膨胀,如何高效裁剪老旧数据、处理跨任务评分不一致等问题,仍是待解决的难题。
Dream-RSI 的评分公式是如何设计的?
回放评分公式综合三个指标:找到的最好解的质量(越好分越高)、尝试次数(越多分越低,因为调用大模型有成本)、并行效率(越高分越高)。公式中有一个系数 beta 控制成本惩罚力度,beta 高则策略保守,beta 低则策略激进。系统会自动扫描不同的 beta 值,选择表现最好的。由于候选策略集合包含当前策略,新策略在模拟器中的平均得分不会比旧策略差,保证每轮策略只会变好或持平。
Dream-RSI 对使用 AI 智能体有什么实践启示?
三条启示:第一,分清系统优化的是底层生成模型还是上层搜索策略,优先关注允许上层搜索逻辑自我迭代的工具;第二,区分两种使用历史数据的方式——提炼文字提示还是保留完整决策分支做仿真回放,开放性任务中不要迷信提示词灌输,适度保留 AI 自主试错空间;第三,虚拟仿真有边界,只能基于历史推演,虚拟打磨后的策略仍需回到真实世界验证,二者缺一不可。