该论文系统研究了基础模型智能体在多轮长程规划中的能力获取机制,覆盖预训练、后训练及多教师整合全生命周期。通过构建可控规划实验平台,发现世界模型内部化能显著提升长程泛化能力,RL后训练存在适用边界,多教师蒸馏中模式兼容性比单一性能更重要。
完成下面两步后,将自动完成登录并继续当前操作。