小红花·文摘

本研究提出了过去令牌预测（PTP）作为辅助任务，以解决从演示中学习长上下文策略的挑战。该方法显著提升了时间建模能力和策略训练效率，使长上下文扩散策略的性能提高了3倍，训练速度加快超过10倍。