本文介绍了CompactionRL,一种将上下文压缩机制融入强化学习的方法。该方法通过联合优化任务执行和摘要生成,帮助长程Agent在复杂任务中有效管理信息,提升性能。实验结果表明,CompactionRL在多个基准上表现优异,并成功应用于GLM-5.2模型的生产级训练,展示了其在工业界的实用性和可扩展性。
完成下面两步后,将自动完成登录并继续当前操作。