ABBEL框架通过将交互历史压缩为自然语言信念状态,并采用重建评分监督信念内容,提升长任务中LLM的摘要学习效率。相比传统递归摘要,ABBEL在CollabBench等场景中减少约50%性能差距,训练步骤减半,同时降低内存使用。信念评分作为辅助RL任务,平衡摘要简洁性与信息保留,支持更高效的长期交互。
本文评估了大型语言模型在多智能体协作文本游戏中的理论推理任务,发现其在合作和推理能力上表现优异,但在长期规划和任务状态管理上存在限制。通过显式信念状态表示,改善了智能体的表现和推理准确性,并探讨了大型语言模型在理解机器生成行为和意念理论方面的应用,提出了提升性能的新方法。
完成下面两步后,将自动完成登录并继续当前操作。