本文主张跳出仅修改harness适配模型的思路,探索改变语言模型的输入输出形态。作者认为decoder-only Transformer并非处理智能体轨迹的终极形态,可结合循环模型与Transformer,分别处理历史与当前观测,实现自动压缩与局部密集注意力。Jev等新形态证明替代权衡空间存在,需配套新目标函数。如今蒸馏与开放环境使这类研究更可行。
本研究探讨了推理问题的深度对大型语言模型的影响,发现循环模型在合成推理问题上表现优异,且与非循环模型在推理任务上存在显著差异。
该文介绍了一种基于ODE的循环模型,用于解决部分可观察的马尔可夫决策过程。该模型能够从历史过渡中提取不可观测的动态相关信息,并在处理不规则采样的时间序列方面表现出有效性和鲁棒性。
完成下面两步后,将自动完成登录并继续当前操作。