大语言模型的推理能力依赖于预训练中的程序性知识,而非简单检索。研究表明,模型在推理时采用通用策略,综合多个文档的信息。这一发现强调了高质量和多样化数据的重要性。
该研究提出了一种新方法,通过有限功能池和组合优化解决通用策略计算问题,适用于数据稀缺任务。利用强化学习和自然语言指令执行框架,显著降低学习新任务的样本复杂度,并在多任务深度强化学习中实现高性能表现。
完成下面两步后,将自动完成登录并继续当前操作。