互 reasoning 使得较小的 LLM 更加高效的解决问题
内容提要
该研究提出了多种方法提升大型语言模型(LLMs)的推理能力,包括Self-Polish、基于图的验证和自主树搜索能力。实验结果显示,这些方法在Few-Shot学习和复杂推理任务中显著提高了模型性能,尤其在数学和逻辑应用方面。适当引导小型模型可使推理能力提升超过100%,显示了大型模型在指导小型模型中的重要性。
延伸解读
小模型推理瓶颈与引导时机
文章指出,较小模型在复杂推理任务中常因难以启动正确推理过程而失败,而非能力不足。研究发现,只有在恰当时机介入,大型语言模型才能有效引导小模型回归正确路径,使性能提升超过100%。这表明引导策略的时机比单纯增加模型规模更关键,为经济高效的专用模型开发提供了新思路。
自主树搜索的效率优势
文章提出的自主树搜索能力(ATS-BFS)在四个益智游戏上相比先前方法准确率提高33%,同时GPT API成本降低65.6%或47.7%。此外,使用ATS提示方法收集数据微调LLaMA,在LLaMA2-7B和13B上分别比CoT-tuned版本提升40.6%和38.5%。这显示自动生成搜索轨迹不仅能提升推理准确性,还能显著降低计算成本。
大模型在符号推理上的局限
文章通过归纳逻辑编程基准测试发现,最新大型语言模型在推理能力上表现较差,无论是自然语言提示还是真值矩阵提示,其性能和泛化均低于模型规模较小的神经程序归纳系统。这挑战了“规模越大推理越强”的普遍认知,提示在符号推理等特定任务上,专用小模型可能更具优势。
自我纠正与分布式归纳学习
文章提出内在自我纠正推理框架,无需人类反馈或外部工具即可提升多步推理性能并减少令牌使用。同时,利用分布式网络的归纳学习方法可提高小型语言模型的推理能力,弥补其依赖统计模式的局限,有望使其逼近高参数模型在逻辑应用上的水平,从而缩小逻辑差距。
Q&A
Self-Polish方法是如何提高模型的推理能力的?
Self-Polish方法通过逐步精炼问题来提升模型的解决能力,特别是在Few-Shot学习中表现显著。
大型语言模型在推理能力方面存在哪些不足?
大型语言模型在需要探索、战略前瞻和序贯决策的任务上表现较差,尤其是在复杂推理任务中。
如何通过引导小型模型来提升其推理能力?
适当引导小型模型可以使其推理能力提升超过100%,尤其是在启动过程时的介入至关重要。
自主树搜索能力的实验结果如何?
自主树搜索能力的实验显示,准确性提高了33%,并且在多个益智游戏中取得了显著改进。
分布式网络的归纳学习方法如何改善小型模型的推理能力?
分布式网络的归纳学习方法可以弥补小型模型依赖统计模式的局限性,从而提高其推理能力。
大型语言模型在符号推理任务上的表现如何?
大型语言模型在符号推理任务上表现较差,模型规模和微调对性能有显著影响。