释放大语言模型作为启发优化器的潜力:一种与基于梯度的模型优化器的类比分析
内容提要
本文综述大语言模型自动提示优化研究。OPRO以LLM为优化器,在GSM8K和Big-Bench Hard上超越人工提示;后续研究揭示LLM优化器存在先验偏见,提出行为优化新范式。其他工作如APO、LLM-PO、EvoPrompt、EMO-Prompts等,结合进化算法、策略梯度等方法自动搜索提示,在推理与生成任务中显著提升性能。
延伸解读
LLM优化器的偏见与行为优化
后续研究指出,LLM作为优化器时存在先验偏见,自我反思时倾向于依赖自身知识,难以准确识别错误原因。同时,由于目标模型行为难以预测,单次优化步骤中生成的提示可能不适当。为此,研究者提出“Automatic Behavior Optimization”新范式,旨在更可控地直接优化目标模型行为,为自动提示优化提供了新方向。
自动提示优化的多样化方法
除OPRO外,APO采用数值梯度下降自动修改提示,提升效率与性能;LLM-PO通过文本计划与反思解决交互式任务,在HotpotQA上成功率更高或相当且推理成本更低;EvoPrompt结合进化算法优化离散提示;EMO-Prompts利用进化多目标方法生成引导冲突情感的提示;基于策略梯度的DP2O通过多轮对话生成可读提示集,在四个数据集上平均超越最优方法1.52%。这些方法展示了自动提示优化的多样性。
性能提升与任务适用性
OPRO在GSM8K上提升最多8%,在Big-Bench Hard上提升最多50%;贪婪和遗传算法在Big Bench Hard的八个任务中平均提升9.2%准确度;DP2O在少样本设置下具有良好通用性、稳健性和泛化能力。这些结果表明自动提示优化能显著提升LLM在推理与生成任务中的表现,但不同方法适用于不同场景,需根据任务特点选择。
Q&A
OPRO 是什么?它如何利用大语言模型进行优化?
OPRO 是一种优化方法,它将大语言模型作为优化器,通过自然语言描述优化任务。它首先在线性回归和旅行商问题上应用,然后用于优化提示,目标是找到最大化任务准确性的指令。实验表明,OPRO 优化的提示在 GSM8K 上比人工设计提示提高了最多 8%,在 Big-Bench Hard 任务上提高了最多 50%。
LLM 作为优化器存在哪些局限性?
研究发现,LLM 优化器在自我反思时往往倾向于以自身的先验知识为偏见,难以正确识别错误的真正原因;此外,由于目标模型行为的难以预测性,LLM 优化器在语义上有效的反思时,往往在单次优化步骤中难以生成适当的提示。
什么是 Automatic Behavior Optimization?它为什么被提出?
Automatic Behavior Optimization 是一种新范式,旨在以更可控的方式直接优化目标模型的行为。它被提出是因为 LLM 优化器存在先验偏见和单步优化困难的问题,希望通过直接优化行为来启发自动提示优化的新方向。
APO 如何自动优化提示?它有什么优势?
APO 采用数值梯度下降的方法来自动更改提示语,以改进大型语言模型的图灵能力。它带来了很大的效率提升和预测性能的提升。
LLM-PO 如何在没有梯度访问的情况下解决交互式任务?
LLM-PO 通过维护基于文本的计划,并要求 LLM 根据其采集的经验反思当前计划的优缺点,然后根据 LLM 的反馈来更新计划和收集更多的经验。在 HotpotQA 上,LLM-PO 的成功率比基于上下文的学习(ICL)基线更高或相当,同时需要更少的推理成本。
EvoPrompt 是什么?它如何提升大语言模型的表现?
EvoPrompt 是一个通过连接大型语言模型和进化算法来进行离散提示优化的新框架。它极大地提升了语言理解和生成任务中大型语言模型的表现,并展示了语言模型与传统算法结合的协同效应。
EMO-Prompts 是什么?它的应用案例是什么?
EMO-Prompts 是一种特定于提示优化的进化多目标方法。它以情感分析为案例研究,结果表明 EMO-Prompts 可以有效生成能够引导大型语言模型同时表达两种相互冲突情感的提示。
基于策略梯度的离散提示优化方法有什么特点?
该方法通过多轮对话适应性策略生成可读性提示集,并提出了具有线性复杂度的高质量提示筛选度量和基于策略梯度的强化学习框架。它在四个开源数据集上平均优于最先进方法 1.52%,在少样本设置中具有良好的通用性、稳健性和泛化能力。