指令调整能提高 LLMs 的一致性吗?
内容提要
本研究提出了一种通过“软提示”优化大型语言模型(LLMs)的方法,以提高其与人类语言处理的相似性。研究表明,指导调优能提升大脑对齐,但对行为对齐的影响有限。同时,提出了对比指令调优(CoIN),增强模型对未知指令的稳健性,顺序指令调整则改善了模型执行多步骤指令的能力。研究还揭示了数据量和模型规模对性能的影响,并强调了人工指导数据的优势。
延伸解读
大脑对齐与行为对齐的分离
文章指出,指令调优平均提升大脑对齐6%,但对行为对齐无类似效果。这意味着模型内部表征更接近人脑神经活动,并不直接转化为阅读任务上更接近人类的行为表现。读者需注意,评估LLM与人类相似性时,应区分神经层面和行为层面,避免将大脑对齐的改善误认为行为一致性的提升。
模型规模与世界知识的关键作用
研究发现大脑对齐与模型大小(r=0.95)及世界知识任务表现(r=0.81)强正相关。这表明,提升LLM与大脑对齐可能更依赖于模型规模和世界知识编码能力,而非单纯指令调优。对于追求类脑表征的研究,扩大模型规模或增强世界知识可能比指令调优更有效。
对比指令调优提升鲁棒性
针对LLM对指令变形敏感的问题,对比指令调优(CoIN)通过最大化语义等效指令表示的相似性,在PromptBench上平均准确率提升2.5%。这提示,提升模型对未知指令的鲁棒性,可借助对比学习思路,而不仅依赖传统指令微调。但提升幅度有限,实际部署中仍需结合其他稳健性策略。
人工数据与顺序指令调优的优势
文章强调,人工指导数据在效率上优于GPT-4合成数据,且随数据量增加能持续提升性能,而合成数据无法达到同样效果。同时,顺序指令调优能增强模型执行多步骤指令的能力,在推理、多语言和多模态任务中优于传统基线。这为数据构建和复杂任务调优提供了实用方向。
Q&A
什么是软提示在大型语言模型中的作用?
软提示通过优化嵌入参数来提高大型语言模型与人类语言处理的相似性。
指导调优对大型语言模型的影响是什么?
指导调优能提升大脑对齐,但对行为对齐的影响有限。
对比指令调优(CoIN)如何提高模型的性能?
CoIN通过最大化语义等效指令实例的隐藏表示相似性,平均准确率提高了2.5%。
顺序指令调整的优势是什么?
顺序指令调整改善了模型执行多步骤指令的能力,尤其在推理和多模态任务中表现优于传统方法。
数据量和模型规模对大型语言模型性能的影响是什么?
数据量和模型规模显著影响性能,人工指导数据的效率高于合成数据。
指导微调对大型语言模型的指令识别有什么影响?
指导微调增强了大型语言模型的指令识别能力和知识存储层次对齐。