通过模型合并减轻语言迁移中的灾难性遗忘

💡 原文中文,约1900字,阅读约需5分钟。
📝

内容提要

该论文分析了多模态大型语言模型(MLLMs)中的灾难性遗忘现象,并提出了后训练调整方法Model Tailor,以有效保留预训练参数。研究发现,MLLM在图像分类任务中的表现不佳,且随着微调,性能显著下降。提出的LR ADJUST方法能够有效减少遗忘,保持新旧知识。整体而言,MLLM在持续学习和多任务场景中仍需改进。

🔎

延伸解读

Model Tailor 的平衡之道

Model Tailor 通过仅替换少量微调参数来保留预训练知识,在原始任务上保持约99%的有效性,同时在新任务上达到约97%的有效性。这种方法在避免灾难性遗忘和适应新任务之间取得了平衡,为多模态大模型的后训练调整提供了实用思路。

MLLM 图像分类的短板

研究发现,多模态大语言模型在标准图像分类任务上表现不佳,甚至无法达到其视觉编码器的性能水平。微调初期可能提升其他数据集上的表现,但随着微调进行,模型开始产生幻觉,泛化能力显著下降,说明其图像分类能力仍有待提高。

LR ADJUST 的持续学习价值

针对多语言持续学习中的灾难性遗忘,LR ADJUST 通过调整学习率来保留新信息而不覆盖旧知识,在51种语言和多种任务上验证有效。该方法可应用于多种持续学习框架,为缓解遗忘提供了简单而通用的策略。

模型合并中的对齐风险

模型合并技术虽能整合多个专家模型,但可能传播安全对齐问题。研究指出,现有合并方法不仅传递领域知识,还会传递错对齐,因此需要在合并过程中引入安全数据,以同时优化专业能力和对齐度。

❓

Q&A

什么是灾难性遗忘现象?

灾难性遗忘现象是指在微调过程中,模型对新任务的学习导致对旧知识的显著遗忘。

Model Tailor方法的主要优势是什么?

Model Tailor方法能够保留约99%的预训练有效性,并在新任务上获得约97%的有效性。

LR ADJUST方法如何帮助减少遗忘?

LR ADJUST方法通过调整学习率,有效保留新信息而不过度覆盖过去的知识,从而减少遗忘。

多模态大型语言模型在图像分类任务中的表现如何?

研究发现,MLLM在图像分类任务中的表现不佳,随着微调,性能显著下降。

该研究对多任务学习有什么启示?

整体而言,MLLM在持续学习和多任务场景中仍需改进,以提高其适应能力和性能。

微调过程中,MLLM会出现什么问题?

在微调过程中,MLLM可能会产生幻觉,并导致显著的泛化能力损失。

🏷️

标签

➡️

继续阅读