本研究提出RaVL方法,旨在发现和缓解微调视觉语言模型中的虚假相关性。通过区域级聚类识别导致分类错误的图像特征,并利用区域感知损失函数优化微调过程,从而显著提升模型性能。实验证明,RaVL在解决虚假相关性方面效果显著,具有广泛应用潜力。
完成下面两步后,将自动完成登录并继续当前操作。