小红花·文摘

本研究解决了大型视觉语言模型中生成文本与图像不符的问题。提出的同心因果注意力策略改善了视觉和指令token的交互，显著减少了对象幻觉现象，并在多个基准测试中优于现有方法。