本文介绍了一种名为Voila-A的视觉-语言模型(VLMs),通过目光对齐提升模型的可解释性和效果。研究还提出了基于注视的视觉问答数据集GazeVQA,并利用注视目标估计提高任务准确性。此外,论文探讨了结合大型语言模型的对话管理器,增强了对话代理的视觉能力,展望了更丰富的用户交互体验。
完成下面两步后,将自动完成登录并继续当前操作。