综述视觉问答(VQA)研究,涵盖数据集、深度学习模型与应用挑战;指出预训练视觉语言模型存在分布偏移,生成模型对数据变化更稳健;提出基于大语言模型的评估指标、知识驱动评估方法及时尚领域VQA系统,并关注时间泛化与多模态问答方向。
完成下面两步后,将自动完成登录并继续当前操作。