视觉问答:仅基于视觉的问答

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种新的多模态任务——视觉问答(VoQA),要求模型根据图像中的视觉问题进行理解和回答。通过引入监督微调策略,显著提升了模型的推理能力和对复杂场景的理解。

🏷️

标签

➡️

继续阅读