语言模型中的冰冻 Transformer 是有效的视觉编码层

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

研究展示了METER框架,使用多模态端到端Transformer和预训练的增强模型,在VQAv2测试数据集上取得了77.64%的准确率,超过了以前的最优模型,最佳情况下可达80.54%的准确率。

🏷️

标签

➡️

继续阅读