小红花·文摘

该文章介绍了一个包含60亿个图像-文本配对的双语数据集BM-6B，并提出了一种新的分组聚合方法来处理此规模的数据集。通过预训练双语图像-文本基础模型，取得了在多模态检索和分类任务方面的成果，并在零样本分类设置下，在ImageNet上的top-1准确率超过了以前报道的SoTA方法。