本研究构建了一个高质量的远程感知图像字幕数据集(RSICap),包括 2,585 个人工注释的字幕,为每个图像提供了详细的描述,包括场景描述和对象信息。此外,还提供了一个基准评估数据集 RSIEval,可以全面评估在 RS 背景下的视觉语言模型。
ViECap是一种可转移的解码模型,利用实体感知解码生成见过和没见过的场景中的描述。通过实体感知的硬提示,ViECap能够在跨多样场景的连贯字幕生成中保持性能,并在跨域字幕生成方面达到最新水平。
完成下面两步后,将自动完成登录并继续当前操作。