一键下载Meta最大视频分割数据集!含50.9K真实世界视频,覆盖47个国家
内容提要
Meta发布了Segment Anything Model 2 (SAM 2),可以实时对图像和视频中的对象进行分割和跟踪。SAM 2已应用于医学成像和自动驾驶等多个领域。Meta还发布了一个名为SA-V的大规模数据集,用于训练SAM 2。该数据集包含50.9K个视频和642.6K个掩膜,为未来的计算机视觉研究提供了丰富的资源。SA-V数据集可以从HyperAI网站下载。
延伸解读
SA-V 数据集的规模与标注构成
SA-V 包含 50.9K 个视频和 642.6K 个掩码片段,其中 191K 由人工标注,452K 由 SAM 2 自动生成。与现有视频对象分割数据集相比,其掩码数量是后者的 53 倍,视频数量也更多。这种混合标注策略在保证质量的同时提升了规模,为训练通用分割模型提供了更丰富的数据基础。
数据多样性与地理覆盖
SA-V 的视频覆盖 47 个国家,平均分辨率 1401×1037 像素,平均时长 14 秒,其中室内场景占 54%,室外占 46%。掩码涵盖从大型物体到细粒度细节,且小于 0.1 归一化面积的掩码超过 88%。这种多样性有助于模型适应不同场景,减少偏差。
验证集与测试集的挑战性设计
SA-V 的验证集包含 155 个视频和 293 个掩码片段,测试集包含 150 个视频和 278 个掩码片段。研究人员特意选择快速移动、被遮挡或具有消失/重现模式的目标,以评估模型在困难场景下的鲁棒性。这种设计能更真实地反映模型在实际应用中的表现。
Q&A
Meta的Segment Anything Model 2 (SAM 2)有什么主要功能?
SAM 2能够实时对图像和视频中的对象进行分割和跟踪,具备零样本学习能力。
SA-V数据集包含多少个视频和掩膜?
SA-V数据集包含50.9K个视频和642.6K个掩膜。
SA-V数据集的应用领域有哪些?
SA-V数据集可用于训练、测试和评估通用对象分割模型,适用于计算机视觉研究。
SA-V数据集的视频覆盖了哪些国家?
SA-V数据集的视频覆盖了47个国家。
SA-V数据集与其他视频对象分割数据集相比有什么优势?
SA-V数据集的标注掩膜数量是现有任何VOS数据集的53倍,视频数量和多样性也大幅提升。
如何下载SA-V数据集?
SA-V数据集可以从HyperAI网站一键下载。