一键下载Meta最大视频分割数据集!含50.9K真实世界视频,覆盖47个国家
内容提要
Meta开源了SAM 2模型,可以根据视频帧上的提示(点击、框选或遮罩)准确识别和分割图像或视频中的任何对象。SAM 2模型已应用于医学图像分割等多个领域。Meta还发布了用于训练SAM 2的SA-V数据集,可在HyperAI网站上下载。SA-V数据集是一个大型多样化的视频分割数据集,为未来的计算机视觉工作提供了丰富的数据资源。
延伸解读
SA-V 数据集的规模与标注优势
SA-V 数据集包含 50.9K 个视频和 642.6K 个 masklets,标注的 masks 数量是现有任何 VOS 数据集的 53 倍。其中,191K 个 masklets 由人工标注,452K 个由 SAM 2 自动生成。这种大规模且高质量的标注为训练通用对象分割模型提供了丰富的数据资源,有助于提升模型的泛化能力。
数据集的多样性与地理覆盖
SA-V 数据集覆盖 47 个国家,视频主题多样,包含 54% 的室内场景和 46% 的室外场景,平均分辨率为 1401×1037 像素,平均时长 14 秒。这种地理和场景的多样性有助于减少模型偏差,使其能更好地适应不同环境下的视频分割任务。
数据集划分与挑战性场景
研究人员根据视频作者和地理位置划分数据集,确保相似对象有最小重叠。验证集和测试集聚焦于快速移动、遮挡、消失/重现等挑战性场景,分别包含 293 和 278 个 masklets。这种设计能更严格地评估模型在复杂情况下的性能。
Q&A
Meta的SAM 2模型有什么主要功能?
SAM 2模型能够根据视频帧上的提示精准识别和分割图像或视频中的任何对象。
SA-V数据集包含多少个视频和masklets?
SA-V数据集包含50.9K个视频和642.6K个masklets。
SA-V数据集的应用领域有哪些?
SA-V数据集可用于训练、测试和评估通用对象分割模型,适用于计算机视觉的多个领域。
SA-V数据集的地理覆盖范围如何?
SA-V数据集覆盖47个国家,视频由不同参与者拍摄,展现了地理多样性。
SA-V数据集与其他视频对象分割数据集相比有什么优势?
SA-V数据集在视频、masklets和masks数量上均有大幅提升,其标注的masks数量是现有任何VOS数据集的53倍。
如何下载SA-V数据集?
SA-V数据集可以在HyperAI官网上直接下载,链接为https://go.hyper.ai/e1Tth。