刚刚,Meta开源「分割一切」2.0模型,视频也能分割了

刚刚,Meta开源「分割一切」2.0模型,视频也能分割了

💡 原文中文,约6100字,阅读约需15分钟。
📝

内容提要

Meta发布了Segment Anything Model 2 (SAM 2),这是一个用于静态图像和动态视频的实时对象分割的统一模型。SAM 2在准确性和性能方面超过了以前的模型,交互时间减少了1/3。该模型采用了流式内存设计,适用于实时应用。Meta还发布了一个大型注释数据库SA-V,用于训练SAM 2。该模型是开源的,可用于各种应用。然而,SAM 2在跟踪具有剧烈摄像机角度变化或长期遮挡的视频中仍面临挑战。

🔎

延伸解读

流式内存架构:实时视频分割的关键

SAM 2 采用流式内存设计,按顺序处理视频帧,并利用记忆库存储对象信息,从而实现在任意长视频上的实时分割。这种架构使模型能够记住之前帧中的对象,并在当前帧中准确分割,无需重新处理整个视频。对于需要实时响应的应用(如机器人、自动驾驶),这一设计至关重要。

SA-V 数据集:规模与多样性并重

Meta 发布的 SA-V 数据集包含约 51,000 个视频和超过 600,000 个 masklet 注释,覆盖 47 个国家的真实场景。其视频数量是现有最大视频分割数据集的 4.5 倍,注释数量是 53 倍。这种规模和多样性有助于训练出更鲁棒的模型,但数据集仍以真实场景为主,可能无法覆盖所有边缘情况。

性能提升与交互效率

SAM 2 在图像和视频分割任务上均优于前代模型,在 17 个零样本视频数据集上表现突出,所需人机交互减少约三倍。在图像基准测试中,速度比 SAM 快六倍,视频推理速度约每秒 44 帧,达到实时水平。这些改进降低了使用门槛,使非专家用户也能高效完成分割任务。

局限与挑战:仍非万能

SAM 2 在剧烈摄像机角度变化、长期遮挡、拥挤场景或长视频中可能丢失目标,对快速移动对象的细节分割也不稳定。模型对每个对象单独处理,缺乏对象间通信,同时分割多个对象时效率下降。此外,数据注释仍依赖人工验证,未来需进一步自动化。

❓

Q&A

SAM 2模型的主要功能是什么?

SAM 2模型用于静态图像和动态视频的实时对象分割,能够分割任何对象,包括之前未见过的对象。

Meta发布的SA-V数据集有什么特点?

SA-V数据集包含约51,000个视频和超过600,000个masklets,是现有视频分割数据集的十倍以上。

SAM 2在性能上相比于之前的模型有哪些改进?

SAM 2在准确性和性能方面超过了之前的模型,交互时间减少了1/3,并且在多个基准测试中表现优异。

SAM 2在处理视频时面临哪些挑战?

SAM 2在剧烈摄像机角度变化、长期遮挡和拥挤场景中仍面临对象追踪的挑战。

如何使用SAM 2进行对象分割?

用户可以通过点击、边界框或掩码提示来定义对象范围,SAM 2会根据提示生成分割掩码。

Meta对SAM 2的开源承诺是什么?

Meta将SAM 2开源并免费使用,使用Apache 2.0协议共享代码和模型权重。

🏷️

标签

➡️

继续阅读