SAM-REF:重新思考图像与提示的协同作用以细化分割

💡 原文中文,约1400字,阅读约需4分钟。
📝

内容提要

该文介绍了Meta AI Research开发的Segment Anything Model(SAM)及其多种应用,研究了RefSAM、AI-SAM、CAT-SAM等模型,探索了跨模态学习、用户交互和优化机制,显著提升了图像分割的准确性和效率。

🔎

延伸解读

SAM 改进的多条技术路径

文章梳理了 SAM 的多种改进模型,展示了不同的优化方向。RefSAM 侧重跨模态对齐,AI-SAM 引入自动与交互式提示器,CAT-SAM 通过条件微调适应少样本任务,SAM-Lightening 改进注意力机制提升效率,SegNext 和 FocSAM 则优化交互式分割。这些工作分别从特征融合、提示设计、参数高效调整和推理加速等角度推进 SAM,反映了该领域研究的多样性。

效率与精度的平衡尝试

在提升分割精度的同时,多个模型致力于降低计算成本。SAM-Lightening 通过 Dilated Flash Attention 和渐进蒸馏,将每幅图像推理时间降至 7 毫秒,速度是原始 SAM 的 30.1 倍,内存占用仅为 3.5%。FocSAM 利用动态窗口注意力和像素级动态 ReLU,在匹配最先进分割质量的同时,推理时间仅需对比方法的约 5.6%。这些进展表明,SAM 的实用化部署正逐步成为可能。

交互式分割的实用化进展

针对交互式分割,SegNext 和 FocSAM 等方法着力提升用户体验。SegNext 通过密集设计细化视觉提示表示,在 HQSeg-44K 和 DAVIS 上表现优异。另一项工作利用用户交互和掩码生成伪标签,使 SAM 能在实时使用中调整,显著降低新领域或对象类型的交互失效率,在 FR_20@85 和 FR_30@90 指标上相对减少约 48.1% 和 46.6%。这些改进让 SAM 更适应实际场景中的动态需求。

❓

Q&A

Segment Anything Model(SAM)是什么?

Segment Anything Model(SAM)是Meta AI Research开发的一种图像分割模型,旨在提升图像分割的准确性和效率。

RefSAM模型如何提升图像分割性能?

RefSAM模型通过跨模态学习和参数高效的调整策略,成功对齐并融合语言和视觉特征,从而提升了图像分割性能。

AI-SAM模型的主要创新是什么?

AI-SAM模型引入了自动与交互式提示器,能够在自动生成初始提示的同时接受用户输入,从而提升分割性能。

CAT-SAM模型适用于哪些任务?

CAT-SAM模型用于处理各种非传统图像目标分割任务,通过少量目标样本提升目标分割性能。

SAM-Lightening的优势是什么?

SAM-Lightening通过改进的注意力机制实现了显著的运行时间效率和分割准确性,推理速度是原始SAM的30.1倍。

SegNext方法如何减少交互式分割的失效率?

SegNext方法通过用户交互和伪标签生成,显著减少了在新领域或对象类型中进行交互式分割的失效率。

🏷️

标签

➡️

继续阅读