文本语义是否可以减轻声音目标分割偏好?

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

该文章介绍了一种基于音频查询的Transformer架构(AQFormer),通过利用预定义的音频查询在视觉特征中聚集对象信息,建立了音频和视觉模态之间的对象级语义对应关系,并提出了一种基于音频的时间交互模块。实验结果表明,该方法在两个AVS基准测试集上取得了最先进的性能。

🎯

关键要点

  • 提出了一种基于音频查询的Transformer架构(AQFormer)。
  • 通过预定义的音频查询在视觉特征中聚集对象信息。
  • 建立了音频和视觉模态之间的对象级语义对应关系。
  • 提出了一种基于音频的时间交互模块,用于多帧之间交换与声音对象相关的信息。
  • 实验结果显示该方法在两个AVS基准测试集上取得了最先进的性能。
  • 在MS3设置上取得了7.1%的M_J增益和7.6%的M_F增益。
➡️

继续阅读