小红花·文摘

该文介绍了一种基于音频查询的Transformer架构（AQFormer），建立了音频和视觉模态之间的对象级语义对应关系，并提出了一种基于音频的时间交互模块。实验结果表明，该方法在两个AVS基准测试集上取得了最先进的性能。