阿里团队提出TF-MossFormer,一种时频域单通道语音分离混合Transformer框架,通过结合局部滑动窗口注意力与全局注意力,并加入卷积门控机制,协同捕捉语音的细粒度局部连续性与长距离全局依赖。在WSJ0-2Mix基准上,该模型以多种规模超越现有方法,小模型高效,大模型达新SOTA,验证了局部与全局协同建模在语音分离中的有效性。
本文介绍了一种新颖的音视频语音分离方法:递归时频分离网络(RTFS-Net)。该方法利用算法对音频的时间和频率进行建模,并引入了基于注意力的融合技术,以整合音频和视觉信息。RTFS-Net 在参数和计算量方面都比先前的方法更优秀,是首个在时频域中超越所有当代时域对应方法的音视频语音分离方法。
本文介绍了一种名为TFDNet的方法,用于从时频域捕捉长期潜在模式和时间周期性。TFDNet通过多尺度的时频增强编码器和两个独立的趋势和季节时频块来捕捉多分辨率中分解的趋势和季节成分的不同模式。实验证明,TFDNet在效果和效率上优于现有方法。
完成下面两步后,将自动完成登录并继续当前操作。