小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
TF-MossFormer:鱼与熊掌亦可兼得?在单通道语音分离中同时捕捉“局部细节”与“全局依赖”

阿里团队提出TF-MossFormer,一种时频域单通道语音分离混合Transformer框架,通过结合局部滑动窗口注意力与全局注意力,并加入卷积门控机制,协同捕捉语音的细粒度局部连续性与长距离全局依赖。在WSJ0-2Mix基准上,该模型以多种规模超越现有方法,小模型高效,大模型达新SOTA,验证了局部与全局协同建模在语音分离中的有效性。

TF-MossFormer:鱼与熊掌亦可兼得?在单通道语音分离中同时捕捉“局部细节”与“全局依赖”

实时互动网 实时互动网 · 2026-07-27T07:48:09Z

本文介绍了一种新颖的音视频语音分离方法:递归时频分离网络(RTFS-Net)。该方法利用算法对音频的时间和频率进行建模,并引入了基于注意力的融合技术,以整合音频和视觉信息。RTFS-Net 在参数和计算量方面都比先前的方法更优秀,是首个在时频域中超越所有当代时域对应方法的音视频语音分离方法。

RTFS-Net: 循环时间频率建模 有效的音频视觉语音分离

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-09-29T00:00:00Z

本文介绍了一种名为TFDNet的方法,用于从时频域捕捉长期潜在模式和时间周期性。TFDNet通过多尺度的时频增强编码器和两个独立的趋势和季节时频块来捕捉多分辨率中分解的趋势和季节成分的不同模式。实验证明,TFDNet在效果和效率上优于现有方法。

TFDNet:基于时频增强分解网络的长期时间序列预测

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-08-25T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码