小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
TF-MossFormer:鱼与熊掌亦可兼得?在单通道语音分离中同时捕捉“局部细节”与“全局依赖”

阿里团队提出TF-MossFormer,一种时频域单通道语音分离混合Transformer框架,通过结合局部滑动窗口注意力与全局注意力,并加入卷积门控机制,协同捕捉语音的细粒度局部连续性与长距离全局依赖。在WSJ0-2Mix基准上,该模型以多种规模超越现有方法,小模型高效,大模型达新SOTA,验证了局部与全局协同建模在语音分离中的有效性。

TF-MossFormer:鱼与熊掌亦可兼得?在单通道语音分离中同时捕捉“局部细节”与“全局依赖”

实时互动网 实时互动网 · 2026-07-27T07:48:09Z
突破噪音:新一代 AI 如何改变语音分离技术

基于AI的语音分离技术利用“吸引子”机制,在多人同时发言时能够清晰识别和分离声音,适用于虚拟会议和智能家居设备,提升语音识别准确性和用户体验,未来有望改善人机交互。

突破噪音:新一代 AI 如何改变语音分离技术

实时互动网 实时互动网 · 2025-08-20T06:40:09Z
清华团队新算法玩转频域时域,压缩95%计算量实现语音分离新SOTA!

清华大学研究团队提出了轻量级语音分离模型TIGER,结合时频交叉建模和频带切分策略,显著提升了语音分离效果。新数据集EchoSet更真实地模拟了复杂声学环境,实验结果表明TIGER在性能和效率上优于现有模型。

清华团队新算法玩转频域时域,压缩95%计算量实现语音分离新SOTA!

机器之心 机器之心 · 2025-02-14T05:08:05Z

本研究提出了一种多选择学习(MCL)框架,旨在解决监督学习中语音分离模型的排列问题。实验结果表明,MCL在计算效率上优于传统的排列不变训练(PIT),且性能相当,为处理可变数量说话者的语音分离提供了新的思路。

Application of Multi-Choice Learning in Efficient Speech Separation for Multiple Speakers

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-11-27T00:00:00Z

本研究提出了一种自监督的领域不变预训练前端(DIP),旨在解决语音分离模型在真实环境中因缺乏目标参考数据而导致的领域差距。DIP通过创新任务显著提升了语音分离质量,优于现有模型,具有重要应用潜力。

Speech Separation with Pretrained Frontend to Minimize Domain Mismatch

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-11-05T00:00:00Z

本文研究了Wave-U-Net在语音增强中的应用,发现其在时域建模中能有效提升多个性能指标。提出了Deep Complex U-Net、SDFCN、PoCoNet和FullSubNet+等新型网络结构和方法,均在不同数据集上表现优异。同时,探讨了语音分离与增强的最新进展及其在自动语音识别中的应用潜力。

RelUNet:用于多通道语音增强的相对通道融合 U-Net

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-07T00:00:00Z

本文介绍了多种目标说话人提取算法的研究进展,包括SpeakerBeam、DiffSpEx和LLM-TSE等。研究表明,结合时间域、空间特征和说话人嵌入的方法显著提高了提取效果,尤其在WSJ0-2mix数据集上表现优异,推动了语音分离和识别技术的发展。

基于离散令牌和语言模型的目标说话人提取

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-09-12T00:00:00Z

本研究首次证明了通过语音音频学习强大表征并在转录语音上微调的可行性,超越了半监督方法。提出的AudioLM框架将音频生成视为语言建模任务,能够生成自然连贯的音频。研究还介绍了TokenSplit模型用于语音分离,表现出色。SpeechTokenizer在语音合成中表现优异,SemantiCodec则以低比特率压缩音频,提升重构质量和语义信息。

WavTokenizer:高效的音频离散编码器标记器

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-08-29T00:00:00Z

本文探讨了自监督学习(SSL)在语音分离中的应用,提出了多种方法以提高性能和降低计算成本。通过微调预训练数据,模型在多个数据集上显著改善了单词错误率,并提升了训练速度和效率。此外,研究还介绍了多语言适应和数据增强技术,以应对数据不足的问题。

语音处理的线性复杂度自监督学习

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-07-18T00:00:00Z

本文提出了一种结合视觉线索和自监督学习的音频-视觉多通道语音分离与去混响方法。该研究结合扩散模型和音频-视频预训练框架,显著降低了训练时间和计算量,并在多个任务中超越了现有方法的表现。

基于视觉场景驱动扩散的声音匹配与去混响的相互学习

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-07-15T00:00:00Z

本文探讨了自监督学习在语音分离中的应用,提出了TasNet和SepFormer等模型,显著提升了语音分离性能并降低计算成本。研究表明,结合Transformer和对比学习技术,能够有效处理多说话人环境下的语音分离任务,提高识别准确率。

基于音频编解码的语音分离

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-06-18T00:00:00Z

音频马巴(Audio Mamba)提出了一种基于状态空间模型的自注意力方法,显著提升了音频频谱的依赖关系捕捉能力。SPMamba网络架构在语音分离任务中表现优越,SI-SNRi提高了2.42 dB。此外,Mamba模型在多模态学习和异常检测中也展现了竞争力,具备快速推断和高效性能。

音频蟒蛇:用于自监督音频表示的选择性状态空间

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-06-04T00:00:00Z

Mamba是一种新型人工智能架构,基于状态空间模型,广泛应用于自然语言处理和计算机视觉。研究表明,Mamba在异常检测、语音分离和增强等任务中表现优异,具备高效的推理速度和长距离依赖建模能力,实验验证了其在不同数据集上的优越性能。

SSAMBA:自监督音频表示学习与 Mamba 状态空间模型

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-05-20T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码