阿里最新开源丨语音分离、降噪、回声消除全覆盖:FLASepformer 与 JAEC 上线

阿里最新开源丨语音分离、降噪、回声消除全覆盖:FLASepformer 与 JAEC 上线

💡 原文中文,约6800字,阅读约需17分钟。
📝

内容提要

Qwen Audio团队在ModelScope开源语音增强模型,新增FLASepformer单通道语音分离和JAEC可解释端到端回声消除。FLASepformer采用门控线性注意力将复杂度降至O(N),推理更快、显存更低;JAEC用神经网络实现时延估计与线性处理,延迟22毫秒。系列模型覆盖降噪、分离与回声消除,可提升语音大模型数据质量。

🔎

延伸解读

FLASepformer 的效率提升与适用场景

FLASepformer 通过门控线性注意力将复杂度从 O(N²) 降至 O(N),在 RTX A800 上处理 30 秒混合音频时,FLA-SepReformer-T/B/L 的推理速度分别达到基线的 2.29 倍、1.91 倍和 1.49 倍,显存占用仅为 15.8%、20.9% 和 31.9%。这意味着长序列语音分离的部署门槛降低,更适合需要处理长音频或资源受限的场景。

JAEC 的可解释性与当前限制

JAEC 将时延估计和线性处理都交由神经网络实现,形成可观察的处理链路,便于调试通信问题。其 16 kHz 版本每次处理 10 ms 音频,固定算法延迟 22 ms,适合实时通话与会议前端。但当前开源版本暂不包含非线性处理网络,因此对于非线性回声的抑制能力可能有限,选型时需结合业务评测。

语音增强在数据工程中的质量控制作用

文章强调语音增强可作为语音大模型数据入口的质量控制环节。在 VAD、ASR、说话人日志等步骤前,用 FLASepformer 分离重叠语音、JAEC 消除回声、降噪模型抑制噪声,能减少错误向标注和训练数据传播。建议保留原始音频、增强音频、模型版本和处理日志,以便追溯和重新处理,避免不可逆的清洗。

模型选型需关注采样率与实时性约束

系列模型覆盖降噪、分离和回声消除,但不同模型的采样率、输入信号和实时性约束不同。例如 FLASepformer 为 8k,JAEC 为 16k,DFSMN ANS 为 48k 且支持流式。文章建议以模型卡和业务评测结果为准进行选择,部署前还需核对许可证、模型版本和采样率,确保与现有链路匹配。

Q&A

FLASepformer 在语音分离任务中是如何降低计算复杂度的?

FLASepformer 采用门控聚焦线性注意力(Gated Focused Linear Attention)和门控模块,将注意力计算复杂度从 O(N²) 降为 O(N),形成 FLA-SepReformer 与 FLA-TFLocoformer 两种结构,从而高效处理长序列。

JAEC 回声消除模型的可解释性体现在哪里?

JAEC 的时延估计(TDE)和线性处理(LP)均由神经网络实现:TDE 网络估计远端参考与麦克风信号的相对时延并完成对齐,LP 网络估计线性回声并完成抵消。可观察的时延与线性处理过程便于通信链路调试。

JAEC 16k 模型的延迟是多少?

JAEC 16k 每次处理 160 个采样点(10 ms),固定算法延迟为 352 个采样点(22 ms)。

FLASepformer 相比基线模型在推理速度和显存占用上有何优势?

在 RTX A800、30 秒混合音频设置下,FLA-SepReformer-T/B/L 的推理速度分别达到对应 SepReformer 基线的 2.29 倍、1.91 倍和 1.49 倍,GPU 显存占用分别为 15.8%、20.9% 和 31.9%,同时保持有竞争力的分离性能。

语音增强模型在语音大模型数据工程中有什么作用?

语音增强模型可在 VAD、ASR、说话人日志和语音—文本对齐之前清理信号:FLASepformer 拆分重叠说话人,JAEC 抵消回放链路产生的回声,降噪模型抑制环境噪声,从而降低错误向标注、配对和训练数据传播的概率。

针对实时通话与会议场景,推荐使用哪些语音增强模型组合?

推荐 JAEC + DFSMN ANS 组合:先抵消回声,再抑制背景噪声,改善双讲与远端听感。

🏷️

标签

➡️

继续阅读