端到端多通道说话人归属 ASR:说话人指导解码器与输入特征分析

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

该研究提出了一种端到端的多通道说话人归属自动语音识别系统,结合了基于 Conformer 的编码器和基于说话人归属的 Transformer 解码器。该模型在语音识别中表现出色,尤其是在多通道会议转录中。研究还探讨了不同输入特征对ASR性能的影响。

🏷️

标签

➡️

继续阅读