本文介绍了一种基于Transformer的流式自动语音识别(ASR)系统,采用时间限制的自注意力机制和触发式关注机制,显著降低了识别延迟并提高了准确性。在LibriSpeech和AISHELL-1数据集上,该系统实现了最佳的词错误率和字符错误率,展示了流式与非流式模型的有效整合与优化。
完成下面两步后,将自动完成登录并继续当前操作。