腾讯发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度识别与语义理解,在通用识别、方言、上下文感知等维度提升。在开源和自建评测中WER领先,中文普通话3.34%、英语2.62%、粤语3.12%。已上线腾讯云API,元宝App免费体验。
腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview,基于Hy3大模型提升通用识别、方言覆盖、上下文理解及复杂环境鲁棒性,在开源和自建评测中WER表现领先。支持热词注入,适配专业场景,已上线腾讯云API,并集成于元宝App,免费提供语音输入服务。
该文介绍了对Whisper语音识别模型的改进,通过在额外数据上微调和使用改进的解码算法,提高了在低资源语言方面的性能。使用Filter-Ends和Min Lookahead解码算法,WER相对于标准beam search平均减少了2.26。
研究提出了一种名为“Detect and Pass”的算法,用于解决语音助手对口吃人士不友好的问题。该算法通过对口吃音频帧分类器对音频进行筛选,并将结果传递到ASR模型中,提高其错误率的鲁棒性。研究结果显示,在不同的ASR系统上,WER的降低幅度达到了23.93%到71.67%。
完成下面两步后,将自动完成登录并继续当前操作。