内容提要
腾讯发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度识别与语义理解,在通用识别、方言、上下文感知等维度提升。在开源和自建评测中WER领先,中文普通话3.34%、英语2.62%、粤语3.12%。已上线腾讯云API,元宝App免费体验。
延伸解读
从“转写”到“理解”:ASR 的范式转变
Hy ASR 3.0 preview 不再只是逐字转写,而是基于大语言模型 Hy3 的语义理解能力,强调“理解语境、兼容场景、一键直出”。这意味着语音识别从单纯的声学信号处理,转向结合语义推理的智能转写,能更好地处理上下文、专业名词和复杂场景,更贴近用户真实意图。
方言覆盖与上下文纠错的实际价值
模型在方言识别上覆盖 10 大方言片区和 20 余个二级小片区,并在粤语等方言上取得较低 WER。同时,通过上下文感知能力,可实现智能纠错,例如在元宝 App 中按住说话即可体验。这对智能客服、语音搜索等场景尤为重要,能提升对非标准普通话和口语化表达的理解准确性。
技术路径:数据、架构与强化学习的协同
性能提升并非单一模块的功劳,而是 MoE 架构、数千万小时无监督语音数据训练、联合预训练、多阶段 SFT 和强化学习共同作用的结果。这种综合优化策略,使得模型在通用识别、复杂声学环境(如高噪、耳语)和长尾场景中表现更稳健,降低了误识别和漏识别。
落地与免费体验:降低使用门槛
Hy ASR 3.0 preview 已上线腾讯云 API,可应用于智能客服、内容理解等场景;同时元宝 App 免费开放体验,用户可直接感受方言识别和上下文纠错能力。这种“云 API + 免费 C 端入口”的组合,有助于快速积累用户反馈,推动模型迭代,也降低了开发者和普通用户的试用门槛。
Q&A
腾讯混元Hy ASR 3.0 preview是什么?
腾讯混元Hy ASR 3.0 preview是腾讯发布的新一代语音识别模型,基于大语言模型Hy3,融合高精度语音识别与深度语义理解,在通用识别、上下文感知、多场景鲁棒性和方言覆盖等维度实现提升。
Hy ASR 3.0 preview在开源评测集上的WER表现如何?
在开源评测集上,Hy ASR 3.0 preview的中文普通话WER为3.34%,英语WER为2.62%,粤语WER为3.12%,整体领先竞品。
Hy ASR 3.0 preview相比传统语音识别有哪些能力提升?
Hy ASR 3.0 preview从“逐字转写、单点优化”演进为“理解语境、兼容场景、一键直出”,重点提升了通用识别、上下文感知、复杂声学场景鲁棒性和方言识别四类能力。
Hy ASR 3.0 preview的技术架构是怎样的?
Hy ASR 3.0 preview采用MoE架构,基座模型升级为Hy3,并自研无监督语音Encoder,通过数千万小时级无监督语音数据训练提取声学表征,然后与LLM联合训练,并经过多阶段能力注入和强化学习优化。
Hy ASR 3.0 preview在方言识别方面做了哪些工作?
在SFT数据体系中覆盖了10大方言片区和20余个二级小片区,并通过多阶段强化学习优化复杂长尾场景,提升方言识别能力。
Hy ASR 3.0 preview目前在哪里可以体验?
Hy ASR 3.0 preview已上线腾讯云官网提供API服务,同时元宝App已首发上线,用户可免费体验,WorkBuddy等产品也在陆续接入。