腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

💡 原文中文,约1600字,阅读约需4分钟。
📝

内容提要

腾讯发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度识别与语义理解,在通用识别、方言、上下文感知等维度提升。在开源和自建评测中WER领先,中文普通话3.34%、英语2.62%、粤语3.12%。已上线腾讯云API,元宝App免费体验。

🔎

延伸解读

从“转写”到“理解”:ASR 的范式转变

Hy ASR 3.0 preview 不再只是逐字转写,而是基于大语言模型 Hy3 的语义理解能力,强调“理解语境、兼容场景、一键直出”。这意味着语音识别从单纯的声学信号处理,转向结合语义推理的智能转写,能更好地处理上下文、专业名词和复杂场景,更贴近用户真实意图。

方言覆盖与上下文纠错的实际价值

模型在方言识别上覆盖 10 大方言片区和 20 余个二级小片区,并在粤语等方言上取得较低 WER。同时,通过上下文感知能力,可实现智能纠错,例如在元宝 App 中按住说话即可体验。这对智能客服、语音搜索等场景尤为重要,能提升对非标准普通话和口语化表达的理解准确性。

技术路径:数据、架构与强化学习的协同

性能提升并非单一模块的功劳,而是 MoE 架构、数千万小时无监督语音数据训练、联合预训练、多阶段 SFT 和强化学习共同作用的结果。这种综合优化策略,使得模型在通用识别、复杂声学环境(如高噪、耳语)和长尾场景中表现更稳健,降低了误识别和漏识别。

落地与免费体验:降低使用门槛

Hy ASR 3.0 preview 已上线腾讯云 API,可应用于智能客服、内容理解等场景;同时元宝 App 免费开放体验,用户可直接感受方言识别和上下文纠错能力。这种“云 API + 免费 C 端入口”的组合,有助于快速积累用户反馈,推动模型迭代,也降低了开发者和普通用户的试用门槛。

Q&A

腾讯混元Hy ASR 3.0 preview是什么?

腾讯混元Hy ASR 3.0 preview是腾讯发布的新一代语音识别模型,基于大语言模型Hy3,融合高精度语音识别与深度语义理解,在通用识别、上下文感知、多场景鲁棒性和方言覆盖等维度实现提升。

Hy ASR 3.0 preview在开源评测集上的WER表现如何?

在开源评测集上,Hy ASR 3.0 preview的中文普通话WER为3.34%,英语WER为2.62%,粤语WER为3.12%,整体领先竞品。

Hy ASR 3.0 preview相比传统语音识别有哪些能力提升?

Hy ASR 3.0 preview从“逐字转写、单点优化”演进为“理解语境、兼容场景、一键直出”,重点提升了通用识别、上下文感知、复杂声学场景鲁棒性和方言识别四类能力。

Hy ASR 3.0 preview的技术架构是怎样的?

Hy ASR 3.0 preview采用MoE架构,基座模型升级为Hy3,并自研无监督语音Encoder,通过数千万小时级无监督语音数据训练提取声学表征,然后与LLM联合训练,并经过多阶段能力注入和强化学习优化。

Hy ASR 3.0 preview在方言识别方面做了哪些工作?

在SFT数据体系中覆盖了10大方言片区和20余个二级小片区,并通过多阶段强化学习优化复杂长尾场景,提升方言识别能力。

Hy ASR 3.0 preview目前在哪里可以体验?

Hy ASR 3.0 preview已上线腾讯云官网提供API服务,同时元宝App已首发上线,用户可免费体验,WorkBuddy等产品也在陆续接入。

🏷️

标签

➡️

继续阅读