腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

💡 原文中文,约1800字,阅读约需5分钟。
📝

内容提要

腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview,基于Hy3大模型提升通用识别、方言覆盖、上下文理解及复杂环境鲁棒性,在开源和自建评测中WER表现领先。支持热词注入,适配专业场景,已上线腾讯云API,并集成于元宝App,免费提供语音输入服务。

🔎

延伸解读

从“转写”到“理解”:ASR 的范式转变

Hy ASR 3.0 preview 强调的不只是识别准确率,而是“理解语境、兼容场景、一键直出”。这意味着语音识别正从单纯的逐字转写,演进为结合语义理解、上下文纠错和意图捕捉的智能系统。对用户而言,同音字、歧义句在上下文中可能被自动修正,转写结果更接近真实意图,而不仅仅是字面内容。

热词注入:专业场景落地的关键

文章特别提到支持热词注入增强,帮助模型快速识别品牌名、人名和行业术语。这对智能客服、内容理解、语音搜索等专业场景尤为重要。通过热词注入,企业无需频繁重新训练模型,即可提升特定领域术语的识别准确率,降低业务接入和持续维护成本,是模型商业化落地的重要能力。

评测数据:开源与自建的双重验证

Hy ASR 3.0 preview 在开源评测集上中文普通话 WER 3.34%、英语 2.62%、粤语 3.12%,多语种控制在 3% 左右。同时,自建评测集覆盖通用、方言、上下文、专词、复杂声学场景,均保持较低 WER。这些数据表明其性能在多个维度上表现均衡,但需注意评测集的具体构成和测试条件,实际效果可能因场景而异。

免费开放与生态接入:普及的推动力

Hy ASR 3.0 preview 已上线腾讯云 API,并集成于元宝 App,免费提供语音输入服务。这一策略有助于快速积累用户反馈,优化模型,同时推动语音识别技术在更多产品中的普及。对于开发者和企业,腾讯云 API 提供了便捷的接入方式,但需关注服务条款、调用限制和后续商业化政策。

Q&A

腾讯混元Hy ASR 3.0 preview是什么?

Hy ASR 3.0 preview是腾讯混元发布的新一代语音识别模型,基于Hy3大模型,融合高精度语音识别与深度语义理解,在通用识别、上下文感知、多场景鲁棒性及方言覆盖等方面有全面提升。

Hy ASR 3.0 preview在开源评测集上的表现如何?

在开源评测集中,Hy ASR 3.0 preview在多语种的WER(词错误率)上控制在3%左右,其中中文普通话WER为3.34%,英语WER为2.62%,粤语WER为3.12%。

Hy ASR 3.0 preview主要提升了哪些能力?

主要提升了四类能力:1. 通用识别更准确,减少错字漏字;2. 更能理解用户意图,结合上下文智能纠错同音词;3. 更容易适配专业场景,支持热词注入;4. 复杂环境下更稳定,针对高噪、耳语等场景优化。

Hy ASR 3.0 preview的技术架构是怎样的?

采用MoE架构,基座模型升级为Hy3,并自研无监督语音Encoder,通过数千万小时级无监督语音数据训练提取声学表征,再与LLM联合训练,并引入多阶段强化学习优化。

Hy ASR 3.0 preview如何支持方言识别?

通过SFT数据体系覆盖10大方言片区和20余个二级小片区,并在训练中引入多阶段强化学习,针对方言识别进行优化。

Hy ASR 3.0 preview目前在哪里可以使用?

已上线腾讯云官网提供API服务,并集成于元宝App,用户可免费使用语音输入功能;WorkBuddy等产品也在陆续接入。

🏷️

标签

➡️

继续阅读