Deepgram 为骁龙处理器提供边缘实时语音 AI 解决方案

Deepgram 为骁龙处理器提供边缘实时语音 AI 解决方案

💡 原文中文,约1200字,阅读约需3分钟。
📝

内容提要

Deepgram与高通合作,将Nova-3语音识别模型优化至骁龙X系列NPU,实现设备端实时语音转文本,无需云端,降低延迟和隐私风险。该技术适用于汽车、AI PC、XR等场景,提升准确率(词错误率6.89%),支持多语言和定制,为离线语音交互奠定基础。

🔎

延伸解读

边缘AI的落地关键:NPU优化

Deepgram将Nova-3模型优化至高通骁龙X系列的Hexagon NPU上运行,这标志着语音识别从云端向设备端迁移的重要一步。NPU的专用算力使得复杂模型能够在功耗受限的设备上实时运行,从而摆脱对云端的依赖。这种优化不仅降低了延迟,还减少了数据传输带来的隐私风险,为汽车、XR、工业等对实时性要求高的场景提供了可行的技术路径。

离线语音交互的实用价值

设备端语音识别意味着在网络不稳定或完全离线的情况下,用户依然可以获得流畅的语音交互体验。对于车载系统、工厂车间、XR头显等场景,这解决了传统云端方案因网络波动导致的响应延迟或中断问题。同时,音频数据无需上传,也降低了敏感信息泄露的风险,使得语音AI在医疗、工业等对数据安全有严格要求的领域更具适用性。

准确率与定制化的双重优势

Nova-3在真实音频中的词错误率仅为6.89%,比第二名低24.7%,这为关键任务场景提供了更高的可靠性。此外,它支持实时多语言转录和自助式定制,无需重新训练模型即可调整词汇,这大大降低了企业部署语音AI的门槛。对于需要特定术语或行业词汇的应用,开发者可以快速适配,提升识别效果。

Q&A

Deepgram与高通合作的具体内容是什么?

Deepgram与高通合作,将Deepgram的Nova-3语音转文本模型优化至骁龙X系列平台的Hexagon NPU上,实现设备端实时语音转文本,无需依赖云连接。

Deepgram的设备端语音识别相比云端方案有哪些优势?

设备端语音识别无需将音频传输到云端,降低了延迟和隐私风险,即使在网络不稳定的边缘环境也能提供自然对话般的体验。

Nova-3模型在准确率方面表现如何?

Nova-3在实际音频制作中的词错误率为6.89%,比排名第二的竞争对手低24.7%,显著提升了准确率。

Nova-3支持哪些功能?

Nova-3是首个提供实时多语言转录的语音AI模型,并支持自助式定制功能,无需重新训练模型即可实现即时词汇调整。

这项技术可以应用在哪些场景?

适用于汽车、AI PC、XR、移动设备、工业边缘计算、物联网和可穿戴设备等领域,尤其适合网络连接不稳定的边缘环境。

高通和Deepgram对这次合作有何评价?

高通产品管理副总裁表示,骁龙的设备端AI与Deepgram的企业级语音AI结合,能满足开发者对准确性、延迟、可靠性和可扩展性的需求;Deepgram业务发展副总裁认为,这为将语音功能集成到各种产品中奠定了基础,使用户无论身处何地都能使用语音交互。

🏷️

标签

➡️

继续阅读