不用出声也能聊天?苹果公开一项无声语音识别专利

不用出声也能聊天?苹果公开一项无声语音识别专利

💡 原文中文,约2200字,阅读约需6分钟。
📝

内容提要

苹果申请了一项默声语音检测专利,通过光学传感器捕捉面部肌肉微动,经神经网络解码为文字并合成语音,延迟低于100毫秒。系统支持耳机或眼镜集成,可离线或分布式运行,并强调低延迟音频反馈以确认识别结果。该技术路线已有先例,核心创新在于本地反馈和硬件架构。

🔎

延伸解读

技术路线已有先例,创新点在于反馈与架构

专利文件指出,国际检索报告将US 2024/221719 A1列为X类对比文件,意味着“光学散斑+神经网络解码语音”的基础技术路线已被他人公开,并非苹果首创。本专利的核心创新组合集中在100毫秒以内的本地音频反馈、I²S低延迟音频通路,以及适配默声识别的分布式硬件架构。因此,该专利的价值更多在于优化用户体验和硬件集成,而非开辟全新领域。

低延迟反馈是提升实用性的关键

传统无声识别方案普遍缺少实时反馈,用户难以快速确认识别结果。本专利将本地实时音频回放作为核心改进点,总延迟控制在100毫秒以内,接近正常说话时的自我听觉体验。此外,回放给用户的音频可适当降低保真度,而对外通话则使用高保真音频,这种策略在保证实时性的同时,也避免了算力和功耗的浪费,提升了日常使用的可行性。

硬件集成方案指向现有产品线

专利附图给出了两种硬件形态:耳挂式无线耳机(适配AirPods系列)和智能眼镜集成方案(适配Vision Pro或苹果智能眼镜)。耳机方案在耳机外侧延伸支架搭载光学传感头,眼镜方案则在镜腿集成传感模块,并可加装肌电电极作为补充。这表明苹果可能将默声识别技术融入现有穿戴设备,但专利公开不代表已有明确量产计划,最终产品形态和上市时间仍不确定。

Q&A

苹果的默声语音识别专利是如何工作的?

苹果的默声语音识别专利通过光学传感器捕捉面部肌肉微动,利用神经网络将皮肤微动解码为文字并合成语音,系统包括非接触光学传感、神经网络解码和低延迟音频反馈三部分。

苹果默声语音识别专利的延迟是多少?

苹果的默声语音识别专利将总延迟控制在100毫秒以内,使用体感接近人正常出声时听见自身语音的效果。

苹果默声语音识别专利有哪些硬件集成方案?

苹果的专利提供了两种硬件集成方案:一种是耳挂式无线耳机,光学传感头悬停在脸颊前方;另一种是智能眼镜,传感模块整合在镜腿,并可加装肌电电极。

🏷️

标签

➡️

继续阅读