内容提要
本文介绍苹果Siri Expressive Voices背后的内存高效音频合成架构。该架构将语义音频令牌转换为RVQ表示,采用流式编码器、时间解码器和深度解码器三组件设计,通过可复用的扩散Transformer深度解码器生成所有RVQ级别,并使用因果滑动窗口注意力实现恒定内存复杂度。在AMX上运行速度比实时快16倍,峰值内存仅约21MB,显著提升语音质量,MOS评分提高0.28。
延伸解读
架构创新:解耦时间与深度处理
该架构将音频合成任务分解为时间与深度两个维度,分别由时间解码器和深度解码器处理。这种解耦设计避免了传统多解码器架构中每个RVQ级别需要独立解码器的冗余,通过一个可复用的扩散Transformer深度解码器统一生成所有RVQ级别,显著降低了模型复杂度和内存占用。
内存效率的关键:因果滑动窗口注意力
采用因果滑动窗口注意力机制,配合固定窗口的键值缓存,使得内存复杂度与序列长度无关,保持恒定。这取代了传统Transformer和GAN方法中随序列长度线性或二次增长的内存需求,使得在设备端连续合成20至320秒音频成为可能,峰值内存仅约21MB。
实际性能与部署效果
在AMX上运行速度比实时快16倍,每步约10毫秒,峰值内存约21MB,设备端资产仅329MB。该架构已部署于Siri Expressive Voices,支持语速和表达自定义滑块,并提升语音质量,MOS评分整体提高0.28,对话语音提高0.42。
Q&A
苹果Siri Expressive Voices背后的音频合成架构是什么?
该架构是一个内存高效的音频合成系统,将语义音频令牌转换为RVQ表示,采用流式编码器、时间解码器和深度解码器三组件设计,通过可复用的扩散Transformer深度解码器生成所有RVQ级别,并使用因果滑动窗口注意力实现恒定内存复杂度。
该音频合成架构如何实现内存高效?
通过使用因果滑动窗口注意力和固定窗口键值缓存,使得内存复杂度与序列长度无关,保持恒定。此外,采用单一可复用的深度解码器替代多个专用解码器,减少了内存占用。
该架构在AMX上的运行速度和内存占用是多少?
在AMX上,该架构每个生成步骤约10毫秒,比实时快约16倍,峰值运行内存约21MB,设备上资产占用329MB。
该架构相比之前的系统在语音质量上提升了多少?
相比之前的设备端文本转语音系统,该架构的MOS评分整体提高了0.28(从3.87到4.15),在对话语音上提高了0.42(从3.82到4.24)。
该架构的三个主要组件是什么?它们各自的作用是什么?
三个组件是流式编码器、时间解码器和深度解码器。流式编码器处理输入,时间解码器处理时间维度,深度解码器处理深度维度(RVQ级别),它们系统地解耦了时间和深度处理。
该架构如何生成所有RVQ级别?
通过一个可复用的深度解码器,采用扩散Transformer(DiT)风格的阶段条件化,自回归地生成所有RVQ级别,取代了之前多解码器架构中每个级别专用的解码器。
该架构支持多长的音频流式合成?
支持连续流式合成20到320秒的音频。
该架构在哪些产品中部署?
该架构已部署在Siri Expressive Voices中,支持Apple设备上的语速和表现力自定义滑块,以及自定义助手声音。