西工大团队提出FlashTTS,一种面向实时语音对话的低时延流式TTS框架。它通过滞后式多轨架构支持流式文本输入,利用Multi-Token Prediction加速语音token生成,并采用X-pred Mean Flow Distillation将声学解码压缩至2步。实验显示,FlashTTS将首包延迟降至325ms,同时保持较好的零样本音色克隆和多语言可懂度,为实时语音助手等应用提供高效基础。
完成下面两步后,将自动完成登录并继续当前操作。