内容提要
FlexiSLM是首个支持动态帧率的语音大模型,可在4-12.5Hz间运行,无需重训。它根据信息密度动态分配语音Token,输入输出端均支持可控帧率。在7B规模上超越Qwen2.5-Omni等基线,输出降至6.25Hz时推理时间近半,性能仅微降。目标帧率控制误差小于0.1Hz,并开源了最大语音问答数据集。
延伸解读
动态帧率的核心价值
传统语音大模型以固定帧率处理语音,忽略了语音信息密度不均的特点。FlexiSLM通过动态分配Token,在信息密集处保留更多帧,在冗余处合并帧,从而在保持性能的同时降低计算开销。这种设计使得模型能够根据实际需求调整帧率,为部署提供了更大的灵活性。
可控帧率的实际意义
FlexiSLM允许用户直接指定目标帧率,而非依赖间接的阈值控制。实验显示,其帧率控制误差小于0.1Hz,这意味着部署方可以更准确地预估计算成本和延迟。例如,将输出帧率从12.5Hz降至6.25Hz,推理时间接近减半,而性能仅微降,为资源受限场景提供了实用选择。
性能与效率的平衡
在7B规模下,FlexiSLM在12.5Hz配置时超越了Qwen2.5-Omni等基线。即使输出降至6.25Hz,S2S得分仍高于所有固定帧率基线。这表明动态帧率不仅没有牺牲质量,反而通过更合理的Token分配提升了效率,为端到端语音模型的发展提供了新思路。
局限性与未来方向
FlexiSLM目前未使用后训练,也未针对流式设计优化,训练数据仅覆盖单轮对话,对复杂推理和多轮对话支持有限。此外,其数据集中部分回复由其他模型蒸馏生成,可能引入偏差。未来计划包括训练更小的0.5B基线模型,以降低社区使用门槛。
Q&A
FlexiSLM是什么?它解决了什么问题?
FlexiSLM是首个支持动态帧率的端到端语音大模型,可在4-12.5Hz之间运行,无需重新训练。它解决了现有语音大模型固定帧率导致的效率问题,如无效Token拉高推理成本、质量与速度只能一次性选定等。
FlexiSLM如何实现动态帧率?
FlexiSLM在输入端使用帧合并模块,根据相邻语义特征的余弦相似度动态压缩语音帧;在输出端使用动态帧率语音编解码器FlexiCodec,并让Talker同时预测语音Token和帧长度Token,从而根据信息密度动态分配Token。
FlexiSLM如何实现可控帧率?
FlexiSLM允许用户直接指定目标帧率(如6.25Hz),模型将目标帧率编码为正弦位置表示作为条件输入Talker,训练时随机采样压缩阈值并监督实际帧率,从而学习目标帧率与生成方式的映射,实现精确控制。
FlexiSLM的性能如何?与Qwen2.5-Omni等模型相比有何优势?
在12.5Hz输入输出下,FlexiSLM的S2T/S2S得分为72.4/67.2,优于Qwen2.5-Omni(66.7/63.3)、Kimi-Audio(69.7/57.2)和Mimo-Audio(70.6/59.0)。当输出降至6.25Hz时,推理时间接近减半,性能仅微降,且最高比Qwen2.5-Omni快2.7倍。
FlexiSLM的帧率控制精度如何?
FlexiSLM的目标帧率控制误差小于0.1Hz。例如请求6.25Hz时实际均值约为6.24-6.25Hz,请求4.0Hz时实际均值约为3.99-4.00Hz,非常稳定。
FlexiSLM的训练数据是什么?是否开源?
FlexiSLM使用了三阶段训练流程,其中Speech-to-Speech问答数据包含约140万条样本,由Qwen3-Omni蒸馏生成。开源了精简版数据集,包含243万条样本、约1.48万小时音频,被认为是目前开源领域最大的语音问答数据集。
FlexiSLM有哪些局限性?
FlexiSLM当前版本尚未使用后训练,也没有针对流式设计和优化;训练数据只覆盖单轮对话,对复杂推理、多轮对话和多选题的覆盖有限。