FlexiSLM是首个支持动态帧率的语音大模型,可在4-12.5Hz间运行,无需重训。它根据信息密度动态分配语音Token,输入输出端均支持可控帧率。在7B规模上超越Qwen2.5-Omni等基线,输出降至6.25Hz时推理时间近半,性能仅微降。目标帧率控制误差小于0.1Hz,并开源了最大语音问答数据集。
完成下面两步后,将自动完成登录并继续当前操作。