FlexiSLM是首个支持动态帧率的语音大模型,可在4-12.5Hz间运行,无需重训。它根据信息密度动态分配语音Token,输入输出端均支持可控帧率。在7B规模上超越Qwen2.5-Omni等基线,输出降至6.25Hz时推理时间近半,性能仅微降。目标帧率控制误差小于0.1Hz,并开源了最大语音问答数据集。
全双工人机交互技术受到关注,ASLP实验室与上海元音矩阵科技公司联合开源了SmoothConv和DuplexConv两个中文长音频对话数据集。这些数据集包含真实对话场景,旨在支持语音大模型研发,提供高质量对话数据,涵盖教育和闲聊领域,助力全双工系统的中断与响应决策。
豆包APP于1月20日更新了实时语音通话功能,基于最新语音大模型,提供接近真人的对话体验,显著提升语音真实感和情绪表现,支持多种声线和方言,用户满意度达到4.36/5。
完成下面两步后,将自动完成登录并继续当前操作。