西工大等机构提出MeanVC 2,一种低延迟鲁棒的流式零样本语音转换方法。它通过未来感受野分块机制提升小块转换稳定性,并引入通用音色Token编码器增强低质量参考音频下的说话人建模鲁棒性。实验表明,MeanVC 2在保持轻量化的同时,降低了延迟并提升了转换质量,相关论文被INTERSPEECH 2026接收。
音频语言模型(ALMs)推动语音理解向多任务生成转型。西工大与南京大学等合作提出MSU-Bench评测基准,专注于多说话人对话理解,涵盖16个子任务。研究表明,现有模型在说话人定位和对话推理方面仍存在不足,未来需优化以提升多说话人理解能力。
国际语音会议Interspeech 2026将于2026年9月在悉尼举行,期间将举办音频编码器能力挑战赛(AECC)。比赛聚焦音频编码器在复杂场景下的表现,参赛者需提交预训练模型,主办方提供评估系统。参赛者可使用公开数据集,报名截止日期为2026年1月25日。
完成下面两步后,将自动完成登录并继续当前操作。