西工大团队提出FlashTTS,一种面向实时语音对话的低时延流式TTS框架。它通过滞后式多轨架构支持流式文本输入,利用Multi-Token Prediction加速语音token生成,并采用X-pred Mean Flow Distillation将声学解码压缩至2步。实验显示,FlashTTS将首包延迟降至325ms,同时保持较好的零样本音色克隆和多语言可懂度,为实时语音助手等应用提供高效基础。
国际语音会议Interspeech 2026将于2026年9月在悉尼举行,期间将举办音频编码器能力挑战赛(AECC)。比赛聚焦音频编码器在复杂场景下的表现,参赛者需提交预训练模型,主办方提供评估系统。参赛者可使用公开数据集,报名截止日期为2026年1月25日。
At Interspeech 2025, Bloomberg's AI engineers explore how they adapted OpenAI's Whisper system into a true streaming automatic speech recognition (ASR) model that delivers real-time CPU...
苹果将在2025年8月17日至21日于荷兰鹿特丹的Interspeech大会上展示语言处理技术的新成果,并设立展位欢迎参观。
苹果将在2025年8月17日至21日于荷兰鹿特丹的Interspeech大会上展示语言处理技术,设立展位并举办多场研讨会和活动。
本研究提出了一种结合超声声响与机器学习的新方法,用于小鼠自闭症谱系障碍(ASD)的检测,显示出良好的分类效果,为ASD检测开辟了新方向。
随着语音技术的发展,全球语言多样性面临挑战。卡内基梅隆大学等机构推出ML-SUPERB 2.0挑战赛,旨在推动多语言语音技术,提供141种语言的语音数据,特别关注小众语言,确保技术公平应用。
苹果赞助2024年9月1日至5日在希腊科斯举行的第25届Interspeech大会,专注于语言处理技术的研究。会议期间,苹果将在Kipriotis酒店展位展示与语音识别相关的研究和工具。
该研究评估了基于Transformer的语音表示模型在多语言语音情感识别中的性能,发现使用最优层特征可降低错误率32%。在德语和波斯语中取得了最新成果,强调中间层对情感信息捕捉的重要性,并提出了多预训练模型和特征增强方法,以提升情感识别的准确率。
本文探讨了语音识别和生成系统的研究进展,重点关注印度语言的ASR模型和视觉语音识别系统的表现。研究表明,离散单元在语音处理中的有效性,以及通过不同技术提高识别准确率的潜力。
Interspeech 2023收录了火山引擎流媒体音频团队的4篇研究论文,涵盖了语音增强、基于AI编解码、回声消除和无监督自适应语音增强等领域。他们在无监督自适应语音增强方面获得了CHiME挑战赛冠军。此外,他们还提出了轻量级语音谐波增强方法、端到端神经网络音频编码器、回声消除方法和无监督域自适应语音增强系统。
完成下面两步后,将自动完成登录并继续当前操作。