本文提出了IQ-LUT方法,通过插值、非均匀量化和残差学习,解决了查找表超分辨率技术的存储膨胀问题。该方法在保持高质量图像重建的同时,显著压缩模型体积,尤其在移动端和嵌入式设备上表现优异。实验结果表明,IQ-LUT在多个基准数据集上优于现有方法,展现出高性能与效率。
2025年低资源音频编解码器比赛吸引了多家机构参与,字节跳动团队表现优异,获得赛道1冠亚军和赛道2季军。比赛聚焦低复杂度、高音质的音频编解码技术,推动实时通信和流媒体的发展。团队提出的IRIS和Enhance-Nanocodec方案在严格限制下实现了优质音频重建,未来将继续优化技术,拓展应用场景。
苹果将在2026年国际声学、语音与信号处理会议(ICASSP)上展示新研究,会议定于5月4日至8日在西班牙巴塞罗那举行。苹果再次赞助该会议,汇聚信号处理及其应用领域的科研和工业界。
本文提出IQ-LUT方法,通过插值、非均匀量化和残差学习,解决查找表超分辨率技术的存储膨胀问题。该方法在小模型下实现高质量超分辨率,尤其在复杂纹理和边缘区域表现优异。实验结果表明,IQ-LUT在多个基准数据集上优于现有方法,展现出良好的性能与效率平衡。
本文提出了一种针对低资源语言(如泰语)的语音大语言模型(SLLM)多任务理解方案,核心创新包括自监督学习的语音编码器XLSR-Thai、通用语音-文本对齐方法U-Align,以及泰语口语理解数据生成流水线Thai-SUP。实验结果表明,该方案有效提升了泰语的自动语音识别和多任务理解能力,为低资源语言的SLLMs构建提供了新路径。
苹果赞助的IEEE国际声学、语音与信号处理会议(ICASSP)将于2025年4月6日至11日在印度海得拉巴举行,展示信号处理相关研究与应用,苹果将在C3展位设立展台,欢迎参观。
ICASSP 2024车载多通道自动语音识别(ICMC-ASR)挑战收集了100多小时的多通道语音数据,并设立了ASR和ASDR两个赛道。USTCiflytek团队在ASR赛道上取得了13.16%的CER,在ASDR赛道上取得了21.48%的cpCER,相比挑战基线,ASR方面改进了13.08%,ASDR方面改进了51.4%。
本文介绍音乐分离任务及两个新的基准数据集,比较模型表现并提供排名和数据集下载。作者提出了一种使用不同模型进行集成的新方法,在音乐分离挑战赛中获得最佳结果,代码和技术细节已在GitHub上公开。
火山引擎RTC音频团队在ICASSP 2023会议上发表了4篇论文,涉及特定说话人语音增强、回声消除、多通道语音增强、音质修复等方面,并在ICASSP 2023 AEC Challenge中获得多个奖项。未来,他们将继续研究自适应噪音场景、多类型修复音频信号以及轻量低复杂度模型等挑战。火山引擎RTC致力于提供全球互联网范围内高质量、低延时的实时音视频通信能力,目前已覆盖丰富实时音视频互动场景,热招音频开发工程师和音频资深算法工程师。
完成下面两步后,将自动完成登录并继续当前操作。