2026年6月,AVS工作组在乌鲁木齐召开会议,腾讯音乐提交的神经网络音频编解码器NAC被选为AVS4音频编码标准。NAC在低码率下显著提升音质,解决了传统编码的音质问题,标志着中国音频产业的自主权和技术实力的提升。
文章回忆了作者童年时对电视沙沙声的敏感,认为这是独特的能力。随着年龄增长,听觉和注意力的变化让他怀念那种丰富的感知。儿童的注意力更开放,而成年人则更专注于任务。作者希望在成年后仍能保持对世界的敏感。
文章讨论了香薰蜡烛和香薰灯的优缺点,指出蜡烛需长时间点燃,容易浪费,而香薰灯则能快速释放香气,更加方便。作者还分享了拒接陌生电话和通过听书助眠的个人经验,强调生活的简化与效率。
SonicEdge首席执行官Moti Margalit表示,未来的可穿戴听觉设备将结合音频硬件、传感器和AI,具备理解能力,成为智能伴侣,能够感知和响应环境,实现个性化体验和健康监测。
IndexTTS2是B站语音团队推出的新一代语音合成模型,优化了情感表达和时长控制。该模型通过“时间编码”机制解决了传统模型的时长控制问题,实现了音色与情感的解耦,并支持基于文本的情感调节。IndexTTS2在多项测试中表现优异,推动了零样本语音合成技术的实用化。
Kardome与LG电子合作,将空间听觉AI技术应用于LG智能设备,提升嘈杂环境中的语音识别速度和准确性,推动产品创新。
我研究了优化认知功能和工作效率的听觉工具,发现伽马波频率结合空间特征的白噪声和低音量合成波音乐,显著提升了专注力和工作流,推荐给需要提高认知表现的专业人士。
本研究解决了语言模型在处理需要听觉常识知识的任务时的不足。提出的“想象听觉”方法通过生成模型动态地生成听觉知识,避免了依赖外部音频数据库的问题。实验结果表明,该方法在AuditoryBench上达到了最先进的性能,展示了基于生成的有效性。
本研究探讨了味觉与听觉的关系,提出了一种新型多模态生成模型,能够将味觉信息转化为音乐。实验结果表明,经过微调的生成音乐模型(MusicGEN)更能准确反映味觉描述,展示了人工智能在声音与味觉交互中的潜力。
本研究解决了传统人工神经网络在与人脑区域对齐方面的困难,提出了一种名为脑样听觉网络(BAN)的新模型,该模型结合了四个神经解剖映射区域及递归连接,并引入了一种新的评估标准——脑样听觉分数(BAS)。研究结果表明,BAN在音乐流派分类任务上表现出色,同时其BAS得分高,首次展现了与人脑听觉识别通路的相似性。
本研究针对耳蜗植入设备在真实环境中语音分离效果不佳的问题,提出通过使用空间线索来提升分离质量的方案。核心发现表明,无论是隐式还是显式的空间线索,均能显著改善相近或空间分隔的说话者之间的语音分离效果,尤其在声谱线索模糊时表现尤为明显。这项工作对日常听觉场景中助听设备的改进具有重要影响。
本研究提出了新的深度学习工具包autrainer,旨在克服计算听觉任务训练框架的局限性。该工具包基于PyTorch,支持低代码训练,提升训练效率。
本研究针对视频到音频生成任务中的可控性不足问题,提出了一种新的多模态生成框架VATT。该框架通过引入文本提示,使得音频生成过程更具精确性,并能够根据视频生成音频描述,展现了在性能和用户偏好方面的显著改善,拓展了视频与音频交互的应用潜力。
本文介绍了一种新型基于transformer的框架,用于从EEG信号中提取注意状态,优化特征提取方法。该框架在多个数据集上表现优异,适用于注意力缺陷多动障碍(ADHD)评估和驾驶警觉度检测。研究提出的新模型SDANet和TAnet显著提高了EEG信号分类的准确性,具有广泛的应用潜力。
本研究提出了Quality-Net模型,能够在没有干净参考语音的情况下评估语音质量,实验结果表明其与PESQ高度相关。此外,探讨了大型语言模型在自动语音识别和语音合成中的应用,并提出了改进评估机制以提升自然语言处理模型的性能。
本文介绍了多种语音增强和识别技术,包括Accordion Annealing(ACCAN)和InterAug等新训练方法,旨在提高语音识别系统在嘈杂环境中的鲁棒性。这些方法显著降低了词错误率,改善了语音质量,推动了语音识别技术的发展。
南卡Runner Pro 5是一款专为运动设计的骨传导耳机,具备防水防尘性能和舒适的佩戴感。耳机采用蓝牙5.4技术和第四代響科技,音质清晰细腻。耳机还具备防漏音技术和32G存储空间,可脱离手机使用。南卡的APP功能简洁实用。唯一的缺点是价格稍贵。
本文探讨了Transformer模型在多说话者语音识别中的应用,实验结果显示其相对错误率显著降低。同时,提出了音频-视觉声音分离方案和基于多通道的ASR系统,均取得良好效果。研究还涉及语音分离模型的可转移性及其在低资源环境下的应用,展示了新架构在实时任务中的优势。
通过物理启发嵌入网络和深度学习技术,我们提出了一种创新的多任务学习模型 PEMT-Net,用于增强多任务听觉信号解码性能,从而超越现有方法并为理解大脑处理复杂听觉信息的机制提供新的见解。
基于人类听觉系统的层次化处理,从低级声学特征到高级语义理解的转变,我们引入了一种新的粗到细的音频重建方法。利用非侵入式功能性磁共振成像(fMRI)数据,我们的方法模拟了听觉处理的逆向路径。通过初始使用 CLAP 将 fMRI 数据粗略解码到低维语义空间,然后通过语义特征引导进行精细解码到高维 AudioMAE...
完成下面两步后,将自动完成登录并继续当前操作。