小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
Arxiv | MagiCodec:高斯噪声注入与多阶段训练实现高保真可建模音频编码

本文介绍了MagiCodec,一种高性能的单层流式音频编解码器。通过高斯噪声注入和三阶段训练,MagiCodec在保持高保真重建的同时,提升了token的语义可建模性。实验结果表明,其在重建质量和下游任务上均超越现有技术,且token分布符合齐普夫定律,适合音频语言模型。

Arxiv | MagiCodec:高斯噪声注入与多阶段训练实现高保真可建模音频编码

实时互动网
实时互动网 · 2026-06-29T08:42:28Z
音频编解码器市场预计到2033年将达到120亿美元,年复合增长率达6.4%

全球音频编解码器市场正快速增长,预计到2026年将达到78亿美元,2033年约120亿美元,年均增长率为6.4%。主要驱动力包括5G普及和无线音频技术进步。北美市场占主导地位,亚太地区增长最快,音频编解码器广泛应用于流媒体、汽车和可穿戴设备,低功耗和高效压缩技术成为关键。

音频编解码器市场预计到2033年将达到120亿美元,年复合增长率达6.4%

实时互动网
实时互动网 · 2026-05-12T06:24:13Z
基于 Pipecat 的 Asterisk PBX websocket 传输发布

Pipecat 的 Asterisk PBX websocket 传输基于 FastAPI websockets 实现,已在 PyPI 发布。它支持多种音频编解码器,自动检测采样率和信令协议,并具备流量控制功能。项目提供 Asterisk 集成和帧序列化器,便于用户连接 Asterisk 与 Pipecat 管道。安装可通过 pip 完成,示例展示了如何将 Asterisk WebSocket 传输集成到 Pipecat 管道中。

基于 Pipecat 的 Asterisk PBX websocket 传输发布

实时互动网
实时互动网 · 2026-05-12T02:06:10Z
SpecTokenizer:压缩频谱域的轻量级流式编解码器

本文介绍了SpecTokenizer,一种轻量级流式神经音频编解码器,采用压缩谱域建模,显著降低计算量和参数规模。实验结果表明,其在低码率下优于现有模型,适合资源受限环境,具备良好的泛化能力和高效的部署潜力。

SpecTokenizer:压缩频谱域的轻量级流式编解码器

实时互动网
实时互动网 · 2026-02-06T02:51:20Z
VLC 3.0.23 媒体播放器改进了 Qt GUI 中的深色调色板,编解码器信息

VLC 3.0.23 发布,支持多平台,改进音频编解码器和界面,修复多个错误和安全问题。开发者正在为2026年发布的VLC 4.0 做准备,带来新功能和界面。

VLC 3.0.23 媒体播放器改进了 Qt GUI 中的深色调色板,编解码器信息

实时互动网
实时互动网 · 2026-01-04T02:50:06Z
FlexiCodec:3-12.5Hz超低帧率动态音频编解码器

FlexiCodec是一种新型音频编解码器,支持低于10Hz的超低帧率,旨在提高语义信息的保留。通过动态帧率、ASR引导的语义和可控帧率,FlexiCodec在音频质量和处理速度上表现优异,适用于多种应用场景。

FlexiCodec:3-12.5Hz超低帧率动态音频编解码器

实时互动网
实时互动网 · 2025-10-20T03:36:13Z
ERVQ: 基于内外码本优化的增强残差矢量量化神经音频编解码器 | TASLP2025

本文提出了一种增强的残差矢量量化(ERVQ)方法,通过优化码本内外来解决码本崩溃问题,从而提升神经音频编解码器的性能。实验结果表明,ERVQ在多种模型和比特率下显著提高了音频质量和泛化能力。

ERVQ: 基于内外码本优化的增强残差矢量量化神经音频编解码器 | TASLP2025

实时互动网
实时互动网 · 2025-09-08T06:26:40Z
NAB 2025 回顾:人工智能与音频的结合成为可能

在NAB 2025上,人工智能成为焦点。Telos Alliance展示了其音频自动化平台的新AI功能,旨在提升音频清晰度。Lawo和Riedel等公司展示了AI在广播中的应用,强调基础设施管理和工作流程优化。RTS推出了多语言无线对讲机,Audinate研究数据预测设备故障。MPEG-H音频编解码器展示了音频分离的新功能。

NAB 2025 回顾:人工智能与音频的结合成为可能

实时互动网
实时互动网 · 2025-04-15T02:13:56Z

本文介绍了一种新型音频编解码器及其在语音合成中的应用,提出了自监督学习、源解耦技术和低帧率编解码器等多种改进方法,显著提升了语音合成的可懂性和效率,解决了传统模型的不足。

对神经编解码再合成的深入研究:缩小编解码与波形生成之间的差距

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-10-29T00:00:00Z
Etere 推出 EA6784 高级音频编解码器

Etere发布了EA6784高级音频编解码器,支持AAC格式,特别是HE-AAC和HE-AAC v2,适用于流媒体和数字广播。该编解码器在音频质量与压缩效率之间取得平衡,支持多种采样率。自1987年成立以来,Etere致力于提供灵活可靠的广播和媒体软件解决方案。

Etere 推出 EA6784 高级音频编解码器

实时互动网
实时互动网 · 2024-10-28T03:56:17Z

本研究提出了一种通用的循环神经网络压缩技术,能够将LSTM声学模型减小至原来的三分之一,同时保持准确性。研究还探讨了基于深度神经网络的音频编解码器和非线性压缩方法,展示了在多个音频领域的优越性能。比较不同模型在音频效果模拟中的表现,发现LSTM在失真和均衡器方面表现最佳,而State Space模型在饱和和压缩方面更具优势。

利用选择性状态空间模型对光学压缩器的时变响应进行建模

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-08-22T00:00:00Z
MLow:Meta推出适用于低端设备的音频编解码器

Meta最近发布了Meta Low Bitrate (MLow)音频编解码器,旨在提供高效、高质量的音频流媒体,适用于低带宽条件下的实时通信。该编解码器在保持较低计算复杂度的同时,实现了Opus的两倍音质。MLow设计轻巧,适用于移动设备和资源受限平台,减少网络拥塞和延迟。

MLow:Meta推出适用于低端设备的音频编解码器

InfoQ
InfoQ · 2024-08-10T05:21:00Z
MLow:Meta的低比特率音频编解码器

Meta推出了新的低比特率音频编解码器MLow,旨在改善低速网络下的音频质量。与Opus相比,MLow在6kbps时音质提升一倍,同时计算复杂度降低10%。该编解码器已在Instagram和Messenger上全面上线,并正在WhatsApp推广,显著提升了用户体验。MLow支持更有效的前向纠错,确保在网络丢包情况下音质更佳。

MLow:Meta的低比特率音频编解码器

Engineering at Meta
Engineering at Meta · 2024-06-13T14:45:58Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码