小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

SafaOS:两年自制 Rust 操作系统补齐 GUI、音频与 SDL2 移植链路 SafaOS 是一个从零开始、主要用 Rust 编写的业余操作系统项目。作者在最新进展里说,这一轮已经补上了 UDP 网络、GUI、基于 Intel HDA 的音频支持,以及音频服务器;同时完成了 SDL2、SDL2_mixer 的移植,并把自己的 libc 重写成了 Rust...

【Rust日报】2026-07-30 SafaOS:两年自制 Rust 操作系统补齐 GUI、音频与 SDL2 移植链路

Rust.cc
Rust.cc · 2026-07-30T01:07:59Z
Riffusion 上传参考音频 API 对接说明

Riffusion 允许我们上传参考音频进行二次创作,本文档讲解相关 API 的对接方法。 该 API 只有一个输入参数,就是 audio_url,它是一个可以公开访问的 CDN 地址,支持 mp3 后缀。 这里我们输入

Riffusion 上传参考音频 API 对接说明

静觅
静觅 · 2026-07-28T21:01:27Z
Producer 上传参考音频 API 对接说明

Producer 允许我们上传参考音频进行二次创作,本文档讲解相关 API 的对接方法。 该 API 只有一个输入参数,就是 audio_url,它是一个可以公开访问的 CDN 地址,支持 mp3 后缀。 这里我们输入的

Producer 上传参考音频 API 对接说明

静觅
静觅 · 2026-07-28T05:52:39Z
亚马逊广告通过与 News UK 的合作拓展音频服务

亚马逊广告(Amazon Ads)和 Octave 宣布了一项程序化整合计划,使得 News UK 旗下的数字音频品牌,包括 talkSPORT、Virgin Radio UK、T...

亚马逊广告通过与 News UK 的合作拓展音频服务

实时互动网
实时互动网 · 2026-07-27T02:33:08Z
Black Forest Labs发布FLUX 3:用于图像、视频、音频和机器人动作预测的多模态流模型

Black Forest Labs (BFL) 发布了FLUX 3,这是一个多模态基础模型,可在单一架构内学习图像、视频和音频。它也是首个仅使用一组权重即可实现视频、音频和动作预测...

Black Forest Labs发布FLUX 3:用于图像、视频、音频和机器人动作预测的多模态流模型

实时互动网
实时互动网 · 2026-07-27T02:15:48Z
以人为本的设备与始终在线的边缘 AI 音频的兴起

语音功能已正式突破智能音箱的局限。随着 AI 更深入地融入日常电子产品,音频已成为人机之间主要的、直接的交互界面。如今的消费者和企业用户期望设备能够自然地响应语音指令,即时适应复杂...

以人为本的设备与始终在线的边缘 AI 音频的兴起

实时互动网
实时互动网 · 2026-07-24T06:45:03Z
预测:游戏音频市场有望增长

根据Futuresource Consulting的研究,预计到2025年,全球游戏音频市场出货量将达到4270万台,2030年将增至5280万台。无线连接技术推动市场增长,游戏玩家对音频体验的需求不断提升。游戏音箱的重要性也在增加,预计到2030年出货量将达到57万台。《侠盗猎车手VI》的发布将刺激新一轮的升级潮。

预测:游戏音频市场有望增长

实时互动网
实时互动网 · 2026-07-15T03:22:57Z
STAR-VAE:让音频潜在空间「按信息重要性」排列,重建与生成双双达到 SOTA

阿里团队的研究STAR-VAE在音频生成领域取得突破,提出了一种新型正则化策略,解决了音频VAE的“率-失真-规整度不可能三角”问题。该方法通过结构化拓扑感知正则化,优化潜在空间,提高了音频重建和文本生成音频的质量,刷新了当前最优结果。

STAR-VAE:让音频潜在空间「按信息重要性」排列,重建与生成双双达到 SOTA

实时互动网
实时互动网 · 2026-07-14T03:14:00Z
KDE Plasma 6.8 为 Spectacle 中的屏幕录制功能带来原生音频

KDE 在 Plasma 6.8 中为屏幕录制工具 Spectacle 添加了音频录制功能,用户可以选择麦克风或系统音频。这一更新满足了内容创作者的需求,并移除了对 OpenCV 的依赖,优化了性能。此外,Plasma 6.8 还朝向完全基于 Wayland 的未来发展,预计将在秋冬发布。

KDE Plasma 6.8 为 Spectacle 中的屏幕录制功能带来原生音频

实时互动网
实时互动网 · 2026-07-13T03:14:50Z
OpenCode 对接 Seedance MCP

Seedance MCP 是一款短视频制作工具,能够快速生成带音频的成片,适合社交媒体使用。用户需获取 Ace Data Cloud API Token,并在 OpenCode 中配置。该工具支持文本和图片生成视频,简化了视频制作流程。

OpenCode 对接 Seedance MCP

静觅
静觅 · 2026-07-12T20:25:44Z
Hydaway 推出实时企业级音频深度伪造检测技术

Hydaway Digital Corp.在其RealityChek平台推出流媒体音频检测功能,能够实时识别合成或篡改的音频,适用于实时电话和呼叫中心等场景,帮助企业在欺诈发生前进行检测,提升安全性。该系统通过分析频谱模式和韵律标记等特征,实时评估音频的真实性,符合Hydaway推动实时信任决策的战略目标。

Hydaway 推出实时企业级音频深度伪造检测技术

实时互动网
实时互动网 · 2026-07-10T02:48:03Z
NVIDIA 发布 Audex (Nemotron-Labs-Audex-30B-A3B):一种统一的音频-文本大语言模型

NVIDIA 发布了 Audex,这是一个统一的音频-文本大型语言模型,具备理解和生成音频及语音的能力,同时保持文本智能。Audex 采用 30 亿参数的 MoE 结构,设计简洁,避免了多模态模型的性能退化,在文本和音频任务中表现优异,尤其在语音识别领域领先。尽管存在商业许可限制和音频理解能力不足等缺点,Audex 仍在多项任务中表现出色。

NVIDIA 发布 Audex (Nemotron-Labs-Audex-30B-A3B):一种统一的音频-文本大语言模型

实时互动网
实时互动网 · 2026-07-08T02:20:40Z
基于长音频编码的分段注意力解码

本文讨论了基于注意力的编码解码模型(AED)与长音频编码的兼容性问题,并提出了四项改进措施以提高模型在长段落解码中的准确性。这些措施包括引入绝对位置编码、扩展音频上下文训练、段落拼接和语义分割,从而缩小了连续与分段音频编码之间的准确性差距。

基于长音频编码的分段注意力解码

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-06T00:00:00Z
新的Mux Robots工作流程:更好的字幕、音频配音和洞察

Mux Robots推出六个新工作流程,包括生成高质量字幕、音频翻译、最佳缩略图选择和观众参与分析。这些功能通过API调用实现,用户可以编辑现有字幕、分段视频场景,并获取详细的参与数据。所有工作流程均可通过Mux仪表板使用,定价基于资产时长和复杂性。

新的Mux Robots工作流程:更好的字幕、音频配音和洞察

Mux Blog - Video technology and more
Mux Blog - Video technology and more · 2026-07-01T18:08:04Z
Arxiv | MagiCodec:高斯噪声注入与多阶段训练实现高保真可建模音频编码

本文介绍了MagiCodec,一种高性能的单层流式音频编解码器。通过高斯噪声注入和三阶段训练,MagiCodec在保持高保真重建的同时,提升了token的语义可建模性。实验结果表明,其在重建质量和下游任务上均超越现有技术,且token分布符合齐普夫定律,适合音频语言模型。

Arxiv | MagiCodec:高斯噪声注入与多阶段训练实现高保真可建模音频编码

实时互动网
实时互动网 · 2026-06-29T08:42:28Z
在AI Gateway上构建实时语音代理

AI Gateway现已支持音频和语音功能,包括实时语音、文本转语音和语音转文本。用户可以通过AI SDK 7使用这些功能,确保安全和便捷。

在AI Gateway上构建实时语音代理

Vercel News
Vercel News · 2026-06-29T07:00:00Z
AI Gateway 现已支持实时语音、语音生成和音频转录

AI Gateway现已支持语音和音频模型,用户可以实时构建语音代理、将文本转换为语音以及进行音频转录。这些功能在测试阶段,提供与文本、图像和视频模型相同的可观察性和费用控制,用户可通过AI SDK 7实现低延迟的实时对话。

AI Gateway 现已支持实时语音、语音生成和音频转录

Vercel News
Vercel News · 2026-06-29T00:00:00Z
xAI Grok音频模型现已在Vercel AI Gateway上线

xAI的音频模型已在AI Gateway上线,提供实时语音、文本转语音和语音转文本功能。用户可通过AI SDK 7版本安全访问这些功能,开发者可使用示例代码快速集成,体验实时语音交互。

xAI Grok音频模型现已在Vercel AI Gateway上线

Vercel News
Vercel News · 2026-06-29T00:00:00Z
Teenage Engineering为其KO II采样器新增低保真模式、USB音频等功能

Teenage Engineering为EP-133 KO II采样器推出了OS 2.5更新,新增USB音频、可选采样率、样本反转和音序器等功能,最大采样时长从20秒延长至40秒。新功能使采样和循环重组更便捷,特别是32kHz和26kHz的低保真模式,增添了独特音色。该更新同样适用于Riddim。

Teenage Engineering为其KO II采样器新增低保真模式、USB音频等功能

The Verge
The Verge · 2026-06-27T21:20:32Z
连麦场景下的音频处理最佳实践

连麦直播中,回声消除(AEC)、降噪(ANS)和自动增益控制(AGC)是提升音频质量的关键技术。AEC需根据硬件场景调整,ANS需平衡语音自然度与环境噪音,AGC确保音量一致。合理配置这些技术可改善连麦体验,避免回声和音质损失。

连麦场景下的音频处理最佳实践

实时互动网
实时互动网 · 2026-06-27T04:41:20Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码