小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
亚马逊Prime Video新AI技术实现口型与配音音频同步

亚马逊Prime Video推出新AI功能,利用AI和视觉特效技术,使演员口型与配音音频同步,提升观影体验。该功能目前仅适用于德语剧《Maxton Hall》的英语配音版,未来将扩展至更多作品。此前,Prime Video已在12部影视作品中试验AI辅助配音。

亚马逊Prime Video新AI技术实现口型与配音音频同步

The Verge The Verge · 2026-09-09T13:00:00Z
海信在IFA 2026展示最新显示、激光和音频创新成果

海信在IFA 2026上以“有爱,科技也动情”为主题,展示了显示、激光和音频领域的创新产品,并荣获多项IFA创新奖。其中,条形音箱UX1获得大奖,116UXS MiniLED电视等产品获得荣誉奖。116UXS采用Chromagic 2.0技术,色域达110% BT.2020,峰值亮度10000尼特,并通过护眼认证。此外,海信全球首发场序显示技术,刷新率最高360Hz,同时展示了UX1音箱及轻量耳机。

海信在IFA 2026展示最新显示、激光和音频创新成果

全球TMT-美通国际 全球TMT-美通国际 · 2026-09-07T07:21:47Z
Shotcut 26.9 视频编辑器 Beta 版带来用户界面改进和更佳的音频质量

Shotcut 26.9 Beta 发布,提升音频质量(避免16位转换,保持32位浮点),优化时间线性能和现代化UI(圆角设计、新徽标)。采用FFmpeg 9.0,修复Linux下VA-API HEVC硬件编码问题。用户可从GitHub下载Linux、macOS和Windows版本。

Shotcut 26.9 视频编辑器 Beta 版带来用户界面改进和更佳的音频质量

实时互动网 实时互动网 · 2026-09-07T02:07:28Z
Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

Gradium AI发布新TTS模型并设为默认,在500句难例测试中人工评分通过率81%,领先Cartesia和ElevenLabs。首音频延迟216毫秒,低且稳定。支持多语言,无需文本归一化即可准确朗读号码和邮箱。基准测试由厂商运行,评估集已开源。

Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

实时互动网 实时互动网 · 2026-09-01T06:35:17Z

探索免费的Epic学习内容,涵盖网络物理、网格体地形等功能,以及项目优化、材质创建等关键工作流程技巧,还有更多内容等你来探索。

<p>八月Epic学习内容精选:网络物理、动态音频等更多内容</p>

Unreal Engine Unreal Engine · 2026-08-28T00:00:00Z

WinAirCast是一款面向Windows用户的低延迟音频串流工具,支持AirPlay 2并兼容AirPlay 1,解决了传统软件高延迟和兼容性问题。它提供设备集中管理、悬浮窗、停靠栏、十段EQ及单应用捕获等功能,定价$2.99,提供15天免费试用,旨在让Windows用户轻松连接HomePod等设备。

让 PC 与 HomePod 互联:音频串流工具 WinAirCast

少数派 少数派 · 2026-08-23T03:00:00Z
低延迟音频播放:AudioUnit vs AudioQueue vs AudioTrack

本文介绍低延迟音频播放方案,对比iOS和Android平台技术。iOS用AudioUnit实现5-10ms延迟,Android用AudioTrack或AAudio达10ms内。核心是绕过系统高级API,使用底层接口、小缓冲区和环形缓冲区。文章提供完整代码示例、延迟诊断工具及常见问题修复方法,帮助开发者选择适合实时通话场景的播放方案。

低延迟音频播放:AudioUnit vs AudioQueue vs AudioTrack

实时互动网 实时互动网 · 2026-08-19T02:50:52Z
【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手【最终版】

该文章介绍了一个全栈AI智能播客平台项目,用户上传音视频后,AI自动完成内容理解、音色设计、语音合成和混音,实现端到端自动化。技术栈包括Vue 3前端、FastAPI后端、LangGraph Agent编排、Qwen-TTS语音合成及多模态模型,并采用AG-UI协议实现流式交互。项目还涵盖音频后期处理、配置管理和资源索引系统,旨在降低使用门槛,提供专业级播客制作体验。

【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手【最终版】

京东科技开发者 京东科技开发者 · 2026-08-18T02:50:29Z
【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(高级篇)

该项目是一个AI驱动的播客创作助手,支持从文字、音频、视频内容识别到播客制作的全流程。本次更新新增了音视频识别能力、临时-永久双层存储架构、定时清理机制和更智能的提示词系统,使播客Agent从单纯的语音合成工具升级为全链路音频内容创作平台。

【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(高级篇)

京东科技开发者 京东科技开发者 · 2026-08-17T03:18:42Z
医生律师必备:YazSes 开源离线听写,音频永不离开你的电脑

YazSes是一款开源离线语音听写工具,支持按住说话、本地转录,音频不离开电脑。它基于faster-whisper模型,CPU即可运行,词错误率低至2.59%,实时因子0.52。支持语音命令、会议录制和说话人分离,跨平台且Linux优先。适合医生、律师等隐私敏感场景,完全免费,安装简单。

医生律师必备:YazSes 开源离线听写,音频永不离开你的电脑

极道 极道 · 2026-08-14T06:50:00Z
【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(进阶篇)

该项目是一个AI音频创作助手,新增播客后期制作功能,包括音频拼接、智能BGM选择和音轨混音,并添加音频资源管理API及语音输入。后端支持交叉淡入淡出、音量归一化,前端通过Web Speech API实现语音转文字,实现从上传、处理到成品的全链路闭环。

【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(进阶篇)

京东科技开发者 京东科技开发者 · 2026-08-14T03:50:25Z
【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(入门篇)

该项目是一个AI驱动的音频内容创作助手,支持通过自然语言生成定制语音、复刻音色及管理本地音频文件。前端使用Vue 3、TypeScript、Tailwind CSS和ai-elements-vue组件库,后端基于FastAPI、LangChain 1.0和LangGraph,通过SSE和AG-UI协议实现流式交互。系统具备多轮对话记忆,并调用阿里云TTS生成音频。文章还分享了开发中遇到的版本兼容和缓冲问题及解决心得。

【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(入门篇)

京东科技开发者 京东科技开发者 · 2026-08-13T09:49:00Z
WebRTC Android 端 + iOS-Android 跨平台音频通话实战

本文介绍用Claude Code开发Android WebRTC封装,实现iOS与Android跨平台1v1通话。重点解决Android端Camera2采集、前后摄切换、EGL上下文、权限及ProGuard等差异,提供Gradle配置、WebRTC客户端、信令协议对齐及完整通话流程,并列出跨平台互通检查清单与性能指标。

WebRTC Android 端 + iOS-Android 跨平台音频通话实战

实时互动网 实时互动网 · 2026-08-10T03:32:48Z
开源FreeSWITCH新模块mod_earshot,通过WebSocket将实时通话音频流式传输到AI代理

mod_earshot 是一个开源模块,通过单个 WebSocket 将实时电话通话桥接到 AI 语音代理,支持全双工通信。它提供多种协议适配器、轮流发言机制、通话控制、PCI/PII 屏蔽、多流工作及高效扩展,适合部署在自有基础设施上。

开源FreeSWITCH新模块mod_earshot,通过WebSocket将实时通话音频流式传输到AI代理

实时互动网 实时互动网 · 2026-08-10T03:11:37Z
swXtch.io 的新应用“无需 IP 音频编解码器硬件”

swXtch.io推出groundSwXtch软件,用于通过标准IP网络(含公共互联网)传输Ravenna、AES67和ST 2110-30等AoIP音频格式,无需编解码器硬件或网络重配置。它保持比特级音质,消除编码延迟和成本,支持PTP时钟同步,并与cloudSwXtch结合构建混合网络。已获广播合作伙伴验证,适用于现场制作、远程活动和分布式音频混合。

swXtch.io 的新应用“无需 IP 音频编解码器硬件”

实时互动网 实时互动网 · 2026-08-10T02:39:47Z
开放媒体联盟推动沉浸式音频发展

开放媒体联盟发布开放音频渲染器OAR v1,为空间音频提供参考实现,补充IAMF规范。它支持扬声器和双耳渲染,适配多种播放系统,并兼容基于声道、场景和对象的音频。OAR旨在简化开发,提升互操作性,同时保留创新灵活性。

开放媒体联盟推动沉浸式音频发展

实时互动网 实时互动网 · 2026-08-07T02:19:11Z
Bose升级版QuietComfort耳机新增头部追踪沉浸式音频

Bose发布第二代QuietComfort降噪耳机,售价359美元,8月8日预售。新增TrueSpatial沉浸式音频和头部追踪,升级ANC自适应降噪,支持蓝牙5.4和USB-C无损连接,续航24小时,提供五种颜色。

Bose升级版QuietComfort耳机新增头部追踪沉浸式音频

The Verge The Verge · 2026-08-06T13:00:00Z
哪些音频平台能触达 Z 世代?

Z世代每天听音频超29小时,广播占广告支持收听46%,播客22%,流媒体31%。音频因真实声音和信任感吸引年轻人,80%视主持人为朋友。iHeartMedia每月触达87%Z世代,通过广播、播客、社交等渠道。音频全天候伴随生活,提升品牌认知和购买意愿,是连接碎片化媒体的有效方式。

哪些音频平台能触达 Z 世代?

实时互动网 实时互动网 · 2026-08-05T08:54:41Z
对讲方案选型、硬件链路、音频引擎、RTP/WebRTC,到弱网、AEC 与量产测试的完整技术拆解

本文系统阐述嵌入式音频对讲的产品级实现方案,涵盖半双工/全双工、局域网/公网等需求选型,推荐“独立音频引擎+可替换协议层”架构。核心涉及ALSA硬件层、AEC/NS/AGC算法、Opus编码、RTP/Jitter Buffer及WebRTC/SIP协议,强调声学结构、时钟同步、弱网恢复和诊断测试,并给出分阶段实施路线与验收清单。

对讲方案选型、硬件链路、音频引擎、RTP/WebRTC,到弱网、AEC 与量产测试的完整技术拆解

实时互动网 实时互动网 · 2026-08-04T03:47:17Z
WebRTC Android 端 + iOS-Android 跨平台音频通话实战

本文介绍用Claude Code开发Android WebRTC封装,实现iOS与Android 1v1通话。内容涵盖Android端摄像头采集、权限、EGL等特殊处理,提供WebRTC客户端、信令客户端及完整通话流程代码,并列出跨平台协议对齐清单,确保双端互通。

WebRTC Android 端 + iOS-Android 跨平台音频通话实战

实时互动网 实时互动网 · 2026-08-03T03:11:05Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码