小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
全栈 AI Agent 从 0 到 1 :智能播客平台开发全记录

这是一个端到端智能播客制作平台,用户上传音视频后,AI自动完成内容理解、音色设计、语音合成和混音。项目采用Vue 3、FastAPI、LangGraph等技术,通过SSE和AG-UI协议实现流式通信,并集成多模态识别、音频处理工具及临时文件清理机制,实现全流程自动化。

全栈 AI Agent 从 0 到 1 :智能播客平台开发全记录

实时互动网 实时互动网 · 2026-08-26T06:30:05Z
Cartesia 发布 Sonic-3.6:一款流媒体 TTS 模型,登顶 Artificial Analysis 语音竞技场

Cartesia发布Sonic-3.6文本转语音模型,在Artificial Analysis两个语音排行榜均居首,自然度提升显著。该模型基于状态空间模型,时延低于90毫秒,支持即时声音克隆、自定义发音等,以Beta版托管API提供,定价每百万字符49美元,不开放自托管权重。

Cartesia 发布 Sonic-3.6:一款流媒体 TTS 模型,登顶 Artificial Analysis 语音竞技场

实时互动网 实时互动网 · 2026-08-19T02:30:03Z
【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手【最终版】

该文章介绍了一个全栈AI智能播客平台项目,用户上传音视频后,AI自动完成内容理解、音色设计、语音合成和混音,实现端到端自动化。技术栈包括Vue 3前端、FastAPI后端、LangGraph Agent编排、Qwen-TTS语音合成及多模态模型,并采用AG-UI协议实现流式交互。项目还涵盖音频后期处理、配置管理和资源索引系统,旨在降低使用门槛,提供专业级播客制作体验。

【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手【最终版】

京东科技开发者 京东科技开发者 · 2026-08-18T02:50:29Z
IndexTTS 2.5 让声音跨越语言

B站发布IndexTTS 2.5语音合成模型,支持中英日西阿五语种零样本配音,推理速度提升2.28倍,并增强跨语言情绪还原与语速控制。团队通过降低语义帧率、换用Zipformer架构及GRPO强化学习优化性能,在情感迁移和说话人相似度上表现优异,旨在让创作者用任意声音、语言和情绪进行配音。

IndexTTS 2.5 让声音跨越语言

实时互动网 实时互动网 · 2026-08-17T07:32:30Z
【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(入门篇)

该项目是一个AI驱动的音频内容创作助手,支持通过自然语言生成定制语音、复刻音色及管理本地音频文件。前端使用Vue 3、TypeScript、Tailwind CSS和ai-elements-vue组件库,后端基于FastAPI、LangChain 1.0和LangGraph,通过SSE和AG-UI协议实现流式交互。系统具备多轮对话记忆,并调用阿里云TTS生成音频。文章还分享了开发中遇到的版本兼容和缓冲问题及解决心得。

【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(入门篇)

京东科技开发者 京东科技开发者 · 2026-08-13T09:49:00Z
阿里推出国内首个AI语音平台CosyVoice Studio,将语义理解融入语音能力

阿里巴巴推出国内首个一站式AI语音生产力平台CosyVoice Studio,基于自研语音模型Qwen-Audio,在语音识别、实时交互和语音合成上获全球第一。平台提供语音键盘、音频内容创作和语音智能体三大功能,支持口语整理、多语言翻译、声音复刻等,满足企业、开发者和个人用户的AI语音需求。

阿里推出国内首个AI语音平台CosyVoice Studio,将语义理解融入语音能力

量子位 量子位 · 2026-08-07T07:43:06Z
缓解 TTS 的重复与漏读:用注意力引导消除语音合成中的稳定性幻觉

论文针对基于大语言模型的语音合成在复杂文本上出现的重复、漏读等稳定性幻觉问题,提出通过注意力引导进行优化。作者从CosyVoice 2的自注意力中发现对齐注意力头,提出最优对齐分数(OAS)评估对齐质量,并据此强化前向注意力约束;同时利用伪对齐路径构建位置思维链,通过稀疏文本Token和进度条预测显式告知模型合成位置。实验表明,该方法在困难文本上词错误率相对下降约35%,且不损害自然度和说话人相似度。

缓解 TTS 的重复与漏读:用注意力引导消除语音合成中的稳定性幻觉

实时互动网 实时互动网 · 2026-07-28T07:21:37Z
AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,支持细粒度标签控制、20种方言和16种语言,覆盖多语种场景。模型分Flash和Plus版本,在权威榜单夺冠,具备高鲁棒性和48kHz高质量输出,适用于实时交互和严肃创作,已开放调用。

AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

量子位 量子位 · 2026-07-20T09:05:06Z
emoji 也能控制语音生成?Irodori-TTS 基于 RF-DiT 架构的日语 TTS;Eczema and Tinea Skin Disease 数据集:支持医学图像分类与迁移学习

Irodori-TTS是由开发者Aratako于2026年发布的日语语音合成项目,具有高保真音质和零样本声音克隆能力。核心模型Irodori-TTS-500M-v3支持48 kHz专业音频输出,用户只需提供3-10秒的参考音频即可精准复刻目标音色,并通过Emoji注释调节情绪和语调。

emoji 也能控制语音生成?Irodori-TTS 基于 RF-DiT 架构的日语 TTS;Eczema and Tinea Skin Disease 数据集:支持医学图像分类与迁移学习

HyperAI超神经 HyperAI超神经 · 2026-07-03T09:07:54Z
【论文解读】BareWave:扔掉声码器,让 AI 语音复刻“一步到位”

BareWave是一种全波形原生的零样本语音合成技术,能够直接从文本和参考音频生成目标说话人的波形,无需中间声学表示或独立声码器。实验结果表明,其在内容清晰度和说话人相似度上表现优异,开辟了新的语音合成方向。

【论文解读】BareWave:扔掉声码器,让 AI 语音复刻“一步到位”

实时互动网 实时互动网 · 2026-07-02T03:30:21Z
什么是AI语音开发?从技术链路到落地场景的完整拆解

AI语音开发是构建实时语音交互系统的过程,涉及语音识别、语言模型和语音合成等技术。核心链路包括用户语音输入、ASR识别、LLM理解与生成、TTS合成和实时传输。开发的难点在于降低端到端延迟,确保对话流畅。可选择全自研或使用一体化平台,以适应不同场景需求。评估方案时需关注延迟、准确率、灵活性和成本等维度。

什么是AI语音开发?从技术链路到落地场景的完整拆解

实时互动网 实时互动网 · 2026-06-11T06:57:24Z
什么是AI实时语音技术?如何理解AI实时语音技术

AI实时语音技术通过语音识别、语义理解、语音合成和实时传输实现自然对话,核心在于毫秒级响应。与传统技术相比,AI实时语音不仅理解字面意思,还能捕捉情绪,提升交流质量。未来,随着技术进步,AI语音系统将更加人性化,但仍需长期投入和精细化开发。

什么是AI实时语音技术?如何理解AI实时语音技术

实时互动网 实时互动网 · 2026-06-08T08:18:43Z
什么是 AI 对话开发?AI 对话开发有什么用途?(2026 完整指南)

AI对话开发结合语音识别、大语言模型和语音合成,能够与用户自然交流,广泛应用于智能客服、AI陪伴和在线教育等领域。与传统聊天机器人不同,AI对话能够理解上下文和处理开放式问题。核心技术包括ASR、LLM、TTS和RTC,语音对话对延迟要求更高。建议从智能客服入手,采用一体化方案以降低工程复杂度。

什么是 AI 对话开发?AI 对话开发有什么用途?(2026 完整指南)

实时互动网 实时互动网 · 2026-06-04T08:24:17Z
MiMo-V2.5-TTS-Series + ASR 正式发布

MiMo-V2.5系列语音模型实现了从简单听读到精准理解与灵活表达的转变,支持语音识别与合成,能够在复杂场景中高效交互。该模型根据自然语言指令生成多样音色,提升语音表达的情感与细腻度,尤其在多种语言和噪音环境中表现优异,确保准确转写,推动语音技术的发展。

MiMo-V2.5-TTS-Series + ASR 正式发布

小米云技术 小米云技术 · 2026-04-23T18:01:46Z
2026年4月本周GitHub上最火9个开源项目,帮你省掉每月1500美元的AI工具订阅费

本周GitHub上出现了10个热门开源项目,这些项目能够替代高价AI工具,帮助用户每月节省高达1500美元。项目涵盖编程课程、上下文记忆和语音合成等,累计获得超过17万颗星标,反映出开发者对昂贵订阅费用的抵制。

2026年4月本周GitHub上最火9个开源项目,帮你省掉每月1500美元的AI工具订阅费

极道 极道 · 2026-04-17T12:28:00Z
微软一口气发布3个AI模型:能听、会说、还能画,实测后我有点意外

微软于4月2日发布了三款新模型:MAI-Transcribe-1、MAI-Voice-1和MAI-Image-2。MAI-Image-2在图像生成方面表现优异,适合设计与创意;MAI-Transcribe-1在嘈杂环境中稳定,适合会议与客服;MAI-Voice-1提供自然语音合成,情绪可控。这些模型在稳定性和实用性上有所提升。

微软一口气发布3个AI模型:能听、会说、还能画,实测后我有点意外

dotNET跨平台 dotNET跨平台 · 2026-04-05T23:56:36Z

研究发现,Qwen的语音合成技术中,跨句合成的音色稳定性只能通过语音克隆实现。虽然可以通过语气指令调节音色,但无法确保跨句一致性。使用seed参数仅能在同一句话中保持一致。最终,通过生成wav文件并转换为pt文件,实现了稳定的音色,并可进行二次语气控制,效果令人满意。希望这些经验能帮助其他AI研究者。

Qwen TTS 跨句音色稳定输出技术的研究

Andy Stewart Andy Stewart · 2026-03-26T16:00:00Z

在小龙虾的语音合成研发中,最初采用“前面流式,后面预取”的方案效果最佳。尝试全流式生成导致不稳定,体验差。最终认识到,AI方案已是最优解,强调承认已有方案的重要性。

分享一下我开发小龙虾流式语音的过程

Andy Stewart Andy Stewart · 2026-03-24T16:00:00Z
有字幕,没配音?用浏览器自带语音能力,让网页视频直接“开口说话”

本文介绍如何利用浏览器的语音合成功能为网页视频添加配音,提升用户体验。通过简单代码实现“字幕转语音”,用户可享受更生动的视频内容。Edge浏览器支持多种语言和声音选择,操作简便,适合快速验证想法。

有字幕,没配音?用浏览器自带语音能力,让网页视频直接“开口说话”

dotNET跨平台 dotNET跨平台 · 2026-03-24T00:01:12Z
在线教程丨基于500万小时语音数据,Qwen3-TTS实现3秒语音克隆及精细调控

生成式AI的语音合成技术不断进步,Qwen3-TTS模型支持多语言、语音克隆和细粒度控制,已在HyperAI官网上线,用户可体验3秒语音克隆。

在线教程丨基于500万小时语音数据,Qwen3-TTS实现3秒语音克隆及精细调控

HyperAI超神经 HyperAI超神经 · 2026-03-03T05:52:33Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码