小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

Gradium AI发布新TTS模型并设为默认,在500句难例测试中人工评分通过率81%,领先Cartesia和ElevenLabs。首音频延迟216毫秒,低且稳定。支持多语言,无需文本归一化即可准确朗读号码和邮箱。基准测试由厂商运行,评估集已开源。

Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

实时互动网 实时互动网 · 2026-09-01T06:35:17Z
VoxCPM:无需分词的开源 TTS 系统

VoxCPM是开源TTS系统,无需分词即可实时克隆人声,在连续空间建模语音,保留呼吸声等细节。基于MiniCPM-4,采用扩散自回归架构,分文本语义和残差声学两模型,支持上下文感知韵律和零样本克隆(3-10秒音频),可流式合成及微调。

VoxCPM:无需分词的开源 TTS 系统

实时互动网 实时互动网 · 2026-08-31T02:42:24Z
Cartesia 发布 Sonic-3.6:一款流媒体 TTS 模型,登顶 Artificial Analysis 语音竞技场

Cartesia发布Sonic-3.6文本转语音模型,在Artificial Analysis两个语音排行榜均居首,自然度提升显著。该模型基于状态空间模型,时延低于90毫秒,支持即时声音克隆、自定义发音等,以Beta版托管API提供,定价每百万字符49美元,不开放自托管权重。

Cartesia 发布 Sonic-3.6:一款流媒体 TTS 模型,登顶 Artificial Analysis 语音竞技场

实时互动网 实时互动网 · 2026-08-19T02:30:03Z
【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(入门篇)

该项目是一个AI驱动的音频内容创作助手,支持通过自然语言生成定制语音、复刻音色及管理本地音频文件。前端使用Vue 3、TypeScript、Tailwind CSS和ai-elements-vue组件库,后端基于FastAPI、LangChain 1.0和LangGraph,通过SSE和AG-UI协议实现流式交互。系统具备多轮对话记忆,并调用阿里云TTS生成音频。文章还分享了开发中遇到的版本兼容和缓冲问题及解决心得。

【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(入门篇)

京东科技开发者 京东科技开发者 · 2026-08-13T09:49:00Z
缓解 TTS 的重复与漏读:用注意力引导消除语音合成中的稳定性幻觉

论文针对基于大语言模型的语音合成在复杂文本上出现的重复、漏读等稳定性幻觉问题,提出通过注意力引导进行优化。作者从CosyVoice 2的自注意力中发现对齐注意力头,提出最优对齐分数(OAS)评估对齐质量,并据此强化前向注意力约束;同时利用伪对齐路径构建位置思维链,通过稀疏文本Token和进度条预测显式告知模型合成位置。实验表明,该方法在困难文本上词错误率相对下降约35%,且不损害自然度和说话人相似度。

缓解 TTS 的重复与漏读:用注意力引导消除语音合成中的稳定性幻觉

实时互动网 实时互动网 · 2026-07-28T07:21:37Z
从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布

Qwen发布Qwen-Audio-3.0-TTS实时语音合成模型,提供Flash和Plus版本,支持16种语言和20种方言,具备自然语言指令控制、细粒度标签控制及复杂声学鲁棒性。Plus版在权威榜单夺冠,并推出精品音色库,支持48K音频输出。

从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布

实时互动网 实时互动网 · 2026-07-20T09:22:03Z
AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,支持细粒度标签控制、20种方言和16种语言,覆盖多语种场景。模型分Flash和Plus版本,在权威榜单夺冠,具备高鲁棒性和48kHz高质量输出,适用于实时交互和严肃创作,已开放调用。

AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

量子位 量子位 · 2026-07-20T09:05:06Z
emoji 也能控制语音生成?Irodori-TTS 基于 RF-DiT 架构的日语 TTS;Eczema and Tinea Skin Disease 数据集:支持医学图像分类与迁移学习

Irodori-TTS是由开发者Aratako于2026年发布的日语语音合成项目,具有高保真音质和零样本声音克隆能力。核心模型Irodori-TTS-500M-v3支持48 kHz专业音频输出,用户只需提供3-10秒的参考音频即可精准复刻目标音色,并通过Emoji注释调节情绪和语调。

emoji 也能控制语音生成?Irodori-TTS 基于 RF-DiT 架构的日语 TTS;Eczema and Tinea Skin Disease 数据集:支持医学图像分类与迁移学习

HyperAI超神经 HyperAI超神经 · 2026-07-03T09:07:54Z
Fish TTS API 对接说明

Fish TTS API 是基于 Fish Audio 官方 TTS API 的接口,使用时需申请 API Token。请求格式为 POST,支持文本合成和音频格式选择(mp3 或 pcm)。可通过异步回调获取长文本合成结果,错误处理包括鉴权失败和参数错误。

Fish TTS API 对接说明

静觅 静觅 · 2026-06-19T21:16:18Z
AI 语音聊天机器人背后是怎么实现的,是 ASR + LLM + TTS 串起来吗,延迟怎么压下去

AI语音聊天机器人的实现依赖多个模块的协同,关键在于整体架构、流式串联、并行与预测、传输与端侧优化。通过优化各环节,端到端延迟可降低至700~900毫秒,接近真人对话速度。团队应明确延迟目标,利用成熟技术平台降低工程门槛,专注于对话逻辑创新。未来,随着技术进步,延迟有望进一步降低。

AI 语音聊天机器人背后是怎么实现的,是 ASR + LLM + TTS 串起来吗,延迟怎么压下去

实时互动网 实时互动网 · 2026-06-12T07:33:39Z
如何训练AI语音开发模型?从数据准备到三层优化的实操路径

训练AI语音模型的关键在于优化而非从头训练。训练分为三层:ASR领域适配、LLM场景优化和TTS音色优化。ASR通过热词定制和选择合适模型提升准确率;LLM可通过提示工程、RAG和微调进行优化;TTS需选择合适音色和情感配置。建议先进行轻量优化,再考虑重型训练,以提高效率和效果。

如何训练AI语音开发模型?从数据准备到三层优化的实操路径

实时互动网 实时互动网 · 2026-06-11T07:18:17Z
哪些AI语音开发平台收费低?了解最省钱的选型组合

选择AI语音平台时需考虑四层成本:ASR识别费、LLM推理费、TTS合成费和RTC传输费。不同场景下最佳组合不同。通过选择合适模型、利用免费额度、优化TTS合成和精简上下文等方式可降低费用。综合考虑各项成本,才能找到真正的低收费方案。

哪些AI语音开发平台收费低?了解最省钱的选型组合

实时互动网 实时互动网 · 2026-06-11T07:05:48Z
Free CPU教程丨狂揽8.8k stars,TTS模型Supertonic-3参数规模仅约99M,支持31种语言

随着生成式AI向多模态发展,Supertone团队推出的Supertonic-3模型支持31种语言,具备实时语音合成能力,参数仅为9900万。该模型可在CPU环境中运行,无需云API,适合开发本地AI助手和语音播报系统。

Free CPU教程丨狂揽8.8k stars,TTS模型Supertonic-3参数规模仅约99M,支持31种语言

HyperAI超神经 HyperAI超神经 · 2026-05-20T10:55:40Z
阶跃最新语音模型位列 Artificial Analysis 评测榜中国第一

阶跃语音生成模型StepAudio 2.5 TTS在全球TTS评测中排名第三,展现出自然的语音表达能力,适用于客户服务和知识分享等场景。阶跃还推出了StepAudio 2.5系列模型,涵盖语音生成、识别和实时交互,强调“有温度”的AI体验,已在多个核心场景实现商业化落地。

阶跃最新语音模型位列 Artificial Analysis 评测榜中国第一

量子位 量子位 · 2026-05-09T10:29:31Z
超600种语言,一个模型全搞定! 小米开源 OmniVoice 多语言语音克隆 TTS

小米AI实验室推出的OmniVoice是一款支持646种语言的语音克隆TTS模型,具备简洁架构和卓越性能。该模型通过开源数据训练,能够高质量合成低资源小语种,解决了多语言合成的行业痛点。此外,OmniVoice还提供自定义音色、噪声过滤和发音纠正等功能,推动了多语言TTS的研发。

超600种语言,一个模型全搞定! 小米开源 OmniVoice 多语言语音克隆 TTS

小米云技术 小米云技术 · 2026-05-07T09:00:46Z

Voxtral TTS是Mistral AI推出的开源文本转语音模型,支持九种语言,能够在三秒音频基础上克隆声音,具有70毫秒的低延迟和9.7倍的实时因子,适合实时对话应用。用户可通过Mistral API或自托管方式使用,提供灵活的商业和非商业使用选项。

Voxtral TTS开源文本转语音模型

KDnuggets KDnuggets · 2026-05-01T12:00:09Z
OpenClaw v2026.4.25更新:语音角色、TTS升级中文顺畅、插件加速

OpenClaw于2026年4月25日进行了重要更新,提升了AI语音合成能力,增加了语音人格化功能,使声音更自然、情感丰富。优化了插件系统,确保快速启动和稳定更新,监控系统实现透明化以保护隐私。简化了安装流程,降低了出错风险。整体上,OpenClaw从实验性工具升级为稳定的工程化平台,显著提升用户体验。

OpenClaw v2026.4.25更新:语音角色、TTS升级中文顺畅、插件加速

极道 极道 · 2026-04-27T22:04:00Z
MiMo-V2.5-TTS-Series + ASR 正式发布

MiMo-V2.5系列语音模型实现了从简单听读到精准理解与灵活表达的转变,支持语音识别与合成,能够在复杂场景中高效交互。该模型根据自然语言指令生成多样音色,提升语音表达的情感与细腻度,尤其在多种语言和噪音环境中表现优异,确保准确转写,推动语音技术的发展。

MiMo-V2.5-TTS-Series + ASR 正式发布

小米云技术 小米云技术 · 2026-04-23T18:01:46Z
突破零样本 TTS 音色克隆上限:LongCat-AudioDiT 的声音克隆艺术

美团LongCat团队发布了LongCat-AudioDiT模型,采用全新的端到端文本转语音技术,减少信息损失。该模型在Seed基准测试中表现优异,取得最佳的说话人相似度和可懂度,证明了在波形潜空间生成语音的有效性。LongCat-AudioDiT以简化架构和高保真合成为目标,已开源,期待推动语音生成技术的发展。

突破零样本 TTS 音色克隆上限:LongCat-AudioDiT 的声音克隆艺术

美团技术团队 美团技术团队 · 2026-04-20T00:00:00Z
零抽样 TTS 新突破!几秒参考音频,OmniVoice 助你轻松克隆数百种语言;17 种语言一网打尽:MDPBench 解决低资源文字系统解析难的「心头大患」

小米人工智能实验室推出了OmniVoice,这是一款支持600多种语言的零样本文本转语音(TTS)模型。该模型采用单阶段框架,直接将文本映射为声学标记,基于58.1万小时的开源数据训练,广泛覆盖语言,并提升了对低资源语言的支持。

零抽样 TTS 新突破!几秒参考音频,OmniVoice 助你轻松克隆数百种语言;17 种语言一网打尽:MDPBench 解决低资源文字系统解析难的「心头大患」

HyperAI超神经 HyperAI超神经 · 2026-04-17T08:28:37Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码