小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布

Qwen-Audio-3.0-TTS 实时语音合成模型发布。本次发布包含两个版本: 本次更新,我们把精力放在了开发者在生产环境中真正会遇到的四个问题上:更广的语言覆盖、更...

从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布

实时互动网
实时互动网 · 2026-07-20T09:22:03Z
AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

细粒度标签+ 20 种方言

AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

量子位
量子位 · 2026-07-20T09:05:06Z
emoji 也能控制语音生成?Irodori-TTS 基于 RF-DiT 架构的日语 TTS;Eczema and Tinea Skin Disease 数据集:支持医学图像分类与迁移学习

Irodori-TTS是由开发者Aratako于2026年发布的日语语音合成项目,具有高保真音质和零样本声音克隆能力。核心模型Irodori-TTS-500M-v3支持48 kHz专业音频输出,用户只需提供3-10秒的参考音频即可精准复刻目标音色,并通过Emoji注释调节情绪和语调。

emoji 也能控制语音生成?Irodori-TTS 基于 RF-DiT 架构的日语 TTS;Eczema and Tinea Skin Disease 数据集:支持医学图像分类与迁移学习

HyperAI超神经
HyperAI超神经 · 2026-07-03T09:07:54Z
Fish TTS API 对接说明

Fish TTS API 是基于 Fish Audio 官方 TTS API 的接口,使用时需申请 API Token。请求格式为 POST,支持文本合成和音频格式选择(mp3 或 pcm)。可通过异步回调获取长文本合成结果,错误处理包括鉴权失败和参数错误。

Fish TTS API 对接说明

静觅
静觅 · 2026-06-19T21:16:18Z
AI 语音聊天机器人背后是怎么实现的,是 ASR + LLM + TTS 串起来吗,延迟怎么压下去

AI语音聊天机器人的实现依赖多个模块的协同,关键在于整体架构、流式串联、并行与预测、传输与端侧优化。通过优化各环节,端到端延迟可降低至700~900毫秒,接近真人对话速度。团队应明确延迟目标,利用成熟技术平台降低工程门槛,专注于对话逻辑创新。未来,随着技术进步,延迟有望进一步降低。

AI 语音聊天机器人背后是怎么实现的,是 ASR + LLM + TTS 串起来吗,延迟怎么压下去

实时互动网
实时互动网 · 2026-06-12T07:33:39Z
如何训练AI语音开发模型?从数据准备到三层优化的实操路径

训练AI语音模型的关键在于优化而非从头训练。训练分为三层:ASR领域适配、LLM场景优化和TTS音色优化。ASR通过热词定制和选择合适模型提升准确率;LLM可通过提示工程、RAG和微调进行优化;TTS需选择合适音色和情感配置。建议先进行轻量优化,再考虑重型训练,以提高效率和效果。

如何训练AI语音开发模型?从数据准备到三层优化的实操路径

实时互动网
实时互动网 · 2026-06-11T07:18:17Z
哪些AI语音开发平台收费低?了解最省钱的选型组合

选择AI语音平台时需考虑四层成本:ASR识别费、LLM推理费、TTS合成费和RTC传输费。不同场景下最佳组合不同。通过选择合适模型、利用免费额度、优化TTS合成和精简上下文等方式可降低费用。综合考虑各项成本,才能找到真正的低收费方案。

哪些AI语音开发平台收费低?了解最省钱的选型组合

实时互动网
实时互动网 · 2026-06-11T07:05:48Z
Free CPU教程丨狂揽8.8k stars,TTS模型Supertonic-3参数规模仅约99M,支持31种语言

随着生成式AI向多模态发展,Supertone团队推出的Supertonic-3模型支持31种语言,具备实时语音合成能力,参数仅为9900万。该模型可在CPU环境中运行,无需云API,适合开发本地AI助手和语音播报系统。

Free CPU教程丨狂揽8.8k stars,TTS模型Supertonic-3参数规模仅约99M,支持31种语言

HyperAI超神经
HyperAI超神经 · 2026-05-20T10:55:40Z
阶跃最新语音模型位列 Artificial Analysis 评测榜中国第一

阶跃语音生成模型StepAudio 2.5 TTS在全球TTS评测中排名第三,展现出自然的语音表达能力,适用于客户服务和知识分享等场景。阶跃还推出了StepAudio 2.5系列模型,涵盖语音生成、识别和实时交互,强调“有温度”的AI体验,已在多个核心场景实现商业化落地。

阶跃最新语音模型位列 Artificial Analysis 评测榜中国第一

量子位
量子位 · 2026-05-09T10:29:31Z
超600种语言,一个模型全搞定! 小米开源 OmniVoice 多语言语音克隆 TTS

小米AI实验室推出的OmniVoice是一款支持646种语言的语音克隆TTS模型,具备简洁架构和卓越性能。该模型通过开源数据训练,能够高质量合成低资源小语种,解决了多语言合成的行业痛点。此外,OmniVoice还提供自定义音色、噪声过滤和发音纠正等功能,推动了多语言TTS的研发。

超600种语言,一个模型全搞定! 小米开源 OmniVoice 多语言语音克隆 TTS

小米云技术
小米云技术 · 2026-05-07T09:00:46Z

Voxtral TTS是Mistral AI推出的开源文本转语音模型,支持九种语言,能够在三秒音频基础上克隆声音,具有70毫秒的低延迟和9.7倍的实时因子,适合实时对话应用。用户可通过Mistral API或自托管方式使用,提供灵活的商业和非商业使用选项。

Voxtral TTS开源文本转语音模型

KDnuggets
KDnuggets · 2026-05-01T12:00:09Z
OpenClaw v2026.4.25更新:语音角色、TTS升级中文顺畅、插件加速

OpenClaw于2026年4月25日进行了重要更新,提升了AI语音合成能力,增加了语音人格化功能,使声音更自然、情感丰富。优化了插件系统,确保快速启动和稳定更新,监控系统实现透明化以保护隐私。简化了安装流程,降低了出错风险。整体上,OpenClaw从实验性工具升级为稳定的工程化平台,显著提升用户体验。

OpenClaw v2026.4.25更新:语音角色、TTS升级中文顺畅、插件加速

极道
极道 · 2026-04-27T22:04:00Z
MiMo-V2.5-TTS-Series + ASR 正式发布

MiMo-V2.5系列语音模型实现了从简单听读到精准理解与灵活表达的转变,支持语音识别与合成,能够在复杂场景中高效交互。该模型根据自然语言指令生成多样音色,提升语音表达的情感与细腻度,尤其在多种语言和噪音环境中表现优异,确保准确转写,推动语音技术的发展。

MiMo-V2.5-TTS-Series + ASR 正式发布

小米云技术
小米云技术 · 2026-04-23T18:01:46Z
突破零样本 TTS 音色克隆上限:LongCat-AudioDiT 的声音克隆艺术

美团LongCat团队发布了LongCat-AudioDiT模型,采用全新的端到端文本转语音技术,减少信息损失。该模型在Seed基准测试中表现优异,取得最佳的说话人相似度和可懂度,证明了在波形潜空间生成语音的有效性。LongCat-AudioDiT以简化架构和高保真合成为目标,已开源,期待推动语音生成技术的发展。

突破零样本 TTS 音色克隆上限:LongCat-AudioDiT 的声音克隆艺术

美团技术团队
美团技术团队 · 2026-04-20T00:00:00Z
零抽样 TTS 新突破!几秒参考音频,OmniVoice 助你轻松克隆数百种语言;17 种语言一网打尽:MDPBench 解决低资源文字系统解析难的「心头大患」

小米人工智能实验室推出了OmniVoice,这是一款支持600多种语言的零样本文本转语音(TTS)模型。该模型采用单阶段框架,直接将文本映射为声学标记,基于58.1万小时的开源数据训练,广泛覆盖语言,并提升了对低资源语言的支持。

零抽样 TTS 新突破!几秒参考音频,OmniVoice 助你轻松克隆数百种语言;17 种语言一网打尽:MDPBench 解决低资源文字系统解析难的「心头大患」

HyperAI超神经
HyperAI超神经 · 2026-04-17T08:28:37Z
OpenClaw v2026.4.15发布:接入Opus4.7、Gemini TTS、云存储

OpenClaw 2026.4.15版本更新了多个核心功能,解决了AI工程中的上下文膨胀、记忆管理和工具链不稳定等问题。新增了对Anthropic Opus 4.7和Gemini TTS的支持,优化了内存系统,增强了模型选择的便捷性和安全性,并引入了云存储支持,提升了长期记忆系统的可扩展性和开发者体验。整体上,OpenClaw朝着长期稳定运行的方向发展。

OpenClaw v2026.4.15发布:接入Opus4.7、Gemini TTS、云存储

极道
极道 · 2026-04-17T00:42:00Z
Google AI 发布 Gemini 3.1 Flash TTS:表现力强、可控性高的 AI 语音技术新标杆

谷歌推出了Gemini 3.1 Flash TTS,这是一个改进的文本转语音模型,支持70多种语言,具备自然语言音频标签和多说话人对话功能。该模型在行业基准测试中得分1211,提供复杂的控制层,允许开发者根据场景调整语气、语速和口音。同时,集成的SynthID水印技术可识别AI生成内容,确保信息透明。

Google AI 发布 Gemini 3.1 Flash TTS:表现力强、可控性高的 AI 语音技术新标杆

实时互动网
实时互动网 · 2026-04-16T03:02:56Z

Gemini 3.1 Flash TTS是最新的AI语音模型,支持70多种语言,用户可通过音频标签调整语音风格和节奏。所有生成的音频均带有SynthID水印,以防止误信息传播。开发者可在Google AI Studio中使用该模型,创造高保真语音体验。

Gemini 3.1 Flash TTS:下一代富有表现力的AI语音

Google DeepMind Blog
Google DeepMind Blog · 2026-04-15T16:03:19Z

谷歌推出了Gemini 3.1 Flash TTS,这是最新的文本转语音模型,具备更好的可控性、表现力和音质,支持70多种语言,并提供音频标签以控制语音风格和节奏。所有生成的音频都带有不可见水印SynthID,以防止虚假信息传播。

Gemini 3.1 Flash TTS:下一代富有表现力的人工智能语音

The Keyword
The Keyword · 2026-04-15T15:00:00Z
仅需 3 秒音频实现「配音自由」,Mistral 开源语音大模型 Voxtral-4B-TTS-2603;多项全能!Capybara 一站式搞定图、视频生成与指令编辑

Mistral发布了Voxtral-4B-TTS-2603模型,旨在提升多语言语音生成的自然度和效率。该模型结合了语义自回归和声学流匹配,支持低延迟本地运行,展现出良好的泛化能力。

仅需 3 秒音频实现「配音自由」,Mistral 开源语音大模型 Voxtral-4B-TTS-2603;多项全能!Capybara 一站式搞定图、视频生成与指令编辑

HyperAI超神经
HyperAI超神经 · 2026-04-08T06:29:50Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码