Gradium AI发布新TTS模型并设为默认,在500句难例测试中人工评分通过率81%,领先Cartesia和ElevenLabs。首音频延迟216毫秒,低且稳定。支持多语言,无需文本归一化即可准确朗读号码和邮箱。基准测试由厂商运行,评估集已开源。
VoxCPM是开源TTS系统,无需分词即可实时克隆人声,在连续空间建模语音,保留呼吸声等细节。基于MiniCPM-4,采用扩散自回归架构,分文本语义和残差声学两模型,支持上下文感知韵律和零样本克隆(3-10秒音频),可流式合成及微调。
Cartesia发布Sonic-3.6文本转语音模型,在Artificial Analysis两个语音排行榜均居首,自然度提升显著。该模型基于状态空间模型,时延低于90毫秒,支持即时声音克隆、自定义发音等,以Beta版托管API提供,定价每百万字符49美元,不开放自托管权重。
该项目是一个AI驱动的音频内容创作助手,支持通过自然语言生成定制语音、复刻音色及管理本地音频文件。前端使用Vue 3、TypeScript、Tailwind CSS和ai-elements-vue组件库,后端基于FastAPI、LangChain 1.0和LangGraph,通过SSE和AG-UI协议实现流式交互。系统具备多轮对话记忆,并调用阿里云TTS生成音频。文章还分享了开发中遇到的版本兼容和缓冲问题及解决心得。
论文针对基于大语言模型的语音合成在复杂文本上出现的重复、漏读等稳定性幻觉问题,提出通过注意力引导进行优化。作者从CosyVoice 2的自注意力中发现对齐注意力头,提出最优对齐分数(OAS)评估对齐质量,并据此强化前向注意力约束;同时利用伪对齐路径构建位置思维链,通过稀疏文本Token和进度条预测显式告知模型合成位置。实验表明,该方法在困难文本上词错误率相对下降约35%,且不损害自然度和说话人相似度。
Qwen发布Qwen-Audio-3.0-TTS实时语音合成模型,提供Flash和Plus版本,支持16种语言和20种方言,具备自然语言指令控制、细粒度标签控制及复杂声学鲁棒性。Plus版在权威榜单夺冠,并推出精品音色库,支持48K音频输出。
阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,支持细粒度标签控制、20种方言和16种语言,覆盖多语种场景。模型分Flash和Plus版本,在权威榜单夺冠,具备高鲁棒性和48kHz高质量输出,适用于实时交互和严肃创作,已开放调用。
Irodori-TTS是由开发者Aratako于2026年发布的日语语音合成项目,具有高保真音质和零样本声音克隆能力。核心模型Irodori-TTS-500M-v3支持48 kHz专业音频输出,用户只需提供3-10秒的参考音频即可精准复刻目标音色,并通过Emoji注释调节情绪和语调。
Fish TTS API 是基于 Fish Audio 官方 TTS API 的接口,使用时需申请 API Token。请求格式为 POST,支持文本合成和音频格式选择(mp3 或 pcm)。可通过异步回调获取长文本合成结果,错误处理包括鉴权失败和参数错误。
AI语音聊天机器人的实现依赖多个模块的协同,关键在于整体架构、流式串联、并行与预测、传输与端侧优化。通过优化各环节,端到端延迟可降低至700~900毫秒,接近真人对话速度。团队应明确延迟目标,利用成熟技术平台降低工程门槛,专注于对话逻辑创新。未来,随着技术进步,延迟有望进一步降低。
训练AI语音模型的关键在于优化而非从头训练。训练分为三层:ASR领域适配、LLM场景优化和TTS音色优化。ASR通过热词定制和选择合适模型提升准确率;LLM可通过提示工程、RAG和微调进行优化;TTS需选择合适音色和情感配置。建议先进行轻量优化,再考虑重型训练,以提高效率和效果。
选择AI语音平台时需考虑四层成本:ASR识别费、LLM推理费、TTS合成费和RTC传输费。不同场景下最佳组合不同。通过选择合适模型、利用免费额度、优化TTS合成和精简上下文等方式可降低费用。综合考虑各项成本,才能找到真正的低收费方案。
随着生成式AI向多模态发展,Supertone团队推出的Supertonic-3模型支持31种语言,具备实时语音合成能力,参数仅为9900万。该模型可在CPU环境中运行,无需云API,适合开发本地AI助手和语音播报系统。
阶跃语音生成模型StepAudio 2.5 TTS在全球TTS评测中排名第三,展现出自然的语音表达能力,适用于客户服务和知识分享等场景。阶跃还推出了StepAudio 2.5系列模型,涵盖语音生成、识别和实时交互,强调“有温度”的AI体验,已在多个核心场景实现商业化落地。
小米AI实验室推出的OmniVoice是一款支持646种语言的语音克隆TTS模型,具备简洁架构和卓越性能。该模型通过开源数据训练,能够高质量合成低资源小语种,解决了多语言合成的行业痛点。此外,OmniVoice还提供自定义音色、噪声过滤和发音纠正等功能,推动了多语言TTS的研发。
Voxtral TTS是Mistral AI推出的开源文本转语音模型,支持九种语言,能够在三秒音频基础上克隆声音,具有70毫秒的低延迟和9.7倍的实时因子,适合实时对话应用。用户可通过Mistral API或自托管方式使用,提供灵活的商业和非商业使用选项。
OpenClaw于2026年4月25日进行了重要更新,提升了AI语音合成能力,增加了语音人格化功能,使声音更自然、情感丰富。优化了插件系统,确保快速启动和稳定更新,监控系统实现透明化以保护隐私。简化了安装流程,降低了出错风险。整体上,OpenClaw从实验性工具升级为稳定的工程化平台,显著提升用户体验。
MiMo-V2.5系列语音模型实现了从简单听读到精准理解与灵活表达的转变,支持语音识别与合成,能够在复杂场景中高效交互。该模型根据自然语言指令生成多样音色,提升语音表达的情感与细腻度,尤其在多种语言和噪音环境中表现优异,确保准确转写,推动语音技术的发展。
美团LongCat团队发布了LongCat-AudioDiT模型,采用全新的端到端文本转语音技术,减少信息损失。该模型在Seed基准测试中表现优异,取得最佳的说话人相似度和可懂度,证明了在波形潜空间生成语音的有效性。LongCat-AudioDiT以简化架构和高保真合成为目标,已开源,期待推动语音生成技术的发展。
小米人工智能实验室推出了OmniVoice,这是一款支持600多种语言的零样本文本转语音(TTS)模型。该模型采用单阶段框架,直接将文本映射为声学标记,基于58.1万小时的开源数据训练,广泛覆盖语言,并提升了对低资源语言的支持。
完成下面两步后,将自动完成登录并继续当前操作。