VoxCPM是开源TTS系统,无需分词即可实时克隆人声,在连续空间建模语音,保留呼吸声等细节。基于MiniCPM-4,采用扩散自回归架构,分文本语义和残差声学两模型,支持上下文感知韵律和零样本克隆(3-10秒音频),可流式合成及微调。
OmniVoice Studio是一款开源本地语音AI桌面应用,支持646种语言,免费供个人使用,无需API密钥。它提供语音克隆、视频配音、实时听写和语音设计功能,所有处理均在本地完成,保护数据隐私。支持多平台(macOS、Windows、Linux),兼容多种GPU,并可通过MCP服务器集成到其他工具中。
Voicebox是一款开源的本地AI语音工具,具备语音克隆、文本转语音和语音识别功能。用户只需录制几秒钟的声音,即可生成多种语言的语音,且无需云端支持和费用。它支持多种语音引擎,适合制作有声书和播客,保护用户隐私,是传统付费服务的替代品。
语音克隆技术利用AI快速、低成本地创建特定人物的声音合成版本,分为零样本、少镜头和全面微调三种方法,广泛应用于音乐、媒体和商业领域。未来将实现更高质量、实时应用和多语言支持,成为数字通信的重要基础。
OmniVoice是一款新发布的多语言文本转语音(TTS)模型,支持超过600种语言,包括多种方言和口音。它采用非自回归架构,简化了语音生成流程,提高了自然度和可懂度。该模型具备零样本语音克隆能力,适用于AI配音和跨语言内容生成,展现出广泛的应用潜力。
小米AI实验室推出的OmniVoice是一款支持646种语言的语音克隆TTS模型,具备简洁架构和卓越性能。该模型通过开源数据训练,能够高质量合成低资源小语种,解决了多语言合成的行业痛点。此外,OmniVoice还提供自定义音色、噪声过滤和发音纠正等功能,推动了多语言TTS的研发。
研究发现,Qwen的语音合成技术中,跨句合成的音色稳定性只能通过语音克隆实现。虽然可以通过语气指令调节音色,但无法确保跨句一致性。使用seed参数仅能在同一句话中保持一致。最终,通过生成wav文件并转换为pt文件,实现了稳定的音色,并可进行二次语气控制,效果令人满意。希望这些经验能帮助其他AI研究者。
在调试小龙猫语音时遇到困难,发现千问TTS模型音色控制有限,句子间音色不稳定。明天将尝试语音克隆,若无效则考虑更换模型。实践是获取知识的关键。
生成式AI的语音合成技术不断进步,Qwen3-TTS模型支持多语言、语音克隆和细粒度控制,已在HyperAI官网上线,用户可体验3秒语音克隆。
Inworld AI 推出了 TTS-1.5,显著提升了实时语音代理的延迟和质量。Max 型号音频延迟低于 250 毫秒,Mini 型号低于 130 毫秒,性能和稳定性分别提高 30% 和 40%。该系统支持 15 种语言,并提供语音克隆功能,定价合理,适合高使用率产品。
VoxCPM是OpenBMB推出的开源无分词文本转语音系统,支持上下文感知和零-shot语音克隆,基于MiniCPM-4,适用于语音助手和媒体配音等高保真合成任务。
Inworld与Modular合作成功,'Inworld TTS 1 MAX'模型在语音排行榜中位列第一。该平台测试了超过100种LLM,评估其智能、速度和成本。两款模型支持12种语言,具备语音克隆和情感标签功能,提升了文本转语音的性能与效率。
NeuTTS-Air是一种高效的TTS模型,支持本地运行和即时语音克隆,降低了小型企业和个人开发者的使用门槛。该模型在超真实合成和实时推理方面表现优异,适用于手机和树莓派等设备,满足高质量TTS需求。
Soul App开源了播客语音合成模型SoulX-Podcast,支持多轮对话和多方言,生成自然流畅的语音,尤其在语音克隆和长对话中表现优异,具备丰富的韵律和情感表达,推动AI与社交结合,提升用户体验。
德克萨斯理工大学研究团队提出了一种“惯性-语音验证”系统,通过结合下颌与脸颊运动的语音数据进行身份验证,增强安全性。该系统利用传感器捕捉口腔运动,有效抵御伪造攻击,适用于高风险场景。尽管效果显著,仍需扩大测试和微型化设备以适应不同环境。
Cosyvoice是由Jichengdu维护的多语言文本转语音系统,具备先进的语音克隆能力,支持低延迟和高质量输出,能够生成自然语音,适用于多种语言和风格。
MiniMax推出的Speech-02大模型在AI语音生成领域取得突破,获得全球权威评测第一,超越OpenAI等竞争对手。该模型支持多语言和个性化音色复刻,具备高效语音克隆能力,广泛应用于教育和智能硬件等领域,展现出强大的技术优势和市场潜力。
Spark-TTS是一款基于Qwen2.5模型的文本转语音系统,支持零-shot语音克隆,用户可轻松创建个性化声音。它架构简化、效率提升,支持中英文合成,适用于有声书和虚拟主持人等场景。Mac用户可一键启动,体验自然生动的语音合成。
Hume的Octave TTS系统在文本转语音领域取得显著进展,能够理解上下文和情感,生成更自然的语音。与传统系统不同,Octave通过语音设计和表演指令调整输出,适应不同场景。内部研究表明,其音频质量和自然度优于竞争对手,未来将推出语音克隆功能,提升AI语音技术的灵活性和表现力。
Step-Audio是一个由中国AI开发者创建的开源框架,旨在提升语音理解与生成的真实感。它支持多语言对话、情感语调和方言,拥有130B参数的多模态模型,集成语音识别和对话处理功能。该系统通过AI生成数据优化训练质量,适用于语音AI应用,具备语音克隆和实时交互能力。
完成下面两步后,将自动完成登录并继续当前操作。