谷歌发布Gemini 3.5 Transcribe语音转文本模型,提升实时转写准确率、降低延迟,支持85种语言,自动去除口头语并修正表达,可区分说话者。流式转写延迟低于1秒,错误率低至2.6%。已通过Gemini API公开预览,未来支持Chrome浏览器。
Fish Audio的音频模型已上线AI Gateway,庆祝期间所有模型免费至9月18日。提供四个模型,包括文本转语音(支持低延迟、语音克隆、多语言及情感标记)和语音转文本(带时间戳)。用户可通过标准名称或加“-free”后缀使用,后者在优惠结束后自动停止服务。支持代码和浏览器试玩。
xAI的音频模型已在AI Gateway上线,提供实时语音、文本转语音和语音转文本功能。用户可通过AI SDK 7版本安全访问这些功能,开发者可使用示例代码快速集成,体验实时语音交互。
Canonical 正在为 Ubuntu 26.10 开发名为 Myna 的语音转文本解决方案。Myna 提供可靠的桌面语音输入功能,用户可通过快捷键自然说话,实时转换为文本。该项目支持本地语音模型处理,无需互联网连接,初期专注于语音转文本功能。
在微软Build开发者大会上,微软发布了MAI-Transcribe-1.5语音转文本模型和MAI-Voice-2文本转语音产品,提升了语音识别和合成语音的自然度。同时,微软推出了Project Solara,旨在通过持续在线的AI代理改善用户体验,尽管面临隐私和安全挑战,微软仍致力于将AI更深入地融入日常生活。
腾讯云与Soniox达成战略合作,结合Soniox的语音转文本技术与腾讯云的实时通信基础设施,支持全球200多个国家的多语言语音AI应用,提升用户体验,适用于智能客服和语音助手等场景,助力企业拓展多语言市场。
本文探讨了语音智能体的架构,包括语音转文本(STT)、大语言模型(LLM)和文本转语音(TTS)三个阶段。引入音频后,延迟和上下文处理变得复杂。级联模型适合大多数生产环境,而端到端模型在自然对话中更具竞争力。流式传输技术可减少延迟,提升对话自然性。设计中需考虑语音活动检测和话轮管理等技术挑战,以改善用户体验。
OpenAI推出了三种音频模型,分别是GPT-Realtime-2(实时对话)、GPT-Realtime-Translate(支持70多种语言的实时翻译)和GPT-Realtime-Whisper(低延迟语音转文本)。这些模型提升了语音交互的智能性和响应能力,适用于客户支持和教育等领域。
埃隆·马斯克的 AI 公司 xAI 发布了两款音频 API:语音转文本(STT)和文本转语音(TTS)。STT 支持 25 种语言,提供实时和批量转录,错误率为 5.0%。TTS 支持 20 种语言,提供多种声音选择,定价为每百万字符 4.20 美元。这标志着 xAI 进军语音 API 市场。
audiov是一款基于Rust开发的Linux语音转文本软件,利用whisper进行本地语音识别。它支持离线识别,能将文字直接输入到光标处,并通过全局快捷键操作,提供流畅的输入体验。
GStreamer 1.28.1于2026年2月26日发布,新增语音转文本功能、调试插件和AV1解码器支持,修复多个组件问题,增强音频事件配置及WebRTC流功能,提升安全性和播放性能。
IBM与Deepgram合作,将语音转文本和文本转语音功能集成到watsonx Orchestrate中,以满足企业对高性能转录和实时字幕的需求。这使Deepgram成为IBM首个语音合作伙伴,推动了医疗和金融领域的运营自动化和对话式AI技术的发展。
总部位于巴黎的Mistral AI推出了两款语音转文本模型,强调快速、准确和低成本,适合处理敏感数据。Voxtral Transcribe 2系列支持本地运行,满足医疗和金融等行业需求。Mistral重视隐私保护,预计到2026年AI转录将获得用户信任。
Handy是一款简单易用的语音转文本工具,支持Windows、macOS、Linux和NixOS。用户通过快捷键说话,松开后自动转为文字。该工具完全免费、开源,支持离线使用,适合需要快速输入或重视隐私的用户。
微软推出了VibeVoice-ASR,一个开源的语音转文本模型,支持最长60分钟的音频处理,输出结构化文本,包括“谁”、“何时”、“什么”。该模型允许用户自定义热词,以提高识别准确性,适合会议记录和长时间通话。
文章介绍了多个开源AI工具,包括离线语音转文本的Handy、自动化壁纸工具、截图工具Snow Shot、命令行AI工具AionUi、安卓自动化工具Ruto-GLM、本地AI代理Openwork、文本转自然语音的VibeVoice、微信聊天记录分析工具WeFlow,以及谷歌的AI工作流Opal。这些工具提升了用户的工作效率和体验。
作者使用GLM ASR替代OpenAI的murmur进行语音转文本,发现GLM在中英混合语句识别上表现更佳,尽管对OpenAI的依赖令人不满,但GLM的识别率和输出质量令人满意。最终,作者修改了murmur代码以使用GLM ASR。
Deepgram与Amazon SageMaker AI集成,提供流式实时语音转文本和文本转语音功能,简化AWS环境中的语音应用开发,适用于呼叫中心等场景,确保数据安全与合规性,助力企业创新。
Cursor IDE 2.0更新了强大的AI集成功能,新增Composer特性,速度是同类模型的四倍,支持多达8个代理并行运行,界面简洁易用,用户可自定义命令,内置语音转文本功能,提升了代码调试体验。
Shotcut 25.07 发布,新增语音转文本模型下载器,改进了 UI 主题和轮廓视频滤镜,增加了柔焦滤镜、环绕声混音改进及翻译功能。可在 Shotcut.org 下载。
完成下面两步后,将自动完成登录并继续当前操作。