实时翻译需将识别、翻译、合成嵌入毫秒级音视频链路,核心是延迟预算与协同。分为字幕翻译和语音翻译两种形态,按场景取舍。工程难点包括说话人分离、噪声口音、术语一致、字幕同步和算力成本。理想方案应让用户无感。
NDI与NVIDIA合作开发AI驱动工作流程,使广播公司能实时创建和分发多语言内容。该方案结合NDI原生媒体连接与NVIDIA NIM微服务,从同一媒体流生成多语言体验,支持实时翻译、唇形同步配音和区域语言适配,无需重复制作。内部测试10种语言时,仅需八分之一视频传输量即可达到相同效果,有望降低带宽和分发成本。方案目前正在测试中。
谷歌翻译推出两项更新:安卓用户可让实时翻译在后台持续运行,适合超过五分钟的多任务或锁屏场景;iOS用户现可通过听筒直接获取实时翻译,无需耳机,适用于嘈杂环境。iOS后台支持即将推出。
Pixel Buds新增动态降噪、Gemini语音控制、Pixel Watch睡眠同步及升级版实时翻译(支持70多种语言)。Pixel Buds Pro 2推出橄榄色,8月12日开售,软件更新9月推送。
OpenAI于2026年推出了新对话模型GPT-Live-1和GPT-Live-1 mini,旨在提升自然对话体验。这些全双工模型支持实时翻译和长时间对话,解决了用户打断和智能不足的问题。新语音模式将取代旧版本,增强交互性,并内置安全机制以保护青少年用户。
OpenAI发布了GPT-Live,语音交互实现质的飞跃。新模式提供更自然的对话、智能回答和可视化信息,支持实时翻译和联网搜索。GPT-Live通过全双工架构和深度任务委托,提升了对话流畅度和响应速度,改变了与AI的交流方式。
OpenAI推出了新的GPT-Live-1语音模型,能够实时说话和倾听,减少打断。该模型支持实时翻译和AI生成的视觉信息,具备内置安全措施,确保适龄回答。GPT-Live-1将在iOS、Android和网页上推出,Go、Plus和Pro用户将使用此模型,免费用户则使用更小的GPT-Live-1迷你版。
Solos推出了新款AirGo A6智能眼镜,去掉了摄像头,设计更轻薄,重量约19克。它支持语音助手、实时翻译和日历提醒等功能,兼容处方镜片,并提供多种款式和透明选项。此外,Solos还发布了隐私配件以保护用户隐私。
出海社交产品需要实时翻译以促进不同语言用户的互动,常见场景包括1v1跨语种匹配、直播间观众翻译和IM消息翻译。接入方案有三种:纯第三方API集成、RTC厂商生态集成和混合方案。选择时需考虑语种覆盖、延迟、成本和隐私合规。ZEGO的实时传译方案提供低延迟和低集成成本,适合大多数出海社交团队。
在规划出海社交App功能时,应区分必选项与加分项。美颜在拉美市场是必需的,而在中东和东南亚则为加分项。变声在语聊房中是强加分项,但在1v1通话中不必要。实时翻译是跨语言社交的基础设施,缺失会影响用户匹配和互动。其他功能如背景分割、空间音效等需按场景评估其必要性。
Conduent公司推出新一代客户体验平台,集成AI功能,提供实时翻译、AI培训模拟和语音增强技术,帮助企业克服语言障碍、加快客服培训、改善客户互动,支持90多种语言,提升服务质量和客户满意度。
DeepL宣布收购Mixhalo团队及技术,以增强其实时AI语音翻译解决方案DeepL Voice。这将提升翻译在大型活动和复杂场景中的速度和清晰度,超越市场平均水平。Mixhalo提供低延迟高保真音频,支持多种大型活动。DeepL在美国市场快速增长,已与多家知名企业合作。
六月Pixel更新推出新功能,包括实时屏幕反应、视频编辑工具Gemini Omni、音乐生成和浮动窗口多任务处理。Voice Translate功能扩展至Pixel 10a,支持多语言实时翻译。紧急共享功能增强,自动通知紧急联系人。Google Photos新增“Ask Photos”功能,用户可通过自然对话编辑照片。
谷歌推出了Gemini 3.5实时翻译模型,支持70多种语言的语音翻译。该模型采用连续流处理,翻译内容滞后几秒,适用于会议和通话场景。开发者可通过Live API配置功能,支持音频输入和输出,未来将应用于Google Meet和Translate应用中。
谷歌推出Gemini 3.5 Live Translate,支持70多种语言的实时语音翻译,自动检测语言并生成自然流畅的翻译语音,适用于会议和通话。该功能在Google Meet和Google Translate应用中逐步推出,提升翻译质量和速度,支持多语言对话,并新增“听模式”,用户可通过手机直接听到翻译内容。
谷歌推出Gemini 3.5实时翻译模型,支持70多种语言的语音实时翻译,自动检测语言并生成自然流畅的翻译语音,适用于会议和通话。用户可通过Google Meet和Google Translate应用体验这一新功能,提升多语言沟通效率。
Palabra.ai是一家总部位于伦敦的AI语音翻译公司,年收入在六个月内从6万美元增长到100万美元,显示出实时多语言通信的需求激增。该平台支持超过1000种语言的实时翻译,保留说话者的身份和情感,显著降低多语种会议的成本,并确保数据安全与合规。
在最新一期播客中,讨论了OpenAI的新语音智能API功能,包括实时翻译和转录。Thinking Machines展示了低延迟对话系统,Anthropic推出了法律领域的Claude产品,并加强了与AWS的合作。此外,还提到OpenAI的自伤风险警报功能等安全和政策更新。
AI语音模型正在迅速发展,改变各行业的通信与自动化。OpenAI的GPT Realtime-2支持70多种语言,但面临幻觉和安全限制。谷歌的TTS模型以自然生动的语音输出著称,适合个性化应用,但响应较慢。InWorld AI的TTS-2专注于游戏互动,速度快但情感表达不足。XAI的Groon API兼顾速度与多功能性,适合个性化需求。尽管存在幻觉和可控性问题,AI语音技术在实时翻译和客户支持等领域展现出巨大潜力。
OpenAI 发布了三个新音频模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper,分别用于语音推理、实时翻译和转录。GPT-Realtime-2 具备 GPT-5 级推理能力,支持复杂对话和任务;GPT-Realtime-Translate 可将 70 多种语言实时翻译成 13 种语言;GPT-Realtime-Whisper 提供低延迟的语音转文本服务。所有模型已通过 Realtime API 正式上线。
完成下面两步后,将自动完成登录并继续当前操作。