谷歌在6月发布了一系列AI更新,包括本地运行的Gemma 4 12B模型、Android 17的浮动窗口和安全升级、新的财务应用以跟踪投资、Gemini 3.5的实时语音翻译,以及NotebookLM和教育工具的个性化学习支持。此外,AI在气候预测和公共服务中展现潜力。
谷歌发布了Gemini 3.5实时语音翻译模型,支持70多种语言,具备抗噪能力,已在谷歌翻译iOS和安卓版上线。该模型能够生成自然流畅的翻译语音,保持说话者的语调和语速,适用于多语言会议和视频通话。开发者可通过Gemini Live API构建语音翻译应用,提升用户体验。
谷歌翻译最新更新扩展了实时语音翻译功能,支持70多种语言,用户只需兼容的安卓手机和翻译应用即可使用。更新还改进了文本翻译,并推出了类似Duolingo的“练习”功能,帮助用户根据技能水平进行定制化学习。实时翻译功能目前在美国、墨西哥和印度推出,明年将支持iOS。
在 Zoomtopia 2025 大会上,Zoom 发布了 AI Companion 3.0 和新服务,支持跨平台及第三方集成。新功能包括实时语音翻译和医疗虚拟代理,预计于2026年1月推出,旨在提升企业和医疗服务效率。
本研究提出SimulS2S-LLM方法,解决大语言模型在实时语音翻译中的并行推理问题,通过离线训练和策略指导,实现高质量的语音即时翻译。
实时语音翻译技术的发展正在消除语言障碍。AI助手如Alexa和ChatGPT能够保留语气和情感,促进全球商务、旅行和教育的顺畅交流。尽管存在准确性和隐私等挑战,这项技术有望改变人际沟通方式。
本文介绍了实时语音翻译技术的进展,包括CIF方法、FCCL方法和SimulS2ST系统。这些方法通过改进模型结构和训练策略,提高了翻译质量并降低了延迟,特别是在多语言支持和长话语处理方面表现突出。实验结果表明,新模型在质量和延迟的平衡上优于传统方法。
完成下面两步后,将自动完成登录并继续当前操作。