实时翻译需将识别、翻译、合成嵌入毫秒级音视频链路,核心是延迟预算与协同。分为字幕翻译和语音翻译两种形态,按场景取舍。工程难点包括说话人分离、噪声口音、术语一致、字幕同步和算力成本。理想方案应让用户无感。
DeepL宣布收购Mixhalo团队及技术,以增强其实时AI语音翻译解决方案DeepL Voice。这将提升翻译在大型活动和复杂场景中的速度和清晰度,超越市场平均水平。Mixhalo提供低延迟高保真音频,支持多种大型活动。DeepL在美国市场快速增长,已与多家知名企业合作。
谷歌于6月17日向Pixel设备推送Android 17正式版,新增AI功能,包括音乐生成模型Lyria 3和语音翻译工具。此外,更新还引入气泡任务栏、同屏录摄功能及家长管控优化,提升用户体验。
Krisp推出语音翻译v3,提供企业级语音翻译解决方案和API,准确率达96%。新功能包括自动语言选择、实时通话审核和自定义词汇表,支持61种语言,专为医疗、金融等高风险场景设计,确保翻译质量。开发者可自助使用API,享受60分钟免费试用。
谷歌推出了Gemini 3.5实时翻译模型,支持70多种语言的语音翻译。该模型采用连续流处理,翻译内容滞后几秒,适用于会议和通话场景。开发者可通过Live API配置功能,支持音频输入和输出,未来将应用于Google Meet和Translate应用中。
谷歌推出Gemini 3.5 Live Translate,支持70多种语言的实时语音翻译,自动检测语言并生成自然流畅的翻译语音,适用于会议和通话。该功能在Google Meet和Google Translate应用中逐步推出,提升翻译质量和速度,支持多语言对话,并新增“听模式”,用户可通过手机直接听到翻译内容。
谷歌推出Gemini 3.5实时翻译模型,支持70多种语言的语音实时翻译,自动检测语言并生成自然流畅的翻译语音,适用于会议和通话。用户可通过Google Meet和Google Translate应用体验这一新功能,提升多语言沟通效率。
当前语音翻译系统虽然准确,但缺乏灵活性,无法像人类翻译员那样适应实际情况。为提升其实用性,需要深入理解人类翻译的本质。本文探讨人类翻译文献,提出借鉴人类翻译原则以改进机器翻译系统,推动机器翻译的真正进步。
DeepL 更新了其实时语音翻译工具 DeepL Voice,新增中文普通话等语言支持,提升会议效率。该工具可在虚拟会议中提供字幕翻译,并支持移动设备的即时语音翻译,更新还包括会议记录和翻译功能,增强企业安全性。
谷歌Workspace推出新功能,包括Gmail的个性化智能回复,能够根据用户语气和上下文生成回复;Google Meet提供近实时低延迟语音翻译,支持多语言自然对话;Google Vids现已向订阅用户开放。
谷歌在Meet中推出了语音翻译功能,利用Gemini技术实时翻译用户对话,保留声音、语调和表达。目前支持英语和西班牙语,未来将增加意大利语、德语和葡萄牙语。该功能仅对AI Pro或AI Ultra计划的用户开放。
本研究提出了一种创新方法,利用大型语言模型提升国际口语翻译研讨会(IWSLT)中的语音翻译与指令跟随任务的性能。通过融合多个自动语音识别系统的输出,采用两步翻译和文档级精炼,显著提高了翻译质量。
本研究提出了Soundwave,一种高效的训练策略和新架构,旨在解决语音大型语言模型在语音与文本之间的表示空间差距和序列长度不一致的问题。Soundwave在语音翻译和AIR-Bench任务中表现优异,仅使用五十分之一的训练数据,仍能保持智能对话的表现。
本研究探讨了2024年12月至2025年1月的首次语音翻译指导(SpeechT),旨在填补该领域的指导空白。研究团队提出了一种系统化的方法,以提升语音翻译效果,为未来研究提供参考。
本研究探讨了传统级联语音翻译模型的局限性,并介绍了Google的Translatotron模型。该模型通过直接进行语音到语音的翻译,提高了翻译效率,减少了错误,尤其在弥合非洲语言与其他正式语言的障碍方面表现优异,具有重要的应用前景。
本研究提出了一种基于条件计算的特征融合框架,解决了自监督学习特征与传统频谱特征之间的冲突。该框架结合了门控网络和断开策略,提升了模型的鲁棒性和收敛速度。在MUSTC数据集上的语音翻译任务中,我们的方法与频谱模型表现相当。
本研究提出了一种利用多语言大型语言模型来解决零资源语音翻译和自动语音识别的挑战。通过结合预训练的语音编码器和轻量适配模块,系统在CoVoST2数据集上实现了超过23的BLEU分数和28.2%的错误率。
本文探讨了韵律对语音翻译中语义和文本翻译的影响,并提出了一种评估韵律意识的方法和基准ContraProSt。研究表明,S2TT模型对韵律有一定的内部表征,但韵律信号对翻译的显著影响有限。E2E系统优于传统级联系统,部分级联系统能够捕捉韵律信息,但效果有限。
本文研究了在低资源环境下提高自动语音识别(ASR)和语音翻译性能的方法。通过预训练声学模型和结合文本到语音(TTS)技术,利用少量数据实现了显著的性能提升。同时,探讨了文本多样性和合成数据对ASR性能的影响,并提出了有效的模型优化策略。
本文研究了在低资源环境下提高自动语音识别(ASR)和语音翻译性能的方法。通过多语言训练和预训练声学模型,显著提升了识别精度,尤其是对低资源语言。同时探讨了知识蒸馏和自监督学习等技术,以优化模型并降低训练数据需求。
完成下面两步后,将自动完成登录并继续当前操作。