让AI服务每一种语言中的每一个人
内容提要
谷歌致力于让AI支持全球千余种语言,覆盖86%人口。通过Gemini实现70种语言实时语音翻译,并推出千种语言计划、WAXAL等本地数据合作项目。TranslateGemma支持离线翻译,SL2T服务听障人群,还为毛利语地名纠正发音,让技术尊重文化差异。
延伸解读
从文本到语音:AI如何捕捉真实对话
传统语音识别采用多步流程,会丢失语调、节奏和情感等关键信息。谷歌转向原生音频智能,让Gemini直接处理音频,理解声音和意图。例如,Gemini 3.5 Live Translate支持70种语言的实时翻译,能自然捕捉语码转换和情感线索。这使AI更贴近人们实际说话的方式,如混合语言或重叠对话。
社区合作:解决低资源语言的数据瓶颈
网络数据过度代表少数主导语言,导致许多语言缺乏训练数据。谷歌通过本地化合作构建开放数据集,如WAXAL覆盖27种撒哈拉以南非洲语言,Project Vaani收集印度109种语言的超过3万小时语音。这些项目强调社区参与,确保数据反映真实语言多样性,而非仅依赖网络抓取。
离线与低端设备:让翻译触及无网人群
全球仍有超过30亿人无法可靠接入互联网。TranslateGemma是一组轻量级开源翻译模型,支持55种语言,可在设备端离线运行,无需云端连接。针对仍使用功能手机的人群,Viamo的语音助手AVA将Gemini带到标准功能手机上,已在卢旺达试点并回答超过200万个问题,帮助缩小数字鸿沟。
文化尊重:从手语到地名发音的包容性设计
语言技术还需考虑非标准沟通方式。SL2T支持50多种手语,在Pixel 11上实现手语到文本听写,首先支持美国手语到英语,惠及全球7000万手语使用者。此外,谷歌与毛利语专家合作,改进谷歌地图中地名的发音,将文化上真实的发音融入文本转语音模型,体现对文化遗产的尊重。
Q&A
谷歌的AI语言技术目前覆盖了多少种语言和人口?
谷歌的技术和产品支持超过300种语言,覆盖全球70多亿人,占全球人口的86%。
Gemini在实时语音翻译方面有哪些能力?
Gemini 3.5 Live Translate支持70种语言的实时语音翻译,涵盖2000多种语言对,能自然捕捉语码转换和情感线索。
什么是千种语言计划?
千种语言计划旨在支持全球使用人数最多的1000种语言。通过通用语音模型(训练了1200万小时音频)和跨语言迁移学习,将数据丰富语言的学习模式应用到资源匮乏的语言上。
谷歌如何收集 underrepresented 语言的数据?
谷歌通过本地草根合作收集数据,例如WAXAL(覆盖27种撒哈拉以南非洲语言)、Project Vaani(收集印度109种语言超过3万小时语音)和Amplify Initiative(与1600多名本地专家合作贡献1.5万多模态数据点)。
TranslateGemma是什么?它有什么作用?
TranslateGemma是一系列基于Gemini构建的轻量级开源翻译模型,训练了55种语言。它能在设备上高效运行,无需连接云端或互联网即可提供高质量翻译。
谷歌如何为听障人士设计语言工具?
谷歌推出了Sign Language-to-Text (SL2T),训练了50多种手语,在Pixel 11的Gboard和Live Transcribe中支持手语到文本的听写,初期支持美国手语(ASL)到英语。
谷歌如何确保地名发音尊重当地文化?
谷歌与当地社区合作,例如在新西兰与毛利语专家合作改进Google Maps中的地名发音,将文化上真实的发音直接融入文本转语音模型。