将手语AI交到用户手中

将手语AI交到用户手中

💡 原文英文,约1300词,阅读约需5分钟。
📝

内容提要

谷歌DeepMind推出手语转文本模型SL2T,支持超50种手语,首次将手语AI应用于Gboard和Live Transcribe,以美国手语转英语起步。该模型通过追踪身体关键点而非原始视频保护隐私,直接翻译为文本,在基准测试中表现优异,并与聋人社群合作开发,未来将扩展更多语言和设备。

🔎

延伸解读

隐私设计:只传关键点,不传视频

SL2T在设备端用MediaPipe Holistic追踪手、臂、躯干、头和脸的关节点,只把几何坐标发送到服务器,原始视频立即丢弃。这种设计既保护用户隐私,又减少传输数据量。但这也意味着模型依赖关键点提取的准确性,在遮挡、低光或快速运动时可能影响翻译质量。

从实验室到产品:现实挑战与已知局限

尽管SL2T在基准测试中表现优异,但实际应用中仍有错误,如罕见手语、快速手指拼写、被动结构、分类器描绘和缺乏上下文时的时态处理。团队还针对左撇子、单手签名(如手持手机时)进行了优化,但用户需注意这些局限,尤其是在关键交流场景中。

与聋人社群共建:治理与影响评估

项目由聋人Google员工Sam Sepah发起,数据收集、评估和影响评估均与聋人伙伴合作。团队还成立了AI手语咨询委员会(AISLAC),汇集全球聋人组织和专家,共同指导开发。这种参与式治理模式确保技术更贴合社群需求,但未来扩展更多语言时仍需持续合作。

Q&A

SL2T是什么?它有什么主要功能?

SL2T是谷歌DeepMind推出的手语转文本模型,支持超过50种手语。它首次将手语AI应用于消费产品,在Gboard和Live Transcribe中提供手语转文本的听写功能,目前支持美国手语(ASL)转英语,用户可以用手语进行搜索、起草消息或文档,以及在对话中回复。

SL2T如何保护用户隐私?

SL2T通过追踪身体关键点(pose landmarks)而非原始视频来保护隐私。设备上的MediaPipe Holistic模型追踪手语者的关键点位置,只将这些几何坐标发送到服务器进行翻译,原始视频立即丢弃。

SL2T在翻译手语时面临哪些核心挑战?

SL2T面临两个核心挑战:一是手语是独立的自然语言,有自己的语法和词汇,需要真正的机器翻译而非简单的符号到词的顺序映射;二是模型需要学习理解身体运动,手语通过手、手臂、躯干、头部和面部的同时运动表达意义,高帧率追踪这些运动是困难的计算机视觉任务。

SL2T在基准测试中的表现如何?

在FLEURS-ASL基准测试中,SL2T取得了70 BLEURT的零样本得分,显著高于以往任何报告的结果,是目前最强大的手语翻译模型。

SL2T的开发过程中如何与聋人社群合作?

SL2T的开发与聋人社群紧密合作,从概念化(由聋人谷歌员工Sam Sepah提出)到数据收集、评估和影响评估,都有聋人参与。还成立了AI手语咨询委员会(AISLAC),由全球聋人组织和专家组成,通过参与式治理影响开发优先级,并共同发布影响报告。

SL2T目前有哪些局限性?

SL2T在罕见手语、快速手指拼写(如'prey'误译为'grey')、被动结构、分类词描述(如省略'claws')以及缺乏上下文时的时态处理(如'kicked off'误译为'start')方面仍存在错误。

SL2T未来有什么扩展计划?

SL2T未来将扩展到更多手语、手语生成以及前沿AI能力,并计划在更多设备上推出,目前首先在Pixel 11上可用,更多设备即将推出。

🏷️

标签

➡️

继续阅读