Pixel 11系列推出全新手语转文字功能,与美国手语社区合作开发,利用多语言模型分析手势、表情和身体动作,实时将ASL翻译成英文。支持单手或双手,可在Live Transcribe或Gboard使用,翻译显示于外屏。该系列现已上市。
谷歌DeepMind推出手语转文本模型SL2T,支持超50种手语,首次将手语AI应用于Gboard和Live Transcribe,以美国手语转英语起步。该模型通过追踪身体关键点而非原始视频保护隐私,直接翻译为文本,在基准测试中表现优异,并与聋人社群合作开发,未来将扩展更多语言和设备。
本研究开发了一种伪注释管道,利用手语视频和英语生成可能的注释,包括时间间隔和手势分类。通过建立基线模型,取得了在手语数据集上的最佳表现。专业翻译人员为ASL STEM Wiki的近500个视频进行了注释,并发布了300小时的伪注释数据,以支持手语生成系统的改进。
Merge Forward团队将在KubeCon + CloudNativeCon亚特兰大会议上举办多样性与包容性活动,欢迎各类群体参与。活动包括社区聚会、手语介绍和小组辅导,旨在促进交流与合作。
云原生词汇表团队推出手语视频,旨在为70多百万聋人提供技术术语的可及性,创建一致的手语标志,促进聋人专业人士参与云原生技术交流与发展。
腾讯Light创造营展示了多个AI公益项目,旨在帮助听障和肢体残障人士。通过面控技术,用户可用面部动作操控设备;AR字幕手语眼镜促进聋哑人与健全人之间的交流。这些项目展示了AI技术在无障碍服务和心理健康支持中的应用。
本研究解决了连续手语分割这一关键问题,该问题对手语翻译和数据标注具有重要影响。我们提出了一种基于变压器的架构,将分割建模为序列标注问题,并采用Begin-In-Out (BIO) 标记方案。实验结果表明,我们的方法在DGS语料库上实现了最先进的结果,同时在BSLCorpus上的特征超过了之前的基准。
本研究开发了一个基于视频的美式手语词典,旨在帮助学习者解决查找不熟悉手势的困难。通过手势识别技术和用户体验研究,分析了初学者在使用过程中的互动问题,如系统延迟和隐私顾虑,为词典系统的设计提供了指导。
LinguaSignAI是一个开源项目,旨在将美国手语(ASL)手势翻译为口语。该项目结合了关键点识别和迁移学习技术,利用Google的MediaPipe和深度学习模型,能够适应不同的光照条件和复杂手势。欢迎大家贡献代码,以促进ASL用户与听力世界的沟通。
本研究解决了孟加拉手语文本翻译问题,创新性地结合德美手语语法与大型语言模型生成合成数据。结果显示,基于mBART-50的模型在PHOENIX-14T测试中表现优异,提出了新的翻译范式,证明合成数据对BdSL翻译的促进作用。
本研究提出了一种文本驱动的扩散模型(TDM)框架,旨在从文本生成语义一致的手语姿态序列,最终在手语生成任务中获得BLEU-1得分20.17,排名第二。
本研究提出了一种新方法,利用事件流辅助RGB摄像头捕捉手势数据,克服了手语翻译算法在光照和运动模糊下的局限性。通过收集15776个样本的数据集VECSL,提出了新的手语翻译框架M$^2$-SLT,并取得了先进的结果。
手语对聋人和听力障碍者至关重要。现有手语生成系统在英语翻译方面未能满足用户需求。我们利用最新语言模型和视频生成技术,将英语句子翻译为自然手语视频。通过用户研究和技术评估,我们发现了显著进展,并识别出满足用户需求的关键领域。
本文提出了BdSLW401,一个包含401个手势和102,176个视频样本的孟加拉手语数据集,以解决手语识别中的说话者变异和视角变化问题。通过引入相对量化编码(RQE),显著提升了基于变换器的手语识别效果,增强了模型的解释性和识别率。
本研究解决了当前孤立手语识别(ISLR)模型的语言特定限制问题,提出了一种跨语言和词汇演变的一-shot 学习方法。通过预训练模型以根据关键特征嵌入手势,并使用密集向量搜索实现对未见手势的快速准确识别,取得了先进的结果,具有良好的跨语言和支持集的稳健性,推动了手语识别技术的可扩展性和适应性。
美国手语是美国第三大语言,但与英语和西班牙语相比,相关的AI工具较少。NVIDIA与美国聋人儿童协会合作推出Signs平台,支持ASL学习,提供3D虚拟形象和实时反馈。用户可贡献视频,建立开放数据集,促进聋人与听人之间的沟通,并整合面部表情等非手动信号,提升ASL教育的可及性。
本研究提出GLaM-Sign,旨在改善聋人及听障人士的沟通,提升希腊旅游行业的包容性。该项目结合音频、视频、文本转录和手语翻译,未来将扩展至更多语言,展示多模态资源在沟通与创新中的潜力。
流媒体在无障碍方面面临挑战,尤其是对聋哑观众。Bitmovin团队利用人工智能将手语化身引入视频,通过将字幕转为HamNoSys表示并结合3D动画,提供灵活的手语展示,提升可访问性。尽管存在语法复杂性和情感表达的局限,未来可通过多模式数据处理和更复杂模型改进手语生成,促进更广泛的沟通。
本文介绍了多个手语数据集及其相关研究,包括美国手语和英国手语的数据集,提出了基于姿态的手语识别模型和方法,探讨了手语处理的自动化技术及其在手语识别中的应用,旨在推动手语技术的发展和研究。
本研究推出了覆盖74种口语和美国手语的2M-BELEBELE数据集,填补了多语言语音和ASL理解数据集的空白。评估结果显示,语音理解的准确率比阅读理解低约8%。
完成下面两步后,将自动完成登录并继续当前操作。