本研究开发了一种伪注释管道,利用手语视频和英语生成可能的注释,包括时间间隔和手势分类。通过建立基线模型,取得了在手语数据集上的最佳表现。专业翻译人员为ASL STEM Wiki的近500个视频进行了注释,并发布了300小时的伪注释数据,以支持手语生成系统的改进。
本文介绍了一种新型动作定位方法,利用视觉线索和伪注释提高视频中动作的时空定位精度。通过多种算法和模型的结合,该方法在THUMOS14和ActivityNet v1.3数据集上表现优异,展示了其有效性和优势。
完成下面两步后,将自动完成登录并继续当前操作。