为何不使用教科书?知识增强的教学视频程序规划
内容提要
本文介绍了一种基于transformer的弱监督学习方法,旨在从自然语言指令中提取过程规划,避免昂贵的视频标注。研究表明,该方法在多个数据集上优于全监督模型,并提出了多种新框架和模型以提高程序理解任务的精度。
关键要点
-
提出了一种基于transformer和概率生成模块的弱监督学习方法,旨在从自然语言指令中提取过程规划。
-
该方法避免了昂贵的时序视频标注,并在多个数据集上优于全监督模型。
-
提出了Dual Dynamics Networks(DDN)框架,以解决复杂任务规划中的技术挑战。
-
利用视频表示学习技术构建Procedural Knowledge Graph (PKG),生成伪标签以提高程序理解任务的精度。
-
提出了一种基于事件引导的范式,通过推断事件来进行过程规划。
-
提出了一种新的过程规划公式,通过贝叶斯推论和基于模型的模仿学习建模人类行为。
-
研究利用网络教学视频和解说学习视频表示方法,推动步骤分类和预测的发展。
-
提出了多阶段训练的知识感知KOALA模型,解决手续性文本理解中的外部知识注入和数据不足问题。
-
通过简化行动空间,模型能够探索行动序列中的可靠子关系,达到最先进的性能。
延伸问答
什么是基于transformer的弱监督学习方法?
基于transformer的弱监督学习方法旨在从自然语言指令中提取过程规划,避免昂贵的视频标注。
Dual Dynamics Networks(DDN)框架的目的是什么?
DDN框架旨在解决学习结构化、可规划的状态和动作空间的技术挑战,以应对复杂任务规划的问题。
Procedural Knowledge Graph (PKG) 是如何构建的?
PKG通过无标签的教学视频和基于文本的程序知识库信息融合而成,生成伪标签以提高程序理解任务的精度。
该研究如何提高程序理解任务的精度?
研究通过构建PKG和采用多种预训练目标,训练视频表示模型,从而提高程序理解任务的精度。
如何利用事件引导的范式进行过程规划?
通过从观察到的状态中推断事件,并基于状态和预测的事件规划行动,来实现过程规划。
KOALA模型解决了哪些问题?
KOALA模型解决了手续性文本理解中的外部知识注入和数据不足的问题,最终在多个数据集上达到了最先进的性能。