本研究提出了一种新的视频时刻拼接(VMM)任务,旨在简化短视频编辑中用户手动选择片段的过程。通过文本-视频多粒度整合方法(TV-MGI),有效融合文本与视频特征,实现精确对齐,并提供了大规模数据集MSSD以验证框架的有效性。
完成下面两步后,将自动完成登录并继续当前操作。