HaltingVT: 适用于高效视频识别的自适应停止令牌变换器

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

AVT是一种基于注意力机制的视频建模架构,通过关注之前观察过的视频来预测未来的动作。AVT在多个动作预测基准测试中表现出最佳性能,并在挑战赛中获得第一名。

🏷️

标签

➡️

继续阅读