本文研究了如何通过在计算机视觉系统中使用记忆来改进视频流中的物体检测的精度和减少计算时间的问题。研究表明,在存在时间记忆的情况下,进行准确检测所需的计算量是非常小的。此外,记忆容纳了足够的信息以应用于强化学习算法来学习自适应推断策略。该模型在 Imaget VID 2015 数据集上实现了移动方法中的最先进性能,并在 Pixel 3 手机上以 70+ FPS 的速度运行。
完成下面两步后,将自动完成登录并继续当前操作。