MambaPupil: 事件驱动的双向选择性循环模型用于眼动跟踪
内容提要
本研究提出了一种稀疏变化卷积长短期记忆(CB-ConvLSTM)模型,专为AR/VR设备的事件驱动眼动追踪设计。该模型利用事件相机的低延迟和稀疏输出,能够高效提取时空特征,算术运算减少约4.7倍,且不损失精度,适合资源受限设备的实时眼动追踪。
延伸解读
事件相机为何适合眼动追踪
事件相机受视网膜启发,输出稀疏事件流而非固定帧率图像,具有低延迟特性。这种特性使其在AR/VR头戴设备等可穿戴医疗技术中,能更快响应眼球运动,尤其适合对实时性要求高的眼动追踪场景。相比传统帧相机,事件相机在动态变化和资源受限环境下更具优势。
CB-ConvLSTM的效率突破
CB-ConvLSTM通过增量编码循环路径增强稀疏激活,在标记的瞳孔数据集上测试时,算术运算减少约4.7倍且不损失精度。这意味着模型在保持追踪精度的同时,显著降低了计算负载,为资源受限设备(如移动AR/VR头显)的实时眼动追踪提供了可行方案。
与传统CNN结构的对比
文章指出,CB-ConvLSTM能从事件流中高效提取时空特征进行瞳孔跟踪,胜过传统CNN结构。传统CNN通常针对帧图像设计,难以直接处理异步稀疏事件流。CB-ConvLSTM的循环路径和稀疏激活机制,使其更适配事件数据的时空特性,从而在效率和精度上取得平衡。
可获取的资源与验证
项目代码和数据集已在GitHub公开(https://github.com/qinche106/cb-convlstm-eyetracking),便于研究者复现和验证。该模型在标记的瞳孔数据集上进行了测试,结果支持其高效性。公开资源有助于推动事件驱动眼动追踪在可穿戴设备中的进一步应用。
Q&A
CB-ConvLSTM模型的主要特点是什么?
CB-ConvLSTM模型专为事件驱动眼动追踪设计,利用低延迟和稀疏输出,能高效提取时空特征,算术运算减少约4.7倍且不损失精度。
CB-ConvLSTM模型适合在哪些设备上使用?
CB-ConvLSTM模型特别适合在资源受限的设备上进行实时眼动追踪。
与传统基于帧的摄像机相比,CB-ConvLSTM模型有什么优势?
CB-ConvLSTM模型利用事件相机的低延迟和稀疏输出,优于传统基于帧的摄像机,能更高效地进行瞳孔跟踪。
CB-ConvLSTM模型如何提高眼动追踪的效率?
通过增强稀疏激活的增量编码循环路径,CB-ConvLSTM在处理瞳孔数据时减少了算术运算量,提升了效率。
CB-ConvLSTM模型的算术运算减少了多少?
CB-ConvLSTM模型的算术运算减少约4.7倍。
如何获取CB-ConvLSTM模型的代码和数据集?
项目代码和数据集可以在GitHub上获取,链接为https://github.com/qinche106/cb-convlstm-eyetracking。