谷歌推出Gemini 3.7 Flash等模型的智能体视频理解功能,通过动态扫描视频片段,将令牌消耗降低88%,成本降低66%,准确率提升7%。该功能支持子秒级检索、异常检测和精确计数,适用于长视频分析,现已通过Gemini API提供。
本文介绍了多种基于弱监督和深度学习的时序动作定位方法,如AutoLoc、SVTAS-RL和OTAS。这些方法通过新损失函数和优化策略,提高了在多个数据集上的定位精度和效率,尤其在长视频分析中表现突出。
完成下面两步后,将自动完成登录并继续当前操作。