推出Gemini智能体视频理解功能
内容提要
谷歌推出Gemini模型的智能体视频理解功能,支持3.7 Flash等版本,通过动态搜索和工具调用,将分析成本降低66%、令牌消耗减少88%,准确率提升7%。该功能适用于长视频检索、异常检测和动作计数,已通过API提供,并计划推广至Gemini应用和YouTube。
延伸解读
动态搜索如何降低视频分析成本
传统静态处理以固定帧率(默认1 FPS)分析视频,长视频会消耗大量令牌。智能体视频理解让模型主动决定观看哪些片段、以何种速度和模态(画面、音频或字幕)分析,只提取所需时刻。基准测试显示,令牌消耗最多可降低88%,成本降低66%,同时准确率提升7%。这种效率提升在10分钟到数小时的长视频中尤为明显。
适用场景与能力边界
该功能支持亚秒级时刻检索、长视频中的“大海捞针”搜索、异常检测和动作计数。例如,可以精准定位快速动作或剪辑边界,或对多小时的视频进行复杂查询。但需注意,这些能力基于模型对视频内容的理解,对于模糊或低质量视频,效果可能受限。开发者应根据具体需求评估是否启用。
启用方式与定价
智能体视频理解已通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform提供,支持Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite。启用只需在API配置中将processing设为“agentic”,且不额外收费,按标准令牌价格计费。未来将推广至Gemini应用和YouTube的“Ask YouTube”功能。
Q&A
谷歌新推出的智能体视频理解功能是什么?
谷歌推出的智能体视频理解功能是一种基于Gemini模型的新能力,它让模型能够动态地搜索、扫描和检查视频中的目标片段,而不是像传统方法那样以固定帧率处理整个视频。该功能支持Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,旨在提高视频分析的准确率,同时大幅降低令牌消耗和成本。
智能体视频理解相比传统静态处理有哪些优势?
相比传统静态处理(固定帧率如1 FPS),智能体视频理解通过动态搜索和工具调用,只处理需要的视频片段,从而将分析成本降低高达66%,令牌消耗减少高达88%,准确率提升高达7%。尤其在长视频(如10分钟教程到90分钟讲座)中优势明显。
智能体视频理解的工作原理是什么?
智能体视频理解让Gemini模型采取主动、目标导向的方式,决定观看什么、以什么速度、通过哪种模态(帧、音频或转录),并调用内部工具加载视频的相关部分,而不是像静态处理那样以固定帧率摄取整个视频流。这减少了开发开销,并提高了处理效率。
智能体视频理解有哪些典型应用场景?
典型应用场景包括:亚秒级时刻检索(如精确定位快速状态变化)、长视频中的大海捞针式搜索(如回答多小时的视频中的复杂问题)、异常检测(如以更高帧率重采样感兴趣的时间窗口以检查快速运动)、以及动作和物体计数(如准确跟踪重复动作和不同物体)。
如何启用智能体视频理解功能?
该功能通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform上提供,支持Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite。启用方法是在API配置中将processing参数设置为"agentic"。使用标准Gemini API令牌定价,无额外功能费用。
智能体视频理解未来会扩展到哪些产品?
该功能将很快在Gemini应用中向所有用户推出,覆盖Flash和Flash-Lite模型。此外,在接下来的几个月内,它还将为YouTube的“Ask YouTube”功能提供支持,利用Gemini提供基于视频画面的更高质量答案。