谷歌推出Gemini 3.7 Flash等模型的智能体视频理解功能,通过动态扫描视频片段,将令牌消耗降低88%,成本降低66%,准确率提升7%。该功能支持子秒级检索、异常检测和精确计数,适用于长视频分析,现已通过Gemini API提供。
谷歌推出Gemini模型的智能体视频理解功能,支持3.7 Flash等版本,通过动态搜索和工具调用,将分析成本降低66%、令牌消耗减少88%,准确率提升7%。该功能适用于长视频检索、异常检测和动作计数,已通过API提供,并计划推广至Gemini应用和YouTube。
本文介绍Mux Robots的“提问”功能,可对视频内容进行多模态分析(结合画面和字幕)。它用于内容审核(如检测脚部特写)、验证列表完整性、广告披露、工作证明及支持工单分类。示例显示,该功能能准确回答无对话视频(如Big Buck Bunny)中的问题,并跳过无法回答的查询,避免幻觉。
Gemini Robotics ER 2于2026年7月发布,通过视频理解、任务编排和多机器人协作增强具身推理能力,支持真实世界机器人任务。其前代ER 1.6于同年4月推出,同样聚焦提升实体推理性能。
SmolVLM2-2.2B是一个高效的视频理解模型,能够在普通GPU上运行,适合处理会议记录、讲座和监控视频。它提取视频帧并生成结构化的JSON摘要,提供每帧的场景描述、关键时刻和行动项,表现优异,适合开发者在本地环境中使用。
本文探讨了多模态大语言模型(MLLMs)在自我中心视频理解中的时间意识不足问题,并提出了时间全局策略优化(TGPO)算法。该算法通过对比有序与打乱的视频帧生成奖励信号,以促进时间推理。实验结果显示,TGPO在五个基准测试中显著提升了时间基础和因果一致性,优于以往的强化学习方法。
上海研究提出AdaCodec编解码器,通过优化帧间信息存储,显著减少AI视频生成的资源消耗。该系统在保持性能的同时,视觉令牌使用量减少约86%,提高了视频理解效率,适用于企业和个人用户。
快手发布了多模态大模型Keye-VL-2.0-30B-A3B,具备深度视频理解能力,采用DSA机制处理超长视频上下文,提升推理效率和准确性。该模型能够精准识别视频细节,提供高情商建议,并在复杂任务中展现强大的逻辑推理能力,标志着快手在多模态理解和自动化调度方面的重大进展,推动内容生产智能化。
TrajTok是一种视频标记模块,通过动态调整标记粒度,解决视频模型中的标记冗余问题。它集成了统一的分割器,能够高效生成对象轨迹,提升视频理解性能。在分类和检索基准测试中表现优异,可作为预训练视觉特征的探测头或视觉-语言模型的连接器。
文心大模型5.0正式上线,参数达到2.4万亿,提升了智能体与工具调用能力。PaddleOCR-VL-1.5发布,解决了曲面文档解析问题,并新增67个数据集,支持多模态推理与视频理解。社区活动包括文心Moment大会与AICA架构师培养计划,促进AI技术应用与开发者交流。
ConvertX 是一款自托管的在线文件转换器,支持多种格式和批量处理。Yuxi-Know 是智能体开发平台,结合知识库与图数据库,支持多模态分析。flowsurface 是加密货币市场的桌面图表分析工具,提供多种图表类型和实时数据。Kiro 是智能集成开发环境,支持软件全流程构建。VideoRAG 实现视频内容的深度理解与交互。
TwelveLabs于2025年12月1日发布了Marengo 3.0视频基础模型,具备视频理解、物体追踪和时空推理功能,存储成本降低50%,索引速度提升2倍。该模型支持多模态查询,适用于体育、媒体和公共安全等领域,现可通过Amazon Bedrock访问。
Uni-MoE-2.0-Omni是哈尔滨工业大学深圳分校研发的全模态大型模型,支持文本、图像、音频和视频的理解与生成。基于Qwen2.5-7B模型,采用动态容量路由和渐进式监督学习,显著提升了跨模态推理能力,尤其在视频理解和长语音处理方面表现优异。
NVIDIA推出Nemotron Nano 2 VL模型,支持视频理解和文档智能,采用混合Transformer-Mamba架构,具备高效视频采样技术,提升处理效率和准确性,适用于多模态应用。
本文探讨了视频理解基准的局限性,指出现有评估方法未能有效区分模型的时间推理能力。提出了VBenchComp,一个自动化流程,将问题分类为可回答、语义和时间问题,以便更细致地评估视频大语言模型的能力。分析表明传统评分掩盖了模型的弱点,并为未来基准设计提供了建议。
计算机视觉国际大会(ICCV)是顶级会议之一,专注于视频理解和多模态推理,涵盖时间表示、实时对话生成和视觉大语言模型等研究,推动了计算机视觉领域的发展。
快手开源了多模态推理模型Keye-VL 1.5,具备128k上下文、0.1秒视频定位和跨模态推理能力。该模型在视频理解和推理方面表现优异,能够准确判断物品出现的时间并详细描述场景,在多个基准测试中取得领先成绩。
本文介绍了SlowFast-LLaVA-1.5(SF-LLaVA-1.5),一种高效的视频大语言模型,专注于长视频理解。该模型结合了SlowFast机制和联合视频-图像训练,在1B和3B规模下表现出色,满足移动友好模型的需求。实验结果显示,SF-LLaVA-1.5在多个视频任务上表现优异,尤其在长视频理解方面达到了最先进水平。
文心ERNIE-4.5-VL视觉语言模型实现了多模态交互,具备强大的图文和视频理解能力,支持100多种语言。其轻量级版本在多个基准测试中表现优异,适应多种场景,能够快速响应基础任务并深度解决复杂问题。
南洋理工大学研究团队提出了Video Thinking Test(Video-TT)来评估AI的视频理解能力。研究显示,GPT-4o的准确率仅为36%,远低于人类的84.3%。AI在模糊内容、场景区分和世界知识理解方面存在显著弱点,表明视频理解领域仍需提升。
完成下面两步后,将自动完成登录并继续当前操作。