小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

谷歌推出Gemini 3.7 Flash等模型的智能体视频理解功能,通过动态扫描视频片段,将令牌消耗降低88%,成本降低66%,准确率提升7%。该功能支持子秒级检索、异常检测和精确计数,适用于长视频分析,现已通过Gemini API提供。

谷歌推出Gemini智能体视频理解功能

Google DeepMind Blog Google DeepMind Blog · 2026-09-01T17:08:51Z

谷歌推出Gemini模型的智能体视频理解功能,支持3.7 Flash等版本,通过动态搜索和工具调用,将分析成本降低66%、令牌消耗减少88%,准确率提升7%。该功能适用于长视频检索、异常检测和动作计数,已通过API提供,并计划推广至Gemini应用和YouTube。

推出Gemini智能体视频理解功能

The Keyword The Keyword · 2026-09-01T17:00:00Z
这个视频主要是脚部特写吗?(以及其他你可能想问的关于视频的有用问题)

本文介绍Mux Robots的“提问”功能,可对视频内容进行多模态分析(结合画面和字幕)。它用于内容审核(如检测脚部特写)、验证列表完整性、广告披露、工作证明及支持工单分类。示例显示,该功能能准确回答无对话视频(如Big Buck Bunny)中的问题,并跳过无法回答的查询,避免幻觉。

这个视频主要是脚部特写吗?(以及其他你可能想问的关于视频的有用问题)

Mux Blog - Video technology and more Mux Blog - Video technology and more · 2026-08-18T22:22:34Z

Gemini Robotics ER 2于2026年7月发布,通过视频理解、任务编排和多机器人协作增强具身推理能力,支持真实世界机器人任务。其前代ER 1.6于同年4月推出,同样聚焦提升实体推理性能。

Gemini Robotics 2为机器人带来全身智能

Google DeepMind Blog Google DeepMind Blog · 2026-07-28T13:21:37Z

SmolVLM2-2.2B是一个高效的视频理解模型,能够在普通GPU上运行,适合处理会议记录、讲座和监控视频。它提取视频帧并生成结构化的JSON摘要,提供每帧的场景描述、关键时刻和行动项,表现优异,适合开发者在本地环境中使用。

本地视频摘要管道:使用SmolVLM2-2.2B处理帧

KDnuggets KDnuggets · 2026-07-10T12:00:51Z
激励自我中心视频理解模型中的时间意识

本文探讨了多模态大语言模型(MLLMs)在自我中心视频理解中的时间意识不足问题,并提出了时间全局策略优化(TGPO)算法。该算法通过对比有序与打乱的视频帧生成奖励信号,以促进时间推理。实验结果显示,TGPO在五个基准测试中显著提升了时间基础和因果一致性,优于以往的强化学习方法。

激励自我中心视频理解模型中的时间意识

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-09T00:00:00Z
AdaCodec:一种适用于 AI 生成视频的编解码器

上海研究提出AdaCodec编解码器,通过优化帧间信息存储,显著减少AI视频生成的资源消耗。该系统在保持性能的同时,视觉令牌使用量减少约86%,提高了视频理解效率,适用于企业和个人用户。

AdaCodec:一种适用于 AI 生成视频的编解码器

实时互动网 实时互动网 · 2026-06-05T03:53:30Z
将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式

快手发布了多模态大模型Keye-VL-2.0-30B-A3B,具备深度视频理解能力,采用DSA机制处理超长视频上下文,提升推理效率和准确性。该模型能够精准识别视频细节,提供高情商建议,并在复杂任务中展现强大的逻辑推理能力,标志着快手在多模态理解和自动化调度方面的重大进展,推动内容生产智能化。

将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式

量子位 量子位 · 2026-05-26T10:17:39Z
TrajTok:学习轨迹标记以提升视频理解

TrajTok是一种视频标记模块,通过动态调整标记粒度,解决视频模型中的标记冗余问题。它集成了统一的分割器,能够高效生成对象轨迹,提升视频理解性能。在分类和检索基准测试中表现优异,可作为预训练视觉特征的探测头或视觉-语言模型的连接器。

TrajTok:学习轨迹标记以提升视频理解

Apple Machine Learning Research Apple Machine Learning Research · 2026-03-17T00:00:00Z
飞桨星河社区月度报告(2026年1月)

文心大模型5.0正式上线,参数达到2.4万亿,提升了智能体与工具调用能力。PaddleOCR-VL-1.5发布,解决了曲面文档解析问题,并新增67个数据集,支持多模态推理与视频理解。社区活动包括文心Moment大会与AICA架构师培养计划,促进AI技术应用与开发者交流。

飞桨星河社区月度报告(2026年1月)

百度大脑 百度大脑 · 2026-02-10T10:55:58Z
自托管在线文件转换器,千种格式轻松转换 | 开源日报 No.852

ConvertX 是一款自托管的在线文件转换器,支持多种格式和批量处理。Yuxi-Know 是智能体开发平台,结合知识库与图数据库,支持多模态分析。flowsurface 是加密货币市场的桌面图表分析工具,提供多种图表类型和实时数据。Kiro 是智能集成开发环境,支持软件全流程构建。VideoRAG 实现视频内容的深度理解与交互。

自托管在线文件转换器,千种格式轻松转换 | 开源日报 No.852

开源服务指南 开源服务指南 · 2026-01-19T23:35:54Z
TwelveLabs 在 Amazon Bedrock 上推出 Marengo 3.0 视频理解模型

TwelveLabs于2025年12月1日发布了Marengo 3.0视频基础模型,具备视频理解、物体追踪和时空推理功能,存储成本降低50%,索引速度提升2倍。该模型支持多模态查询,适用于体育、媒体和公共安全等领域,现可通过Amazon Bedrock访问。

TwelveLabs 在 Amazon Bedrock 上推出 Marengo 3.0 视频理解模型

实时互动网 实时互动网 · 2025-12-02T03:30:00Z
Uni-MoE-2.0-Omni:基于开源Qwen2.5-7B的文本、图像、音频与视频理解全模态MoE模型

Uni-MoE-2.0-Omni是哈尔滨工业大学深圳分校研发的全模态大型模型,支持文本、图像、音频和视频的理解与生成。基于Qwen2.5-7B模型,采用动态容量路由和渐进式监督学习,显著提升了跨模态推理能力,尤其在视频理解和长语音处理方面表现优异。

Uni-MoE-2.0-Omni:基于开源Qwen2.5-7B的文本、图像、音频与视频理解全模态MoE模型

实时互动网 实时互动网 · 2025-11-19T02:32:18Z
在vLLM上运行NVIDIA Nemotron的多模态推理代理

NVIDIA推出Nemotron Nano 2 VL模型,支持视频理解和文档智能,采用混合Transformer-Mamba架构,具备高效视频采样技术,提升处理效率和准确性,适用于多模态应用。

在vLLM上运行NVIDIA Nemotron的多模态推理代理

vLLM Blog vLLM Blog · 2025-10-31T00:00:00Z
剖析视频大语言模型基准:知识、空间感知还是真实的时间理解?

本文探讨了视频理解基准的局限性,指出现有评估方法未能有效区分模型的时间推理能力。提出了VBenchComp,一个自动化流程,将问题分类为可回答、语义和时间问题,以便更细致地评估视频大语言模型的能力。分析表明传统评分掩盖了模型的弱点,并为未来基准设计提供了建议。

剖析视频大语言模型基准:知识、空间感知还是真实的时间理解?

Apple Machine Learning Research Apple Machine Learning Research · 2025-10-27T00:00:00Z
ICCV 2025 | 美团论文精选及多模态推理竞赛冠军方法分享

计算机视觉国际大会(ICCV)是顶级会议之一,专注于视频理解和多模态推理,涵盖时间表示、实时对话生成和视觉大语言模型等研究,推动了计算机视觉领域的发展。

ICCV 2025 | 美团论文精选及多模态推理竞赛冠军方法分享

美团技术团队 美团技术团队 · 2025-10-27T00:00:00Z

快手开源了多模态推理模型Keye-VL 1.5,具备128k上下文、0.1秒视频定位和跨模态推理能力。该模型在视频理解和推理方面表现优异,能够准确判断物品出现的时间并详细描述场景,在多个基准测试中取得领先成绩。

视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理

量子位 量子位 · 2025-09-05T13:39:24Z
SlowFast-LLaVA-1.5:一种高效的长视频理解视频大语言模型家族

本文介绍了SlowFast-LLaVA-1.5(SF-LLaVA-1.5),一种高效的视频大语言模型,专注于长视频理解。该模型结合了SlowFast机制和联合视频-图像训练,在1B和3B规模下表现出色,满足移动友好模型的需求。实验结果显示,SF-LLaVA-1.5在多个视频任务上表现优异,尤其在长视频理解方面达到了最先进水平。

SlowFast-LLaVA-1.5:一种高效的长视频理解视频大语言模型家族

Apple Machine Learning Research Apple Machine Learning Research · 2025-08-22T00:00:00Z

文心ERNIE-4.5-VL视觉语言模型实现了多模态交互,具备强大的图文和视频理解能力,支持100多种语言。其轻量级版本在多个基准测试中表现优异,适应多种场景,能够快速响应基础任务并深度解决复杂问题。

ERNIE-4.5-VL:技术解密+应用实战,解锁多模态新场景!

百度大脑 百度大脑 · 2025-08-19T13:45:55Z

南洋理工大学研究团队提出了Video Thinking Test(Video-TT)来评估AI的视频理解能力。研究显示,GPT-4o的准确率仅为36%,远低于人类的84.3%。AI在模糊内容、场景区分和世界知识理解方面存在显著弱点,表明视频理解领域仍需提升。

大模型无法真正理解视频,GPT-4o正确率仅36%,南洋理工大团队提出新基准

量子位 量子位 · 2025-08-01T10:23:28Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码