小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Ai2 推出 Molmo 2 开源视频语言模型

Ai2发布了开源视频语言模型Molmo 2,支持多图像和视频输入,允许用户进行端到端研究,强调开源的重要性,适合企业使用,关注数据透明性和责任。

Ai2 推出 Molmo 2 开源视频语言模型

实时互动网 实时互动网 · 2025-12-17T03:38:15Z

本研究提出了一种新型视频分析系统AVA,基于视频语言模型(VLM),旨在提升开放性分析场景的适应性。AVA通过实时构建事件知识图谱和代理检索生成机制,显著改善复杂查询的表现,并在多个基准测试中超越现有系统,展示了处理超长视频内容的潜力。

Empowering Video Language Models for Agentic Video Analytics Systems

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-01T00:00:00Z

本研究针对视频语言模型ResNetVLLM中的多模态幻觉问题,提出了改进的Lynx模型和动态知识库策略。实验结果表明,ResNetVLLM-2的准确率从54.8%提升至65.3%,显著增强了模型的可靠性。

ResNetVLLM-2: Addressing the Multi-Modal Hallucination Problem in ResNetVLLM

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-20T00:00:00Z

本研究提出了一种名为差异蒸馏的方法,旨在降低视频语言模型处理长视频的计算成本。通过差异关键帧选择和特征合并机制,开发了ViLaMP模型,能够在单个NVIDIA A100 GPU上高效处理最多10K帧的视频,并在多个视频理解基准测试中表现优异。

Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-03T00:00:00Z

本研究提出了一种新的即插即用KV缓存量化方法VidKV,旨在解决视频大型语言模型在处理长视频时的内存瓶颈问题。该方法将KV缓存压缩至低于2位,并通过通道级别量化实现精度与性能的平衡。

Plug-and-Play 1.x-Bit KV Cache Quantization for Video Large Language Models

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-03-20T00:00:00Z

本研究提出了VCBench,一个用于评估大型视频语言模型在符号和抽象概念下认知能力的基准。研究表明,现有模型在处理抽象概念的视频认知任务时表现不佳,强调了VCBench在推动视频认知模型研究中的重要性。

VCBench: A Controllable Benchmark for Symbolic and Abstract Challenges in Video Cognition

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-11-14T00:00:00Z

本文介绍了VIOLET、E-ViLM和LongVLM等视频语言模型的研究进展。这些模型通过新技术和优化算法,在视频问答和文本到视频检索等任务中表现优异,显著提升了效率和性能。此外,研究提出了TemporalBench基准,以评估模型在时间理解方面的能力,揭示了当前模型与人类之间的差距。

xGen-MM-Vid (BLIP-3-Video): 只需32个标记即可表示视频

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-21T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码