Robo.ai计划以1亿美元收购Neurovia AI,以加速构建物理AI基础设施。Neurovia专注于视频数据的压缩与传输。收购后,Robo.ai将成为全球AI视频数据平台,支持无人驾驶和智慧城市等应用。交易以股票形式完成,确保长期战略一致性,未来十年将专注于AI硬件和边缘AI的整合。
标准智能公司正在探索通过视频数据训练通用智能代理的可能性。他们的模型分析计算机使用的原始视频数据,以预测鼠标移动和点击等操作。创始人Galen Mead和Devansh Pandey致力于安全实现AGI,团队以创新和技术勇气著称。
自动驾驶面临边缘案例挑战,这些罕见场景常被忽视。Kyra Mozley介绍了Perception 2.0,通过基础模型和嵌入技术提升视频数据理解,简化数据标注,增强模型灵活性和准确性。新方法支持自然语言搜索和分类,快速识别复杂场景,提高安全性和可靠性。
视频数据快速增长推动编解码技术进步,人工智能提升了视频压缩效率,克服了传统编码的局限。未来,视频编解码将朝智能化、语义化和可持续发展方向发展。
Meta发布的V-JEPA 2世界模型能够在62小时内训练机器人,使其理解物理世界并进行预测与规划。该模型通过自监督学习,利用大量视频数据提升机器人控制能力,标志着机器人技术的新纪元。
本文介绍了「七月在线」开发的NaVILA框架,旨在提升腿式机器人在视觉与语言导航中的能力。NaVILA将高级语言指令转化为中级动作,并结合低级运动策略,提高了导航效率。该框架利用真实视频数据训练,显著提升了机器人在复杂环境中的成功率,展现了广泛的应用潜力。
本研究提出了一种基于视频数据的价值函数,旨在解决在线强化学习中稀疏奖励导致的反馈不足问题。该方法利用多样的数据源,展现出良好的迁移效果和泛化能力,有望提升在线强化学习的效果与效率。
本研究提出了一种新颖的非侵入性方法,利用多模态预测模型整合RGB和热成像视频数据与患者元数据,显著提高了远程肺活量测定的准确性,达到92%和99.5%。
英伟达正在从YouTube和其他来源抓取视频数据,用于AI产品的训练。员工被要求从Netflix、YouTube和其他来源抓取视频,以训练AI模型。英伟达使用了开源的YouTube视频下载器,并使用了20到30台虚拟机每天下载相当于80年的视频。英伟达似乎不在意法律问题,员工被告知已获得公司最高层的批准。此外,他们还购买了800万支YouTube视频,并通过谷歌云下载。这些行为可能涉及版权问题。
本文介绍了一种通过野外视频数据重建手持物体三维形状的方法,该方法利用三维监督信号和数据驱动的形状先验进行训练。研究表明,在没有直接三维监督的情况下,该方法能够有效预测真实世界中的手持物体形状。
本研究探讨了动态生成模型在视频数据中的应用,提出了基于变换的网络架构和Rough Transformer,以提高长程依赖建模的效率。研究表明,Rough Transformer在时间序列任务中优于传统模型,且计算成本显著降低。此外,AMLNet和GAT-GAN在需求预测和长时间序列生成中也表现出色。
文本数据扩展达瓶颈,下一步发展集中在视频-语言生成建模和迭代强化学习。Llama 3性能不错,但推理能力需扩大强化学习规模。视频数据可改善模型与现实世界联系。
本文探讨了利用视频数据和深层迁移学习对睡眠进行分类的方法,准确率达到73.4%。同时,提出了基于事件相机的数据处理策略,提升了物体识别和活动识别的性能,展示了事件数据在高动态范围和低延迟条件下的优势。
本文提出了一种用于无监督特征学习的视频数据的强基线模型,通过学习预测输入视频序列中缺少的帧或外推未来帧,该模型发现了对于表示复杂变形和运动模式有用的空间和时间相关性,并且是借鉴语言建模文献,通过将图像补丁的空间量化为一个大字典,适应了视觉领域。我们在填充和生成任务上演示了该方法。第一次,我们展示了在自然视频上训练后,这样一个模型可以预测短视频序列中的非平凡运动。
完成下面两步后,将自动完成登录并继续当前操作。