3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知

3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知

💡 原文中文,约4600字,阅读约需11分钟。
📝

内容提要

AI联汇完成数亿元融资并开源端侧原生模型VLX-Seek 1.5,旨在填补物理AI端侧原生路线空白。该模型从架构设计即考虑端侧约束,通过流式多模态实现低延迟、低成本部署,在无人机等场景性能超越同规模模型,并减少目标幻觉。此举类比云原生早期,意在定义物理AI基础设施标准,推动AI规模化进入真实设备。

🔎

延伸解读

端侧原生与端侧部署的本质区别

文章强调,端侧原生并非简单的端侧部署。传统做法是先训练云端大模型,再通过压缩、蒸馏、量化等手段适配端侧,模型本质上仍依赖云端。而端侧原生从架构设计之初就将端侧算力、延迟、功耗和部署成本作为约束条件,模型天生适合端侧环境。这种区别决定了物理AI能否大规模、低成本地走出实验室,进入工厂、家庭等真实场景。

流式多模态架构的优势

VLX-Seek 1.5采用流式多模态架构,接收视频流持续输入,实现端侧实时理解和动态输出决策,区别于传统VLM的批处理模式(拍照-上传-推理-返回)。这种架构降低了延迟和带宽依赖,避免了将连续物理世界切割成静态快照,从而在无人机视角、小目标检测等场景中展现出效率优势,验证了架构创新对单位参数价值的提升。

目标幻觉指标对高可靠场景的意义

文章引入目标幻觉指标(FP/GT),衡量模型是否产生不存在目标的误报。在RefDrone测试中,VLX-Seek 1.5的FP/GT为18,远低于对比模型的71.3。对于安防机器人、无人机巡检等高可靠场景,误报可能比漏报更危险,因为错误判断可能触发错误动作。模型在信息不足时敢于拒绝识别,是智能进入物理世界的重要标志。

开源与融资背后的生态战略

Om AI联汇通过开源VLX-Seek 1.5争夺物理AI基础能力标准的定义权,类比Kubernetes通过免费标准建立行业共识。融资则代表资本对端侧原生范式的投票。公司已构建OmAgent平台、OttoPlex御行、OttoBox AI Studio和Homer AI等生态,服务近10万视障用户,月均AI调用千万次,旨在成为端侧原生智能时代的基础设施提供者。

Q&A

Om AI联汇最近有什么重要动态?

Om AI联汇于8月6日完成数亿元融资,由前海母基金领投,并开源了全球首款端侧原生模型VLX-Seek 1.5。

什么是端侧原生模型?它与端侧部署有何不同?

端侧原生模型在架构设计阶段就将端侧算力、延迟、功耗和部署成本作为约束条件,而非像端侧部署那样先训练大模型再压缩适配。它天生适合端侧环境,能实现更快响应、更低成本和更强自主性。

VLX-Seek 1.5的流式多模态架构有什么优势?

VLX-Seek 1.5采用流式多模态架构,接收视频流持续输入,在端侧实时理解并动态输出决策,相比传统批处理模式(拍照上传云端)降低了延迟和带宽依赖,并保护隐私。

VLX-Seek 1.5在评测中表现如何?

VLX-Seek 1.5-3B在通用检测任务中LVIS Mean达57.5,比同规模模型提升13.4%;在指代表达理解任务中RefCOCOg test Mean达80.2,提升3.4%;在无人机视角的RefDrone测试中F1达73.2,提升40%,实例准确率提升62.9%。

VLX-Seek 1.5如何减少目标幻觉?

VLX-Seek 1.5引入目标幻觉指标(FP/GT),在RefDrone测试中FP/GT为18,远低于对比模型的71.3,显著减少误报,提升高可靠场景的安全性。

Om AI联汇开源VLX-Seek 1.5的战略目的是什么?

开源旨在争夺物理AI基础能力标准的定义权,类比云原生早期,通过免费开放标准吸引开发者,形成生态飞轮,最终成为端侧原生智能时代的基础设施提供者。

Om AI联汇构建了哪些端侧智能生态产品?

包括OmAgent智能体平台、OttoPlex御行、OttoBox AI Studio(与联想、苹果合作)以及Homer AI可穿戴视觉中枢,后者已服务近10万视障用户,月均AI调用千万次。

🏷️

标签

➡️

继续阅读