➡️
继续阅读
-
模型路线趋同之后,Physical AI的胜负手变了
物理AI面临数据、认知、行动与真实世界间的三层断裂,需建立持续学习闭环。元戎启行成立Superfluid Lab,以基座模型为核心,整合VLA、世界模型和...
-
我用一个 skill 把视觉活外包了(模型看不了图)
作者介绍了一种解决AI模型不支持多模态图片识别的方法:通过skill调用外部多模态模型API,将识别结果返回给当前会话模型。整个流程对用户无感,代码包含S...
-
马斯克的新生图模型,让我笑了一整晚
马斯克推广的Imagine Image 2.0生图模型,凭借交互式精准编辑和表情包生成功能出圈,支持图层分离、魔棒工具及多图融合,但审核严格。同时,Ope...
-
ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活
ω-0是一种用于人形机器人并行行走与操作的世界动作模型,通过潜在预测而非视频生成来学习全身协同控制。它联合训练未来视觉潜变量与全身动作潜变量,避免依赖大型...
-
NVIDIA 发布 NemotronLabs VoiceChat 11B:一款开放式全双工语音对语音模型
NVIDIA发布开源11B端到端语音模型NemotronLabs VoiceChat 11B,支持实时全双工对话,延迟仅448毫秒,可插话和调用工具。需8...
-
3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知
AI联汇完成数亿元融资并开源端侧原生模型VLX-Seek 1.5,旨在填补物理AI端侧原生路线空白。该模型从架构设计即考虑端侧约束,通过流式多模态实现低延...