AWS公开了π0机器人的微调流程,称动作误差降低约89%。但早期评测因训练回合混入评测导致误差虚高至96%,修正数据切分后才可信。文章强调,关键在于训练与评测回合严格隔离,且89%仅为离线误差,不等于闭环任务成功率。
蚂蚁灵波与港科大联合提出Zero-WAM,一种因果视频-动作模型,通过上下文学习实现机器人零样本跨任务泛化。它利用人类视频作为任务描述,并构建HumanGen数据集(含8.6K任务、74.2K人机样本),提出上下文未来片段预测目标,避免模型走捷径,从而从视频中提取任务信息执行未见任务。
Facet-0是一种面向高精度接触操作的机器人基础模型,结合视觉-语言骨干与流匹配动作专家,联合预测动作及未来腕部扭矩,将接触视为可预测结果。基于ManuFacet-1K数据集训练,并通过Action–Wrench Critic评估交互价值,实现策略细化,提升装配可靠性。
BrowserSkill 通过 bsk CLI 和浏览器扩展,使 AI 能直接操作浏览器,在独立窗口中观察页面并执行点击、输入等动作。其录制功能可记录操作流程供 AI 学习,适合重复性后台任务。使用时需注意隐私,避免在敏感页面录制。
Generalist AI发布机器人基础模型GEN-1.5,支持一次性学习,机器人看3-12秒演示即可学会新任务,无需梯度更新或微调。模型能举一反三,结合不同演示,甚至从模拟器学后直接应用于现实。此能力源于大规模物理数据预训练,类似GPT-3的上下文学习,但成功率仅59%,提升至83%需额外微调。
本文介绍Tetragon v1.7.0的TracingPolicy选择器与动作机制。选择器内过滤器为AND关系,每个hook最多5个选择器,多个选择器采用first-match短路逻辑,默认动作为Post。matchArgs、matchBinaries等过滤器按路径或参数匹配,NoPost抑制事件但保留其他动作,Override和Sigkill在内核执行,GetUrl等动作在用户态执行。CEL-in-BPF有宏限制,最多8路表达式。
银河通用发布G0.5模型,采用单一自回归流同时处理推理与动作,替代主流VLA架构中VLM仅作编码器、另配动作专家的设计。该模型通过跨本体动作tokenizer、原生思维链和视觉记忆模块,实现推理与动作共享权重。真机微调成功率76.7%,优于π0.5和GR00T-N1.7,但BEHAVIOR基准绝对成功率仅31.4%,实验样本量小,评测协议多样,需谨慎看待。
本文介绍Claude Code的Cron家族工具(CronCreate/CronDelete/CronList),用于定时调度未来动作。核心是CronCreate,支持一次性或周期性任务,采用标准cron语法,仅限会话内有效,7天自动过期。设计强调复用行业约定、负载分散(避开整点)、诚实透明,与Task家族、Bash后台及Monitor工具分工明确,是唯一跨越时间的工具原语。
ω-0是一种用于人形机器人并行行走与操作的世界动作模型,通过潜在预测而非视频生成来学习全身协同控制。它联合训练未来视觉潜变量与全身动作潜变量,避免依赖大型视频生成器。模型利用人类数据预训练,并构建ω-HOME数据集,在11个家庭任务上实现统一模型控制,展现平滑的全身协调能力。
该论文提出w-0模型,联合预测未来视觉与全身动作,解决人形机器人并发运动操作难题。在11个家庭任务上优于9种基线,发布40小时w-HOME数据集。模型分三阶段训练,结合VLM与V-JEPA,支持多视角输入。局限是硬件耦合、延迟高、缺安全机制,未来需验证跨平台泛化。
MiniCPM推出具身智能模型系列,包括15亿参数的机器人操作模型和0.9B参数的目标跟踪模型,实现端到端映射与实时跟踪。HyperAI官网更新了9个数据集、8个教程等资源,涵盖数学推理、视觉推理等领域,并精选社区文章和百科词条。
谷歌DeepMind发布Gemini Robotics 2,可控制人形机器人全身动作,从脚趾到指尖,支持行走、蹲下、伸展及操作物体。新模型提升手部灵活性,能完成密封袋、拧灯泡等精细任务。同时升级Gemini Robotics ER 2,增强多步骤任务和安全性,并支持多机器人协作。
MoMo是一种两阶段模仿学习框架,包含时空动作分词器和行为克隆变换器,通过输入任务和连续运动模式条件,控制机器人操作中的动作执行方式。在六个真实机器人操作任务中,该框架能产生稳定、动态及中间行为,且人类可区分。即使任务仅以单一模式演示,MoMo也能迁移未见模式,保持任务成功率,展示了对任务-模式组合的泛化能力。
Go 1.28 计划引入泛型集合类型,由七位核心开发者提出,包括哈希 Set/Map、有序树形 Map、泛型堆等七个组件,解决标准库集合类型缺失问题。提案采用 F-bounded 多态设计抽象接口,兼顾兼容性与性能,若通过将显著简化开发,但仍在提案阶段。
Robo-ValueRL提出统一框架,研究离线到在线强化学习中价值估计可靠性对策略优化的影响。它训练历史条件价值估计器,用全局进度和局部偏好指标评估可靠性,并用于质量条件预训练和在线残差自适应。实验显示,可靠价值函数能提升动作质量估计,稳定在线提升,使芯片插入成功率达86%。
BeingBeyond发布首个基于人类视频数据的隐式触觉世界动作模型Being-H0.8,将触觉纳入“预测-执行-反馈”链路。模型通过TactoHand从无触觉标注视频中推断接触,通用触觉编码器统一信号,TopoHand对齐动作,并利用超50万小时数据训练,实现包中取物、毛笔写字等精细任务。
Black Forest Labs发布FLUX 3多模态模型,统一学习图像、视频和音频,基于Self-Flow方法。视频生成最长20秒含原生音频,在偏好测试中优于多数竞品,但训练计算超95%用于视频。访问受限,优先开放视频和动作内容。
星尘智能发布了第二代具身基座模型Lumo-2和物理AI智能体Philia。Lumo-2通过预测物理变化提升机器人在家庭任务中的能力,涵盖22项家务。Philia整合多台机器人,关注用户体验,提供长期服务。这两者共同推动具身智能进入系统工程阶段,强调技术与用户体验的结合。
VT-WAM是一种视觉-触觉世界动作模型,旨在提升机器人在复杂环境中的操作能力。它结合视觉和触觉信息,通过非对称MoT注意力和接触门控机制优化动作预测,强调触觉动态的重要性,以克服视觉信息的主导偏差。
蚂蚁灵波于7月10日发布了LingBot-VA 2.0,标志着机器人基础模型从数字世界向物理世界的转变。该模型通过自回归架构和因果预训练,提升了执行速度和泛化能力,解决了具身智能的效率问题。LingBot-VA 2.0设计包括语义视觉-动作分词器和增强的异步推理机制,确保机器人在真实环境中高效执行任务。蚂蚁灵波将继续探索具身智能的潜力,并将在2026世界人工智能大会展示其技术成果。
完成下面两步后,将自动完成登录并继续当前操作。