它石智航发布通用具身大模型AWE3.7,统一系统贯通工业、物流、家庭等场景,实现精细操作、动态感知与移动协同。模型基于超百万小时数据训练,已在产线落地,并获吉尼斯纪录和WAIC奖项,验证了具身智能通用化路径的可行性。
香港科技大学与澳门大学提出SkillProx框架,用于智能体技能演化,采用前向-后向双阶段优化:前向闭环诊断验证编辑效果,后向近端精炼审计并压缩冗余知识。在SpreadSheetBench、WikiTQ和HiTab基准上,相比基线平均提升约3个百分点,分布外泛化显著更稳,但评估限于结构化表格场景,存在计算开销和过拟合风险。
MoMo是一种两阶段模仿学习框架,包含时空动作分词器和行为克隆变换器,通过输入任务和连续运动模式条件,控制机器人操作中的动作执行方式。在六个真实机器人操作任务中,该框架能产生稳定、动态及中间行为,且人类可区分。即使任务仅以单一模式演示,MoMo也能迁移未见模式,保持任务成功率,展示了对任务-模式组合的泛化能力。
本文探讨了语言模型“束具”(harness)在组合泛化中的关键作用。通过递归语言模型(RLM)设计,将复杂任务分解为局部分布内的子调用,训练短任务可泛化至8-32倍长任务,并跨领域迁移。相比直接训练Transformer,RLM显著提升泛化能力,表明束具可编码高层归纳偏置,降低数据成本,是提升扩展回报的核心。
本文介绍视觉概念推断任务(VICIS),要求模型从少量示例图像中提取共享概念,并应用于新查询图像生成。现有视觉语言模型在此任务上表现不佳,常忽略视觉上下文或产生偏见输出。作者提出训练框架和架构,学习从图像集合推断概念并提取查询特定嵌入。实验表明,该方法在合成数据和ImageNet/WordNet数据上生成更准确多样,且能泛化至未见概念和草图等模态。
这篇文章探讨了生命进化与人工智能大模型之间的相似性,强调泛化能力的出现是进化的重要飞跃。复杂的基因调控网络使生物能够从经验中提炼规律,适应新环境,类似于大模型通过增加参数提升泛化能力。这一理论为理解生命的适应性和人工智能的发展提供了新视角。
银河通用机器人发布了AstraBrain-WBC 0.5,标志着人形机器人进入“GPT时代”。该模型基于20亿帧人类动作数据,具备全身实时运动控制能力,展现出强大的泛化性和稳定性,推动机器人从单一技能学习向通用运动生成转变。
微软 AI 团队提出了「爬山机器」框架,并训练了参数达到 1T 的 MoE 模型 MAI-Thinking-1。该模型通过自适应熵控制的强化学习,在无第三方数据的情况下实现了长期稳定的性能增长,并在多个基准测试中取得领先水平。
本文介绍了LARYBench,一个用于评估隐式动作表征的基准系统,旨在提升机器人在不同环境中的泛化能力。LARYBench分析了大规模人类视频数据,提供超过一百万段标注视频,涵盖151种动作,支持多样化的机器人形态和操作场景。实验结果表明,通用视觉模型在动作泛化和控制精度上优于专门模型,强调了隐式动作表征的重要性。
π0.7是一种新型通用机器人模型,具备强大的组合泛化能力。通过多模态数据和详细上下文标注,该模型能够有效执行多样化任务,并在新任务中展现灵巧技能。它结合了人类视频和机器人自主数据,提升了在复杂环境中的表现。引入子目标图像和任务元数据增强了模型的指令理解和执行能力,使其在多样化数据上训练时表现出色。
状态空间模型(SSMs)在序列建模中逐渐取代变换器,因其在长上下文生成中的高效性。研究表明,通过与外部工具互动,SSMs能够克服在“真正的长形式”生成中的局限,实现任意问题长度的泛化。这表明SSMs在交互式工具应用中可能成为变换器的高效替代方案。
RoboChallenge发布的Table30 V2旨在提升具身智能模型的泛化能力。新版本引入多任务、零样本测试和双臂协作,评测标准和系统吞吐量提升300%。该平台为全球研究者提供公平的竞技环境,推动具身智能的发展。
北京大学彭宇新团队提出了分类感知表征对齐方法TARA,旨在解决多模态大模型在生物类别分层识别中的挑战,提升细粒度和分层视觉识别的准确率。该方法通过对齐大模型与生物基础模型的表征,注入类别树知识,从而增强模型的识别能力。
本文探讨了电子商务搜索中的稀疏嵌入微调,分析了专业化与泛化的权衡。研究表明,专注于特定领域的微调在单一零售商中效果最佳,而多领域训练则在多个零售商中更具泛化能力。微调模型能够更好地理解特定领域的搜索模式和词汇,从而提升搜索效果。
EMBridge是一个跨模态表示学习框架,旨在通过将表面肌电信号(sEMG)与高质量结构化数据对齐,提升手势识别的准确性。该框架采用查询变换器和对比学习目标,实现了零样本手势分类,展示了在可穿戴设备上进行手势识别的潜力。
GigaBrain-0是一种新型视觉-语言-动作(VLA)模型,旨在通过整合视觉输入、自然语言指令和运动控制,提升机器人在多样环境中的操作能力。该模型利用生成的数据,降低对真实世界数据的依赖,提高泛化能力和数据效率。GigaBrain-0采用混合架构,增强空间感知能力,并通过生成中间推理步骤,模拟人类问题解决过程,实现更精确的操作和决策。
RDT2是一种新型机器人基础模型,旨在实现跨本体、物体和场景的零样本迁移能力。通过使用UMI数据集和三阶段训练策略,RDT2能够高效处理多样化的真实世界任务,提升机器人在未见物体和场景中的泛化能力。该模型在微调实验中表现优异,尤其在复杂操作和动态任务中,展现出显著的性能提升。
AI短名单是对长篇文章的简要概述,旨在提炼出核心信息。
Google DeepMind推出SIMA 2,这是一种基于Gemini模型的通用智能体,能够在多个3D虚拟环境中理解和行动。与前版本相比,SIMA 2具备制定多步计划和与用户讨论策略的能力。研究显示,该智能体在游戏测试中接近人类表现,并能在新环境中自我改进。SIMA 2的应用潜力包括机器人领域,但仍面临复杂任务的挑战。
本研究探讨了语音基础模型在可穿戴传感器数据时间序列任务中的应用,发现该模型在情绪分类和心律失常检测等任务中表现优异。通过简单的探测方法,提升了数据稀缺时间序列任务的性能,促进了语音与传感器模态的统一发展。
完成下面两步后,将自动完成登录并继续当前操作。