15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge

15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge

💡 原文中文,约6400字,阅读约需16分钟。
📝

内容提要

MiniCPM推出具身智能模型系列,包括15亿参数的机器人操作模型和0.9B参数的目标跟踪模型,实现端到端映射与实时跟踪。HyperAI官网更新了9个数据集、8个教程等资源,涵盖数学推理、视觉推理等领域,并精选社区文章和百科词条。

🔎

延伸解读

小模型具身智能的潜力与局限

MiniCPM-Robot系列以15亿和9亿参数实现机器人操作与目标跟踪,展示了小模型在具身智能中的高效推理潜力。但文章未提供实际性能数据或与更大模型的对比,因此其真实能力仍需进一步验证。轻量化架构和高效视觉压缩技术是亮点,但端到端映射的泛化性和鲁棒性尚不明确。

数据集与教程的实用价值

HyperAI本周更新了9个数据集和8个教程,覆盖数学推理、视觉推理、语音修复、图像生成等领域。这些资源为研究者提供了多样化的训练和评估工具,例如MathNet支持多语言多模态数学推理,Nemotron系列提供大规模数学推理数据。教程则包括具身智能、语音修复等前沿模型,便于快速上手。

社区文章揭示的AI科研自动化趋势

两篇社区文章分别展示了LLM在计算化学和同步辐射实验中的自动化应用。阿贡实验室的ChemGraph通过任务拆解让小模型也能达到大模型水平,斯坦福的AI X射线科学家则实现了自主实验操作。这些案例表明,AI正从辅助分析走向自主执行复杂科研任务,但实际部署仍需处理真实环境中的不确定性。

Q&A

MiniCPM-RobotManip是什么?它的参数量和主要功能是什么?

MiniCPM-RobotManip是MiniCPM-Robot系列中的机器人操作模型,参数量为15亿,是一个视觉语言动作模型,基于MiniCPM-V 4.6视觉语言骨干和扩散动作头,实现从视觉观察和语言指令到机器人动作的端到端映射。

MiniCPM-RobotTrack是什么?它的参数量和特点是什么?

MiniCPM-RobotTrack是MiniCPM-Robot系列中的目标跟踪模型,参数量为0.9B,聚焦实体目标跟踪,实现端侧实时视觉跟踪能力。

MiniCPM-Robot系列模型有哪些技术特点?

MiniCPM-Robot系列模型采用轻量化架构、流式上下文记忆和高效视觉压缩技术,展现了小规模模型在真实机器人场景中的高效推理潜力。

MiniCPM-Robot系列模型在HyperAI官网可以如何获取?

HyperAI超神经官网已上线了「MiniCPM-Robot:面向真实世界的具身智能模型」,用户可以在线使用,并提供了在线运行链接。

HyperAI官网在7月25日至7月30日更新了哪些内容?

HyperAI官网在7月25日至7月30日更新了9个优质公共数据集、8个优质教程精选、2篇社区文章解读、5条热门百科词条,并公布了6个8月截稿的顶会。

Math-Graph数据集是什么?它包含哪些内容?

Math-Graph是由华盛顿大学数学人工智能实验室于2026年发布的数学定理依赖图数据集,构建了语句级粒度的数学定理依赖图,包含47,952条非形式化与形式化数学的语句匹配对,覆盖论文元数据、数学语句、依赖关系边以及LLM生成的自然语言描述数据。

Nemotron-SFT-Math-v4数据集的特点和用途是什么?

Nemotron-SFT-Math-v4是NVIDIA于2026年5月发布的数学推理数据集,包含545,431条训练样本,涵盖COT思维推理和TIR工具推理样本,覆盖代数、几何、数论、组合数学等场景,用于大模型数学推理微调、推理轨迹分析、答案校验算法研发等。

MathNet数据集是什么?它支持哪些基准任务?

MathNet是MIT团队联合阿卜杜拉国王科技大学等机构于2026年发布的大规模多语言、多模态数学推理数据集,包含27,817道专家级数学试题,覆盖58个国家和地区、17种语言,支持数学问题求解、数学语义检索和检索增强问题求解三个基准任务。

CHIMERA数据集是什么?它有什么特点?

CHIMERA是一个专为推理训练设计的合成推理数据集,涵盖广泛的STEM学科,包含9,225个问题,8个学科,所有示例均由LLM生成并通过自动验证,无需人工标注。

VisCoR-55K数据集是什么?它包含哪些类别?

VisCoR-55K是由华中科技大学联合阿里云于2026年发布的高质量视觉推理数据集,包含约55,000个视觉推理样本,涵盖通用、推理、数学、图表及OCR五大类别,旨在促进视觉语言模型在可信且稳健的视觉推理方面的研究。

🏷️

标签

➡️

继续阅读