内容提要
前字节跳动强化学习专家孙鹏博博士加入星尘智能,负责机器人强化学习研发,将强化其全栈体系,推动机器人在真实环境中持续学习与部署,实现从Demo到稳定商业化的突破。
延伸解读
强化学习为何重回具身智能中心
文章指出,过去两年机器人基础模型主要解决“会不会”,而随着机器人从Demo走向真实部署,问题转向“能不能稳定做好”。强化学习能让机器人根据真实执行结果持续修正策略,因此重新成为行业关注焦点。孙鹏的加入正是为了强化这一环节,推动机器人在真实环境中持续学习与部署。
孙鹏的技术路径与星尘智能的协同
孙鹏的履历覆盖机器人强化学习、大规模RL系统及大模型后训练,与星尘智能的“AI模型+具身OS+绳驱本体”全栈体系高度契合。他曾在腾讯开发《星际争霸》AI,在字节主导ByteRL基础设施,并参与大模型RLHF与强化微调,这些经验将助力星尘智能将大模型时代的RL后训练方法应用于真实机器人执行与数据闭环。
从Demo到稳定商业化的关键挑战
文章强调,机器人从演示到商业化部署的核心挑战在于稳定性和持续优化。孙鹏的加入旨在解决“训练之后”的问题,即如何让机器人在真实世界中通过交互反馈不断改进策略。这不仅是技术问题,也涉及数据闭环和长期部署,星尘智能的Lumo系列基座模型和Philia Agent已为此奠定基础。
Q&A
孙鹏博士在加入星尘智能之前有哪些主要经历?
孙鹏博士毕业于清华大学,曾在康奈尔大学和罗格斯大学从事博士后研究。他曾在腾讯AI Lab及Robotics X实验室担任智能体中心负责人,研发了《星际争霸》AI智能体TStarBots等。在字节跳动期间,他主导开发了强化学习基础设施ByteRL,并参与了ReFT等大模型后训练研究。
孙鹏加入星尘智能后将主要负责什么工作?
孙鹏将重点负责机器人强化学习方向的技术研发与应用探索,并扩充机器人强化学习团队,推动相关技术能力提升和应用部署。
为什么强化学习在机器人领域重新受到关注?
过去两年机器人基础模型主要解决“会不会”的问题,但随着机器人从Demo走向真实部署和商业化,问题转向“能不能稳定做好”,需要机器人根据真实执行结果持续修正策略,因此强化学习重新回到行业关注的中心。
星尘智能的全栈技术体系包括哪些部分?
星尘智能的全栈技术体系包括AI模型、具身OS和绳驱机器人本体,具体包括基座模型Lumo系列、前端共生Agent Philia,以及强化学习后训练环节。
孙鹏在字节跳动期间有哪些技术成果?
孙鹏主导开发了核心强化学习基础设施ByteRL,支撑多款自研游戏AI的高效训练;其团队曾夺得IEEE CoG 2023策略卡牌AI竞赛冠军,研发的《炉石传说》AI展现出击败行业顶尖选手的水平。此外,他还参与了ReFT和DeltaProver等项目。
孙鹏的加入对星尘智能有何意义?
孙鹏的加入将强化星尘智能在机器人强化学习方向的布局,并与AI模型、具身OS和绳驱机器人本体形成协同,推动机器人在真实世界中持续学习、不断进化,是夯实机器人模型“训练之后”的关键一环。
孙鹏在强化学习领域的研究路径是怎样的?
孙鹏的研究路径从机器人强化学习拓展至大规模RL系统,再到大模型后训练,始终围绕如何让智能体通过环境交互与反馈不断学习并优化策略。