内容提要
京东在WAIC展示物理AI最新成果,推出JoyAI全系列大模型,覆盖视觉、语音、交互和具身智能,并开源EgoLive数据集。通过具身数据采集闭环和JoyInside系统,AI已从屏幕走向工厂、家庭等真实场景,实现感知、理解、决策到执行的完整闭环,推动物理世界智能化。
延伸解读
物理AI的落地关键:数据质量比数量更重要
文章指出,京东的实验显示,用1万小时高质量数据训练的模型效果优于用1万小时有瑕疵数据训练的模型,且瑕疵数据越多,模型效果可能越差。这说明在具身智能领域,数据质量比数量更关键。对于关注AI发展的读者,这意味着在数据采集和训练中,应重视数据的准确性和完整性,而非单纯追求规模。
家庭场景:物理AI最难啃的骨头
文章对比了工厂与家庭场景的差异:工厂任务边界清晰,而家庭环境充满不确定性,如孩子哭闹、老人起夜、宠物挡路等,难以穷举。因此,家庭被视为物理AI最具战略价值也最难进入的场景。京东通过JoyInside系统,将AI能力嵌入台灯、床垫等设备,试图以“积木式机器人”思路应对这一挑战,展示了物理AI在复杂场景中的落地路径。
第一视角数据:具身智能的规模化之路
京东选择第一视角数据采集,因其能同时记录环境、动作和任务意图,且减少对特定机器人本体的依赖,更适合规模化。其开源的EgoLive数据集包含2000小时视频,覆盖346项任务,并在实际应用中使任务准确率提升两位数。这表明第一视角数据是推动具身智能从实验室走向现实的有效途径。
Q&A
京东在WAIC 2025上展示了哪些物理AI相关成果?
京东在WAIC上首次集体亮相了JoyAI全系列大模型,包括视觉、语音、交互和具身智能模型,并开源了行业最大的人类第一视角数据集EgoLive。同时展示了具身数据采集与训练链路,以及以JoyInside为底座打造的京东AI Home。
JoyAI全系列大模型包含哪些具体模型?它们分别有什么功能?
JoyAI全系列包括:视觉模型如JoyAI-Image-Edit(实现视角变换、空间漫游与几何一致性编辑)、JoyAI-Echo(跨模态记忆维持长视频一致性)、JoyAI-VL-Interaction(毫秒级理解和响应,支持实时交互)、实时视频编辑模型JoyAI-Video-Edit(支持预览中实时修改);语音模型如JoyAI-Voice(语音生成基础模型)和JoyAI-Talker(识别情绪与意图,支持低延迟交互和打断);具身智能模型JoyAI-RA(移动操控基础模型,统一训练框架对齐机器人与人类操作经验)。
为什么京东认为具身数据采集很重要?他们是如何构建数据闭环的?
京东认为模型能力是智能上限,但真实世界任务需要物理经验。他们通过实验发现,有瑕疵的数据即使规模再大,模型效果也不会提升甚至变差,因此高质量数据至关重要。京东构建了“数据采集—模型训练—真机验证—反哺采集”的闭环,并建设了全球最大具身数据采集中心,发动60万人参与,预计2年内采集1000万小时人类真实数据。同时构建了覆盖采、存、标、训、评、仿、测的全链路基础设施。
京东开源的EgoLive数据集有什么特点?为什么采用第一视角?
EgoLive是行业最大的人类第一视角数据集,包含2000小时视频、65866个Episode,覆盖346项真实世界任务。采用第一视角是因为它能同时保留环境信息、动作过程与任务意图,减少对特定机器人本体的依赖,更适合规模化采集。实际应用中,使用第一视角数据和机器人数据后,任务准确率实现了两位数的提升。
JoyInside是什么?它如何赋能智能硬件?
JoyInside是京东将JoyAI大模型能力封装成的AI大脑,定位为连接模型与硬件的AI System。它将感知、理解、记忆和交互能力接入具体设备,处理语音识别、意图理解、长期记忆和多设备协同。目前接入JoyInside的智能硬件对话轮次平均提升超过120%,合作品牌近200个,预计今年接入超过千万台终端设备。
京东在WAIC上如何展示具身智能从数据采集到真机验证的闭环?
参观者可以戴上京东自研的超高清采集终端JoyEgoCam,在货架前完成真实作业,以第一视角记录操作过程。这些数据经过自动标注、质量优化和结构化处理后,送入数字孪生环境训练、评测,最后部署到实体机器人上,现场演示了完整的闭环流程。
为什么家庭场景被认为是物理AI最难进入的场景?京东如何应对?
家庭场景存在设备多样、系统各异、数据分散,以及人和环境变化难以预测等问题,如孩子哭闹、老人起夜、宠物挡路等,难以穷举。京东通过JoyInside将模型能力接入具体设备,将家庭设备视为“积木式机器人”,让它们协同感知和行动,例如智能睡眠床垫和AI投影台灯,实现感知、理解、反馈的闭环。