实现视频“边播边改”,京东开源JoyAI-Video-Edit模型,性能全球领先

实现视频“边播边改”,京东开源JoyAI-Video-Edit模型,性能全球领先

💡 原文中文,约2000字,阅读约需5分钟。
📝

内容提要

京东开源实时流式视频编辑模型JoyAI-Video-Edit,支持720P下每秒30帧处理,可任意时长边看边改,性能领先同类。该模型应用于零售、家装、影视,并助力机器人训练数据合成,完善京东物理世界模型矩阵。

🔎

延伸解读

实时编辑的难点与突破

视频实时编辑的核心挑战在于处理速度与视频长度。传统模型难以在保持画质的同时跟上播放节奏,且只能处理短片段。JoyAI-Video-Edit通过自研模型实现720P下每秒30帧的推理速度,并支持任意时长稳定编辑,解决了这两大痛点,使“边播边改”成为可能。

应用场景与价值

该模型可应用于零售营销、家装设计、影视制作等场景,如快速更换商品穿搭、实时切换装修风格、尝试人物造型等,减少重复拍摄与返工。此外,它还能将人手操作视频转化为机器人训练素材,为具身智能数据合成提供新路径,降低数据采集成本。

性能对比与开源意义

在OpenVE-Bench等评测中,JoyAI-Video-Edit超越SANA Streaming、LiveEdit等代表性模型,在全局风格、局部替换等任务上优势明显,兼顾速度与质量。开源后,开发者可获取模型并探索更多应用,有助于推动视频编辑技术发展,完善京东物理世界模型矩阵。

Q&A

京东开源的JoyAI-Video-Edit模型主要解决什么问题?

JoyAI-Video-Edit是京东开源的实时流式视频编辑模型,主要解决视频编辑中无法实时修改的问题,让用户可以一边观看视频一边修改人物与场景,实现“边播边改”。

JoyAI-Video-Edit在性能上有哪些具体优势?

JoyAI-Video-Edit在720P分辨率下实现每秒30帧的模型推理速度,支持任意时长的稳定流式编辑,且对比SANA Streaming、LiveEdit等国际代表性模型,在OpenVE-Bench通用评测中全面领先,尤其在全局风格、局部替换、局部删除和字幕编辑等任务上优势突出。

JoyAI-Video-Edit可以应用于哪些实际场景?

JoyAI-Video-Edit可应用于零售营销(如服装展示快速更换穿搭)、家装设计(实时切换家具与装修风格)、影视制作(尝试人物造型和场景)等场景,还可用于机器人训练数据合成。

🏷️

标签

➡️

继续阅读