京东开源自研实时流式视频编辑模型JoyAI-Video-Edit:让视频“边播边改”
8月5日,京东宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit,用户可一边观看视频一边修改人物与场景,实现“边观看边创作”的实时互动编辑体验。官方表示,在流式实时视频编辑方向,该模型各项指标全面领先,达到世界一流水平。
视频实时编辑的关键在于速度。JoyAI-Video-Edit基于全自研JoyAI-Video模型,在720P分辨率下实现每秒30帧的模型推理速度——这意味着模型处理画面的速度与视频标准播放速度(24-30帧/秒)基本同步,能够在保持较高画面清晰度的同时,跟上常见影视视频的播放节奏。
此前流式编辑模型只能处理几秒或分钟级片段,而JoyAI-Video-Edit支持任意时长的稳定流式编辑,可随视频持续播放、持续处理。用户无需等待整段视频生成完成,即可实时修改场景、替换物体、调整人物形象或改变画面风格。
研究团队将JoyAI-Video-Edit与SANA Streaming、LiveEdit、Xmax-X2.0等国际代表性流式视频编辑模型进行对比,结果显示整体效果全面领先。在业界权威的OpenVE-Bench通用评测中,模型超越了目前所有流式编辑方法,在全局风格、局部替换、局部删除和字幕编辑等任务中优势尤为突出。
除视频创作外,JoyAI-Video-Edit还可应用于具身智能数据大规模合成。机器人训练需要大量物体抓取、搬运与操作视频,但真机数据采集成本高,危险场景难以反复采集。借助对场景、物体与画面内容的可控编辑能力,模型可将人手操作视频转化为机械手或机械臂操作素材,在保留物体位置、空间关系与动作轨迹的基础上,替换场景、物体与机器人形态,使一段视频扩展出更多训练样本。
JoyAI-Video-Edit的开源将降低实时视频编辑的技术门槛,为内容创作者和AI研究人员提供可直接使用的工具。模型已在GitHub和Hugging Face上开放下载。