2026年8月5日,京东宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit。这是京东"物理世界模型矩阵"的又一重要拼图,其底层逻辑是将AI能力从"数字内容生成"延伸至"物理世界理解与操控"。
JoyAI-Video-Edit是什么
JoyAI-Video-Edit是一款实时流式视频编辑模型。与传统视频编辑工具"先有素材再修改"的工作流不同,JoyAI-Video-Edit允许用户一边观看视频,一边实时修改人物与场景。
这种"实时互动编辑"模式彻底改变了视频创作流程。用户无需等待渲染完成才能看到效果,而是可以即时调整并立即看到修改结果。对于C端内容创作者和B端零售营销场景,这种能力直接降低了视频生产门槛。
核心技术特点
- 实时流式处理:视频播放和编辑同步进行,无需等待渲染
- 人物与场景编辑:支持实时修改视频中的人物和场景元素
- 开源开放:模型完全开源,开发者可自由集成和二次开发
- 物理世界理解:底层具备物理世界理解能力,编辑结果符合物理规律
- 具身智能数据合成:可将人手操作视频转化为机械手/机械臂训练素材
应用场景
JoyAI-Video-Edit面向两类核心场景:
C端内容创作:个人创作者可以实时调整视频内容,无需掌握复杂的后期软件。直播切片、短视频剪辑、电商商品展示等场景都将受益。
B端零售营销:电商商家可以实时修改商品展示视频中的场景、模特、配色等元素,快速生成多版本营销素材。更具深意的是,JoyAI-Video-Edit的具身智能数据合成能力,可以将人手操作视频转化为机械手/机械臂训练素材,为机器人学习提供数据支持。
与竞品对比
对比Runway的Gen-3和可灵AI,JoyAI-Video-Edit的独特定位在于"实时流式"而非"离线生成"。它不是从零生成视频,而是对已有视频进行实时编辑。这种定位与Opus Clip的剪辑优化和Invideo AI的模板化创作形成差异化互补。
优缺点分析
优点:实时流式编辑无需等待、开源可自由集成、物理世界理解能力强、具身智能数据合成应用前景广阔。
缺点:目前仅发布模型,完整产品体验尚未上线、编辑精度和分辨率可能受限、复杂场景编辑效果待验证。
适合人群
JoyAI-Video-Edit最适合电商内容创作者、零售营销团队、具身智能研究者。对于需要快速迭代视频素材的电商从业者,实时编辑能力可以大幅缩短内容生产周期。开源策略也意味着开发者可以将其集成到自己的工作流中,打造定制化的视频编辑工具。
总结
JoyAI-Video-Edit的发布体现了京东从"电商公司"向"AI技术公司"的战略转型。实时流式视频编辑+物理世界理解+具身智能数据合成,这三层能力的叠加,使JoyAI-Video-Edit在视频编辑工具赛道中占据了独特的技术高地。对于视频创作者和AI开发者而言,这是一个值得密切关注和早期尝试的开源项目。