京东开源JoyAI-Video-Edit模型:实时流式编辑

   发布时间:2026-08-06 17:12 作者:柳晴雪

在视频创作领域,实时流式编辑一直是个技术难题。传统视频编辑往往需要提前准备好素材,再进行后期处理,过程繁琐且耗时。然而,京东近期开源的自研实时流式视频编辑模型JoyAI-Video-Edit,为这一领域带来了革命性的突破。该模型允许用户在观看视频的同时进行编辑,实现了视频创作的实时互动性,让视频创作从“先有素材再修改”转变为“边观看边创作”。

JoyAI-Video-Edit的出色表现,得益于其基于全自研的JoyAI-Video模型。在720P分辨率下,该模型能够实现每秒30帧的推理速度,确保视频处理的高效与流畅。这一速度不仅跟上了常见影视视频的播放节奏,还保持了较高的画面清晰度,有效避免了卡顿与延迟问题。该模型还突破了视频长度的限制,支持任意时长的稳定流式编辑。这意味着用户无需等待整段视频生成完成,就能在播放过程中实时修改场景、替换物体或调整人物形象,极大地提升了视频创作的灵活性和效率。

在实际应用中,JoyAI-Video-Edit展现出了强大的编辑能力。无论是让视频中的人物连续更换服装,还是在直播中将普通街道变成动画世界,亦或是在家装设计中尝试不同的家具、墙面和灯光效果,该模型都能轻松应对。这些功能不仅为创作者提供了更多的创作空间,也为观众带来了更加丰富的视觉体验。

为了验证模型的性能,研究团队将其与SANA Streaming、LiveEdit、Xmax-X2.0等国际上有代表性的流式视频编辑模型进行了对比。结果显示,在覆盖典型视频编辑场景的评测数据中,JoyAI-Video-Edit整体效果全面领先。特别是在全局风格、局部替换、局部删除和字幕编辑等任务中,该模型展现出了显著的优势,大幅领先行业同类模型。这表明,JoyAI-Video-Edit在保持实时流式处理优势的同时,也能准确理解编辑意图、稳定完成多类常用编辑任务,兼顾了编辑速度与画面效果。

JoyAI-Video-Edit的实时流式编辑能力,不仅为视频创作领域带来了新的技术支持,还为零售营销、家装设计、影视制作等大量真实场景提供了创新的解决方案。例如,在服装与商品展示视频中,可以快速更换人物穿搭、商品和背景;在家装视频中,可以实时切换家具与装修风格;在影视创作中,也可以更快尝试人物造型、场景和视觉效果,减少重复拍摄与整段返工的成本和时间。

JoyAI-Video-Edit还为具身智能数据大规模合成提供了新的技术路径。在机器人训练中,大量物体抓取、搬运与操作视频是必不可少的。然而,真机数据采集成本较高,且危险或少见场景难以反复采集。依托JoyAI-Video-Edit对场景、物体与画面内容的可控编辑能力,可以将人手操作视频转化为机械手或机械臂操作素材,并在保留物体位置、空间关系与动作轨迹的基础上,替换场景、物体与机器人形态,从而扩展出更多的训练样本。

随着JoyAI-Video-Edit模型的开源,京东的物理世界模型矩阵得到了进一步完善。目前,京东已经形成了面向物理世界的JoyAI模型矩阵,包括JoyAI-Image-Edit、JoyAI-Echo、JoyAI-VL-Interaction、JoyAI-Talker和JoyAI-RA等基础模型,覆盖了语音、图像、视频、实时交互与具身智能等多个领域。JoyAI-Video-Edit的加入,进一步提升了京东在实时视频编辑领域的能力,并为具身智能大规模数据合成积累了底层技术。京东将持续向开发者与行业开放模型能力,推动AI技术在物理世界的广泛应用。

 
 
更多>同类内容
全站最新
热门内容
本栏最新