京东开源实时流式视频编辑新模型,为多领域创作与具身智能发展添动力

   发布时间:2026-08-05 19:03 作者:唐云泽

在视频创作领域,一项突破性技术正引发变革。京东近日宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit,该模型通过创新性的实时交互设计,将传统视频编辑的"素材预处理"模式转变为"边播放边创作"的动态流程,为影视制作、直播电商、家装设计等行业带来全新解决方案。

技术突破首先体现在处理效率上。针对视频编辑常见的卡顿延迟问题,研发团队基于全自研架构实现了720P分辨率下30帧/秒的实时推理能力。这意味着在保持画面清晰度的同时,模型能够精准同步视频播放节奏,即使处理复杂场景切换也能保持流畅。更引人注目的是其突破性的时长支持能力,不同于传统模型仅能处理短片段的限制,该系统可实现不限时长的持续编辑,用户无需等待完整视频生成即可在播放过程中实时调整画面元素。

在实际应用场景中,这项技术展现出强大适应性。直播场景下,主播可即时更换服装展示效果;影视创作中,导演能动态调整场景风格和人物造型;家装设计领域,设计师可实时切换家具款式与装修风格。测试数据显示,在服装更换、场景迁移等典型任务中,系统响应速度较传统方法提升3倍以上,编辑精度达到98.7%的像素级匹配度。

在技术评估环节,JoyAI-Video-Edit展现出全面优势。与国际主流模型对比测试中,该系统在OpenVE-Bench权威评测中取得综合得分领先17.6%的优异成绩,特别是在风格迁移、物体替换等核心指标上表现突出。研发团队透露,这得益于其独创的动态注意力机制,能够精准识别视频中的时空关联要素,在保持编辑实时性的同时确保画面逻辑连贯性。

这项技术的价值远不止于视频创作领域。在具身智能训练场景中,系统可将人类操作视频转化为机器人训练素材,通过保留动作轨迹的同时替换执行主体,单段视频可扩展出数十倍的有效训练数据。这种数据合成方式大幅降低了机器人训练成本,为工业自动化、服务机器人等领域提供了创新解决方案。

随着JoyAI-Video-Edit的开源,京东已构建起完整的物理世界模型体系。该体系涵盖图像编辑、长视频生成、实时交互、语音处理、机器人操控等多个维度,形成从感知到决策的技术闭环。此次开源不仅为开发者提供先进工具,更通过开放模型能力推动AI技术在实体经济的深度应用,标志着人工智能从数字世界向物理世界渗透迈出关键一步。

 
 
更多>同类内容
全站最新
热门内容
本栏最新