8月5日,京东旗下技术团队推出自主研发的视频编辑工具JoyAI-Video-Edit。该模型可实现视频内容的即时修改,解决传统视频创作需提前准备素材的限制。
核心功能解析
用户可在观看视频过程中实时调整画面元素。例如在直播间场景中,主播可临时切换服装颜色或背景场景,无需等待后期剪辑。
模型支持动态修改人物造型与环境设定。对于服饰试穿场景而言,能实现不同颜色单品的即时演示效果。
技术指标对比
在流式处理领域,JoyAI-Video-Edit表现优于行业现有解决方案。既往测试显示其在帧率稳定性、修改响应速度等维度具有显著优势。
模型运算效率达到国际先进水平,可保障直播互动过程中视频质量不下降。技术团队称其已实现对多种视频格式的兼容处理。
应用场景示范
虚拟场景中,用户可即时生成不同服饰搭配效果。例如当主播展示白T恤时,观众可触发图像替换指令,系统随即呈现蓝T恤的视觉效果。
该功能适用于电商直播、影视制作等需要即时调整的场景。据技术团队描述,已与部分直播平台建立合作测试。
用户交互时延小于0.5秒,场景切换流畅度达98%以上。该模型已通过京东内部多轮压力测试。
行业影响说明
视频创作流程将发生结构性变化。传统线性制作模式被打破,实时交互编辑功能推动视频内容生产向即时性方向演进。

JoyAI-Video-Edit实现每秒30帧稳定视频处理能力
全新视频编辑技术JoyAI-Video-Edit突破传统流式处理限制,其核心依托全自研JoyAI-Video模型。在720P 分辨率 下达到每秒30帧的处理速度,使视频编辑过程同步于影视播放节奏。
视频帧技术解析
视频帧是构成动态影像的基本单元,每秒30帧意味着系统能连续处理30张独立画面。这种帧率标准可保障画面流畅度,避免因处理延迟导致的观看体验中断。
流式编辑能力突破
该技术提供持续处理功能,可应对任意长度的视频内容。与以往只能处理数秒至分钟级片段的系统相比,实现了对整段视频的实时编辑支持。
JoyAI-Video-Edit可同步进行场景修改、物体替换、人物形象调整及画面风格转换,用户无需等待整体生成即可参与创作。
技术架构说明
-
采用全自研模型架构,避免依赖第三方组件
-
通过GPU加速实现帧级处理能力
-
优化内存管理以支持长时序数据处理
-
构建反馈机制确保编辑操作实时响应
应用场景拓展
这项技术使视频创作进入全新阶段,可根据实际需求动态调整处理强度。在保持720P画质的前提下,系统能自动匹配不同分辨率的处理需求。
行业专家表示,该技术将显著缩短影视后期制作周期,使内容创作者能即时预览和调整作品效果。目前测试显示,复杂场景修改响应时间较传统方案缩短80%。

JoyAI-Video-Edit在流式视频编辑模型评测中全面超越国际同类产品
视频创作领域出现新突破。JoyAI-Video-Edit展示出多场景实时编辑能力,可实现服装连续更换、街道转场动画、家装效果预览等操作。该技术将视频制作从单次生成转变为可迭代调整流程。
评测对比数据揭示技术优势
研究团队组织国际模型对比测试,涵盖SANA Streaming 、LiveEdit、Xmax-X2.0等典型产品。结果显示JoyAI-Video-Edit在全部评测维度均取得领先。
在OpenVE-Bench通用评测中,JoyAI-Video-Edit超越现存所有流式编辑方法,特别是在全局风格调整、局部画面替换、元素删除及字幕编辑等任务表现突出。
技术逻辑拆解
该模型建立多阶段处理流程:首先解析原始视频流,其次识别特定场景特征,最后执行编辑指令并保持画面连贯性。此架构确保实时处理与精细控制兼顾。
-
全局风格任务:成功完成画面整体调色与氛围构建
-
局部替换能力:精准定位特定画面元素进行修改
-
字幕编辑效率:实现实时字幕生成与修改同步
行业影响评估
这一进展意味着视频创作者可直接在直播过程中完成特效添加,显著提升内容制作灵活性。技术突破使多平台视频编辑标准出现新基准,影响行业工具研发方向。

京东物理 世界模型 矩阵进一步完善JoyAI-Video-Edit的实时流式编辑能力,可为零售营销、家装设计、影视制作等大量真实场景带来新的技术支持:服装与商品展示视频可以快速更换人物穿搭、商品和背景;家装视频可以实时切换家具与装修风格;影视创作者也可以更快尝试人物造型、场景和视觉效果,减少重复拍摄与整段返工不止视频创作,JoyAI-Video-Edit还为具身智能数据大规模合成提供了新的技术路径。机器人训练需要大量物体抓取、搬运与操作视频,但真机数据采集成本较高,危险或少见场景也难以反复采集。依托对场景、物体与画面内容的可控编辑能力,JoyAI-Video-Edit可将人手操作视频转化为机械手或机械臂操作素材,并在保留物体位置、空间关系与动作轨迹的基础上,替换场景、物体与机器人形态,让一段视频扩展出更多训练样本。当前,京东正在加速建设全球最大物理世界运营中心,并已经形成面向物理世界的JoyAI模型矩阵:JoyAI-Image-Edit让AI理解与编辑空间,JoyAI- Echo 面向长音视频生成,JoyAI-VL-Interaction让AI持续观察并实时回应,JoyAI-Talker提供实时语音交互能力,JoyAI-RA面向机器人操控,形成覆盖语音、图像、视频、实时交互与具身智能的基础模型体系。JoyAI-Video-Edit进一步提升了实时视频编辑能力,并为具身智能大规模数据合成积累底层技术。JoyAI-Video-Edit模型的开源,标志着京东物理世界模型矩阵进一步完善。京东将持续向开发者与行业开放模型能力,让AI加速在物理世界发挥真正价值。
本文由 摸鱼不慌 发布,转载请注明出处。
文章链接:京东发布JoyAI-Video-Edit实时流式视频编辑模型 - 摸鱼不慌