资讯动态

实时视频编辑终于来了:JoyAI-Video-Edit项目概览与6大开放式编辑能力完全解析

发布时间:2026/8/24 16:25:31 来源:尧图企业网站定制
实时视频编辑终于来了JoyAI-Video-Edit项目概览与6大开放式编辑能力完全解析【免费下载链接】JoyAI-Video-Edit[Official Repo] JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion项目地址: https://gitcode.com/gh_mirrors/jo/JoyAI-Video-EditJoyAI-Video-Edit 是一个实时、指令驱动、开放式视频编辑系统给它一路实时摄像头流或一段上传的视频再加一句自然语言编辑指令它就会在画面帧到达的瞬间完成编辑无需等整段视频下载完毕、无需预设视频长度、更不会回看未来帧。在官方部署基准中它在 720×1248 分辨率下端到端达到30 FPS真正把视频编辑从离线批量处理推进到了交互式流式生成。上图就是项目的门面左侧展示直播画面LIVE与编辑结果EDIT几乎同步产出右侧的 OpenVE-Bench 对比图显示JoyAI-Video-Edit 在编辑质量与吞吐量30 FPS上同时领先人工评估得分更是以 1.00 对 0.14 大幅甩开其他流式方案。它是怎么做到实时的系统由三块核心组成源码位于deploy/xvideo/models/目录组件作用通俗理解MLLM 条件编码器MiMo-VL理解你的自然语言编辑指令听懂把狗变成白色这句话因果视频 VAE逐帧压缩/重建画面视频的即时翻译器16B 多模态扩散 TransformerMMDiT执行扩散编辑真正的剪辑师在此之上项目做了一整套部署级加速这也是新手最关心的凭什么能跑 30 帧自回归扩散 有界 KV 状态推理每处理完一块画面就定稿KV 缓存长度有上限长视频不会越跑越慢、越跑越漂CUDA Graph把稳态推理循环整段录制回放砍掉大量 CPU 调度开销默认开启FP8 量化 GEMM 融合算子由仓库内的 CUDA 算子库deploy/joyomni_ops/提供矩阵乘法和 Norm/RoPE 都被加速SageAttention长序列注意力用 INT8/FP8 量化计算短序列走 cuDNN 兜底。6大开放式视频编辑能力全解析开放式意味着不限定任务类型——一句话想改什么就改什么。官方支持的 6 大能力如下1️⃣ 主体编辑添加 / 移除 / 替换直接对画面主角下命令把画面两侧两只穿粉色衣服的白猫移除或给女孩穿上棕色羽绒服和蓝色棒球帽。主体数量、位置变化都能被正确跟踪。2️⃣ 局部编辑只改局部、保留其余画面让所有狗变白给它们戴上彩色帽子把太阳镜改成热粉色——多对象、多属性同时编辑互不串扰。3️⃣ 背景更换把场景变成正在下雨的运动场馆前景人物动作完整保留背景整段替换。4️⃣ 风格迁移把视频转成水彩晕染风格全局视觉风格重写人物与场景结构不变。5️⃣ 运动编辑调整画面中的动态元素例如给小女孩加一条随风飘动的红色披风让新增内容在时间轴上自然运动。6️⃣ 参考图引导编辑RV2V给一张参考图 一句指令就能让视频照着图改把主角换成参考图里的玩偶、给主角戴上参考图里的帽子。0811 版本权重专门强化了这一能力主体与身份保持、参考一致性都有明显提升。以上三张就是官方 Web 界面内置的参考图示例存放于deploy/rv2v_reference/目录戴上这顶帽子、换上这副橙色眼镜、穿上这件粉色 T 恤——指令越具体编辑结果越可控。一键部署步骤本地跑起实时视频编辑服务 完整的部署细节环境、权重、配置都在官方文档 DEPLOYMENT.md 中这里给出最短路径第 1 步克隆仓库并安装依赖git clone https://gitcode.com/gh_mirrors/jo/JoyAI-Video-Edit cd JoyAI-Video-Edit conda create -n joyai-video-edit python3.10 -y conda activate joyai-video-edit python -m pip install -r deploy/requirements.txt第 2 步下载模型权重按DEPLOYMENT.md的说明将 DiT、VAE 与 MiMo-VL 编码器权重放到deploy/deps/checkpoints/下合计约 51 GB检测模型为可选项。第 3 步启动服务bash deploy/run_server.sh然后打开http://localhost:8080上传视频或接入摄像头输入中文或英文编辑指令即可看到画面被实时改写。⚡不同显卡的推荐分辨率可通过环境变量JOYOMNI_WIDTH / JOYOMNI_HEIGHT / JOYOMNI_FPS覆盖显卡推荐配置NVIDIA B200原生 720p 24 FPSRTX PRO 6000480p 24 FPS或 720p 16 FPSGeForce RTX 5090优化中敬请期待首次启动会编译并预热 CUDA 内核稍慢属正常现象之后重启可复用deploy/deps/cache/中的编译缓存直接进入热启动。项目目录结构与关键文件路径说明deploy/run_server.sh服务启动脚本读取.env.local配置deploy/xvideo/serving/serve_joyomni_streaming.pyFastAPI WebSocket 服务入口deploy/xvideo/serving/graph_runner.pyCUDA Graph 推理运行器deploy/xvideo/models/dit/dit.py16B 多模态扩散 Transformer 主模型deploy/xvideo/models/vae/vae.py因果视频 VAEdeploy/joyomni_ops/csrc/fp8_gemm.cuFP8 GEMM 等 CUDA 加速算子deploy/static/index.html浏览器端实时编辑界面DEPLOYMENT.md从零到跑通的全流程部署指南总结JoyAI-Video-Edit 用自回归扩散 流式部署回答了视频编辑领域的关键问题编辑能不能像直播一样实时发生答案是肯定的——6 大开放式编辑能力、720p 下 30 FPS 的端到端吞吐、Apache 2.0 协议完整开源加上持续强化的 RV2V 参考图编辑能力让它成为目前最值得关注的实时视频编辑开源方案。无论是做直播特效、视频二创还是产品原型这个项目都值得你花一个下午克隆下来亲自试一试。【免费下载链接】JoyAI-Video-Edit[Official Repo] JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion项目地址: https://gitcode.com/gh_mirrors/jo/JoyAI-Video-Edit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价