资讯动态

一段随手拍的手机视频 → 可驱动 4D 化身:Ant Research 4DAnyone 把「单目到 4D」的门槛拆到底

发布时间:2026/8/22 23:54:35 来源:尧图企业网站定制
一段随手拍的手机视频 → 可驱动 4D 化身Ant Research 4DAnyone 把「单目到 4D」的门槛拆到底Hugging Face 每日论文2026-08-22 精选 · 事实流论文4DAnyone: Create Anyone in 4D from a Casual Monocular Video作者Yudong Jin、Tao Xie、Qihang Zhang、Zehong Shen、Zhen Xu、Yujun Shen、Hujun Bao、Xiaowei Zhou、Yinghao Xu机构浙江大学 CADCG 国家重点实验室、Robbyant、Ant Group蚂蚁集团/Ant Research、香港中文大学、香港科技大学项目页https://4danyone.github.io/arXiv2608.203352026-08-21一句话总结Ant Research 联合浙大、CUHK、HKUST 在 8 月 21 日放出的这篇论文把「用一段手机随手拍的单目视频」直接生成为可驱动、可渲染、可绕任意视角观察的 4D 化身这件事做到了 SOTA 之上——不依赖任何相机标定、不需要专门的多相机 rig只要一段日常视频输入是「非标定的」就能跑。整套方法的关键是两个新机制RCPReference Context Packing把参考视图压缩到 O(1) 复杂度TCRTarget Context Routing让目标视图在去噪过程中轮换分组从而共享上下文、稳定细节。一、要解决的真问题单目视频生成 4D 化身的三个老坑4D 化身4D human avatar听起来抽象但落到产业上就一句话让一个虚拟人能像真人一样被观察、被驱动。从一段手机视频出发这件事过去三年被反复尝试但都卡在三个坑里老坑表现标定依赖要求多相机、动捕服或专业 rig消费级场景不可用多视角一致性生成侧面/背面时身体变形、姿态漂移长序列稳定性视频稍长就出现累积误差化身崩掉4DAnyone 的目标场景是最不友好的那种未标定uncalibrated、随手拍、相机内参未知、姿态未知。也就是论文里反复强调的「a casually captured monocular video」。二、Pipeline 全貌四步把单目视频变 4D 化身4DAnyone 不是一个端到端黑箱而是一条显式可拆的四步流水线姿态与 3D 关键点估计用 GVHMR 从单目视频估计出 ground-aligned 的 SMPL-X 序列再从 SMPL-X 回归出稀疏的 Goliath 3D keypoints3D-aware 骨架条件把 40 个关键点用「相机空间深度 z-buffer」渲染到每个目标视点保留前后顺序关系——这是论文的关键技巧传统 2D 骨架渲染会丢失这一信息多视角扩散生成用 Wan2.2-TI2V-5B 在 704×1280 分辨率上微调输入骨架条件生成多视角视频4D Gaussian Splatting 提升把多视角视频送进 FreeTimeGS训练出 4D Gaussian Splatting4DGS化身可以绕任意视角观察、任意时刻重渲染。这套流水线把「单目 → 4D」明确切成「单目 → 多视角 → 4D」两个阶段每个阶段都有自己的解法和损失函数。三、RCPReference Context Packing把 O(N) 压成 O(1)多视角扩散生成有个根本的工程问题随着参考视图越来越多每生成一个新视图都得把所有已生成的参考视图一起喂进模型作为条件。如果参考视图数量是 N每次去噪 step 的参考上下文就是 N 量级复杂度 O(N)。当 N 超过 8 就开始显存爆炸、超过 16 已经没法跑。4DAnyone 的RCP思路非常直接把 N 个参考视图压缩到一个固定长度的上下文方法是用 1×、2×、4× 三种 patchify 把参考视图分块拼接成一个混合分辨率的固定 context后续生成的新视图都只看这个固定 context。效果reference-context complexity 从 O(N) 降到 O(1)。论文最终用了 8 个参考视图 16 个目标视图 24 个视角每个目标视图生成时只看一个固定大小的 context显存和算力都可控。四、TCRTarget Context Routing20 步去噪里一半轮换、一半固定仅有 RCP 还不够——目标视图本身被分成 4 个一组去生成一次去噪 step 内生成 4 个视图。如果所有 step 都用同样分组会出现「组内视图一致、组间视图错位」的问题。TCR 的做法早期高噪 step前 80%让 4 个一组轮换——A 组、B 组、C 组、D 组在不同 step 里轮换作为「当前生成组」让所有目标视图都能从别的组借到全局上下文后期低噪 step最后 4 步t_s/T0.2 阈值之后让分组固定下来让每个组稳定收敛到自己的细节。直观理解早期多交流、后期各自打磨。论文的消融实验表明去掉 RCP未观察区域在所有指标上都不一致去掉 TCR每个组独立去噪导致互相漂移滑动式sliding路由优于随机、间隔、固定三种t_s/T0.2 是性能饱和点。五、关键实验数据5.1 训练数据 MVGameHuman为了训这个模型团队单独构建了一个数据集数据数量同步序列38,000演员318虚拟相机24分辨率2560×1440训练硬件128 × H20-3E GPU单阶段训练时长0.5 / 1 / 1.5 天三阶段外加 DNA-Rendering、SynCamVideo 多视角源 Pexels、TedTalk in-the-wild 源。5.2 推理阶段时延阶段硬件时长预处理RTX 4090约 2 分钟多视角生成20 步去噪H20约 7 分钟4DGS 训练RTX 4090约 30 分钟整套从一段视频到 4D 化身约 40 分钟单机可跑。5.3 评测覆盖10 个 DNA-Rendering 场景3 个 DyMVHumans 场景每场景 16 个目标视图、98 帧指标PSNR↑、SSIM↑、LPIPS↓论文报告 4DAnyone在所有 baseline 上都领先尤其在稳定生成侧面/背面视图几何漂移显著减少下游 4DGS 重建质量提升。5.4 Baseline 对比要点Baseline主要弱点MV-Performer正面尚可侧面/背面身体变形、姿态错位TrajectoryCrafter深度累积误差从正面切到背面时失败ReCamMaster†同数据微调相机控制错位4DGS 噪声明显4DAnyone 之所以领先是因为它同时解决了视角一致性和细节稳定性——RCP 解决显存TCR 解决一致性。六、三个值得展开的方法论6.1 3D-aware 骨架条件传统做法是把 2D 骨架投影到目标视图作为条件但这会让重叠的身体部位手-躯干、腿-脚出现前后歧义——模型不知道哪个在前。4DAnyone 的做法是把 40 个 3D 关键点用相机空间深度 z-buffer 渲染这样每个像素自然带「前后关系」多视角生成时模型能正确推断遮挡。消融里这是关键——把这一步换成普通 2D 骨架所有指标都会掉。6.2 渐进式参考视图生成不是一次性生成所有 24 个视图而是先生成 8 个参考视图充分覆盖人体再生成 16 个目标视图围绕主体。这样 RCP 的 O(1) context 才有意义——参考视图质量高扩散模型更容易产出稳定的目标视图。6.3 失败模式论文很诚实给出了两个失败案例松散衣物薄纱、裙摆在多视角下无法保持物理合理特殊姿态en-pointe芭蕾足尖被 HMR 错误估计为平脚。这些是数据驱动的限制——模型见过类似样本才能学会样本不够就崩。七、产业意义单目 4D 化身能落地什么场景价值直播 / 短视频一段视频就能生成主播 4D 化身多机位拍摄成本下降电商试穿用户上传日常视频即可生成自己的 4D 试穿化身游戏 / 影视演员日常自拍即可生成数字替身会议 / 远程协作真人化身进入虚拟会议室沉浸感更强体育训练教练可绕任意角度回放学员动作论文里还演示了一个单图到 4D 化身的扩展用 Wan-Animate 生成动作视频再用 4DAnyone 生成多视角最后 FreeTimeGS 重建——把门槛进一步降低到「一张图 一段动作」。八、与近一年同类工作对比工作输入关键机制主要局限NeRF-based avatar多视角神经辐射场需多相机标定3DGS avatar多视角高斯泼溅视角有限HumanGaussian单目单阶段扩散长序列不稳定4DAnyone单目随手拍RCP TCR 3D 骨架条件衣物/极端姿态仍崩4DAnyone 的差异化是「单目 不标定 长序列稳定」——把过去三个独立的优势一次集成。九、给做 3D/视频/虚拟化身的人三条结论RCP 把多视角生成的显存瓶颈解决了如果你在做类似系统O(1) context 是 2026 年必备设计TCR 的「早期轮换 后期固定」是可迁移模板不仅对多视角生成对任何「多组去噪」场景都适用3D-aware 骨架条件比 2D 更稳把 2D 骨架换成带 z-buffer 的 3D 渲染是低成本提升一致性的捷径。arXiv2608.203352026-08-21项目页https://4danyone.github.io/HF 链接https://huggingface.co/papers/2608.20335

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价