资讯动态

拆解Helios三阶段训练管线:从历史注入到金字塔蒸馏,长视频模型如何炼成

发布时间:2026/10/8 20:40:14 来源:尧图企业网站定制
拆解Helios三阶段训练管线从历史注入到金字塔蒸馏长视频模型如何炼成【免费下载链接】HeliosHelios: Real Real-Time Long Video Generation Model项目地址: https://gitcode.com/gh_mirrors/helios33/HeliosHelios 是一个 14B 的实时长视频生成模型能够在单张 H100 GPU 上以 19.5 FPS 的速度生成分钟级、高一致性的视频。这份能力背后是一套精心设计的三阶段训练管线第一阶段通过历史注入把模型改造成自回归长视频生成器第二阶段用金字塔式 token 压缩大幅削减计算量第三阶段用对抗式层级蒸馏把 50 步采样压到 3 步并彻底去掉 CFG。本文带你逐阶段拆解长视频模型的完整炼成路径。为什么长视频模型要三阶段训练先搞懂长视频生成的三大难点误差累积漂移自回归逐段生成分钟级视频时每段都把上一段的输出当历史小误差会被逐帧放大最后画面变糊、内容跑偏甚至崩掉算力开销大每新增一个 chunk模型都要关注全部历史帧token 数随视频长度线性膨胀采样步数多标准扩散模型要几十步去噪才能出一段视频谈实时是空话。Helios 的三个阶段恰好各打一个痛点阶段产出模型核心技术解决的问题Stage 1Helios-Base统一历史注入 Easy Anti-Drifting 多时程记忆补丁化自回归长视频且不漂移Stage 2Helios-Mid金字塔统一预测器-校正器Token 压缩算力大降Stage 3Helios-Distilled对抗式层级蒸馏DMD50 步 → 3 步告别 CFG 三阶段的完整配置都在 scripts/training/configs/总览说明见 scripts/training/README.md。Stage 1架构适配——教会模型记住历史Stage 1 的起点是双向预训练的 Wan2.1-T2V-14B 基座见 stage_1_init.yaml 中的transformer_model_name_or_path。双向意味着它天生看的是完整视频而长视频要求逐块流式生成。所以 Stage 1 的目标是把它改造为自回归生成器每 9 个 latent 帧对应 33 个像素帧为一个 chunk模型必须看着过去预测下一段。三个关键招式1️⃣ 统一历史注入历史 latent 不是简单拼接到当前输入而是通过注意力统一注入。配置里history_sizes: [16, 2, 1]定义了短、中、长三级记忆——短期记忆看 16 帧细粒度历史越往远越压缩兼顾细节与视野。历史数据的切分逻辑在 helios/dataset/dataloader_history_latents_dist.py。2️⃣ 多时程记忆补丁化多级记忆通过专门的 patch embedding 模块has_multi_term_memory_patch: true进入主干。这个模块在 Stage 1 全量训练之后的阶段保持冻结保证记忆接口稳定。3️⃣ Easy Anti-Drifting抗漂移的精髓是训练时故意给历史加噪。corrupt_history: true会对历史特征做加噪或降采样破坏细节见 helios/utils/utils_helios_base.py让模型对带瑕疵的历史免疫推理时误差才不会滚雪球——这正是 Helios 不需要关键帧采样、反转采样等常规抗漂移手段的原因。训练策略上Stage 1 分成两相stage_1_init用较高学习率5e-5快速收敛stage_1_post换低学习率3e-5精修基座大部分冻结主要通过 rank 128 的 LoRA 更新参数。Stage 2金字塔 Token 压缩——让注意力变便宜Stage 1 完成后长视频的计算开销仍然偏高去噪的 token 数随 chunk 数量不断增长。Stage 2 引入金字塔统一预测器-校正器配置见 stage_2_init.yaml。核心思路是把去噪过程切成 3 段stage2_num_stages: 3sigma 区间按 1/3 划分stage2_stage_range: [0, 1/3, 2/3, 1]前两段在低分辨率的压缩 token 上粗雕最后一段才用全分辨率 token 精修。就像写文章——先搭骨架再逐段细化最后润色字词。效果是最贵的注意力计算大部分发生在少数 token 上粗到细的金字塔结构又保住了画质总算力显著下降。多阶段调度的实现见 helios/scheduler/scheduling_helios.py推理时对应 helios/pipelines/pipeline_helios.py 里的stage2_sample。Stage 2 同样分成stage_2_init与stage_2_post两相延续高学习率快跑 低学习率精修的节奏。Stage 3对抗式层级蒸馏——从 50 步到 3 步Stage 3 的产物就是最快的Helios-Distilled它内部又分两步① ODE 冷启动stage_3_ode.yaml先准备一组教师模型生成的 ODE 轨迹对用 ODE 回归损失ode_regression_weight: 80.0让学生模型学会抄近路——几步之内直接从噪声跳到干净结果建立少步生成的初步能力。② DMD 对抗蒸馏stage_3_post.yaml这是对抗式层级蒸馏的主体两组网络博弈生成器学生只走极少几步对应dmd_denoising_step_list: [1000, 750, 500, 250]的去噪点生成视频Critic打分模型学习率 4e-7不断学习区分学生产出与真实数据的分布差异分布匹配损失实现在 helios/utils/utils_helios_post.py。还有两个巧思is_use_gt_history: true训练时喂真实数据的历史防止少步推理进一步放大漂移EMAdecay 0.99平滑权重。最终 Helios-Distilled 只需 3 步采样即可出片guidance_scale1.0免 CFG相当于白省一半前向并改用 x0 预测 HeliosDMDScheduler。仓库还提供了两个变体配置stage_3_post_gan_version.yaml加 GAN 判别器提清晰度与stage_3_post_self-forcing_version.yamlself-forcing 训练方式。实战如何跑通这条三阶段训练管线训练入口是 train_helios.py支持 DDP 与 DeepSpeed 两种分布式方案bash scripts/training/train_ddp.sh # DDP bash scripts/training/train_deepspeed.sh # DeepSpeed操作顺序与要点先备数据用 tools/offload_data/ 下的脚本预提取视频 latent、ODE 对和文本嵌入官方还提供 toy 数据集方便小成本跑通全流程按序训练依次执行 stage_1_init → stage_1_post → stage_2_init → stage_2_post → stage_3_ode → stage_3_post每阶段改 scripts/training/configs/ 中对应 yaml 即可可以用 scripts/training/compare_yaml.py 检查配置完整性与阶段间差异合并权重每阶段结束后用 tools/merge_lora_for_helios.py 把 LoRA 与附加 checkpoint 合并成最终 safetensors。训练完成后如何验证效果跑一个推理脚本直观感受实时cd scripts/inference bash helios-distilled_t2v.sh蒸馏版推荐参数--is_enable_stage2 --pyramid_num_inference_steps_list 2 2 2 --is_amplify_first_chunk且num_frames设为 33 的整数倍每个 chunk 的长度。想要系统性评估可以用官方 HeliosBench 评测集含运动幅度、语义一致性、漂移等指标见 eval/README.md检验自己炼出的模型在分钟级视频上是否真的稳。总结Helios 的三阶段管线回答的是长视频生成的三个根本问题如何不漂移——历史注入 抗漂移训练Stage 1如何变便宜——金字塔 token 压缩Stage 2如何变快——从 50 步到 3 步的对抗式蒸馏Stage 3。三个阶段各司其职且每阶段产物都能独立可用Base 主打质量、Mid 主打均衡、Distilled 主打实时。这种一步一石、步步可用的渐进式训练思路对想自己训练长视频生成模型的同学非常有参考价值。【免费下载链接】HeliosHelios: Real Real-Time Long Video Generation Model项目地址: https://gitcode.com/gh_mirrors/helios33/Helios创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑