资讯动态

MiniMax-H3-GGUF命令行完全指南:sd-cli参数逐项解析与实用技巧

发布时间:2026/8/19 15:32:09 来源:尧图企业网站定制
MiniMax-H3-GGUF命令行完全指南sd-cli参数逐项解析与实用技巧【免费下载链接】MiniMax-H3-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/unsloth/MiniMax-H3-GGUFMiniMax-H3-GGUF 是 unsloth 团队发布的 GGUF 量化版视频生成模型配合 stable-diffusion.cpp 自带的 sd-cli 命令行工具就能在本地显卡上直接生成自带声音的短视频——画面和 32kHz 立体声音轨由模型同步产出无需任何云端 API。对新手来说最大的门槛往往是那一长串 sd-cli 参数哪些必填、哪些影响画质、哪些决定显存占用。本文将以一条可复现的命令为主线逐项解析 sd-cli 参数并给出量化等级选择与实用调参技巧。MiniMax-H3 是什么一个会出声的视频生成模型MiniMax H3 是 MiniMax 发布的 omni-modal全模态生成系统核心亮点是视频与音频联合生成不是后期配音而是扩散模型在生成画面帧的同时直接产出 32kHz 立体声最长支持 15 秒、24 FPS 的片段。本仓库提供了两套去噪模型加载哪一套决定了你能输入什么fl2va_pruned首尾帧版输入文字可选 0、1 或 2 张首帧/尾帧图片。ref2va_pruned参考版输入文字外加参考图、参考视频和参考音频。两者是独立的 checkpoint 而非设置项按任务二选一即可。此外还需要共享的 Qwen3-VL 文本编码器和视频/音频 VAE。准备工作一次下载全部所需文件先用 git clone 拉取整个仓库内含全部 GGUF 模型与 VAEgit clone https://gitcode.com/hf_mirrors/unsloth/MiniMax-H3-GGUF仓库结构如下vae/目录下已有现成的视频与音频 VAE无需额外下载MiniMax-H3-GGUF/ ├── vae/ │ ├── minimax_h3_video_vae_fp16.safetensors # 视频解码器 │ └── minimax_h3_audio_vae_fp32.safetensors # 音频解码器 ├── minimax_h3_fl2va_pruned-*.gguf # 首尾帧版去噪器8 个量化档 ├── minimax_h3_ref2va_pruned-*.gguf # 参考版去噪器6 个量化档 └── qwen3vl_32b_minimax_h3-*.gguf # Qwen3-VL 文本编码器2 个档跑通第一条命令sd-cli 最小示例sd-cli --mode vid_gen \ --diffusion-model minimax_h3_fl2va_pruned-UD-Q2_K_XL.gguf \ --llm qwen3vl_32b_minimax_h3-Q2_K_M.gguf \ --vae minimax_h3_video_vae_fp16.safetensors \ --audio-vae minimax_h3_audio_vae_fp32.safetensors \ --prompt a red fox trotting through falling snow, cinematic \ --width 640 --height 384 --video-frames 25 --steps 4 --cfg-scale 1.0 \ --backend tecpu --diffusion-fa \ --output out.webmsd-cli 参数逐项解析从必填项到可选优化--mode vid_gen第一个必填参数--mode指定运行模式视频生成必须显式写成--mode vid_gen。不写的话 sd-cli 会把它当作图片生成模式直接拿图片路径去解析 prompt 然后报错退出。--diffusion-model选择去噪模型指向minimax_h3_fl2va_pruned-*.gguf或minimax_h3_ref2va_pruned-*.gguf。想用首尾帧控图就选 fl2va想用参考视频/音频就选 ref2va。--llm文本编码器搭配--llm指定qwen3vl_32b_minimax_h3-Q2_K_M.gguf或Q4_K_M。官方建议最小的两个去噪器搭配 Q2_K_M其余档位搭配 Q4_K_M。--vae 与 --audio-vae视频和音频的解码器--vae用vae/minimax_h3_video_vae_fp16.safetensors--audio-vae用vae/minimax_h3_audio_vae_fp32.safetensors。两个 VAE 是 fl2va/ref2va 共用的切换去噪器不用重下。--prompt提示词写法英文提示词效果最佳建议包含主体、动作、环境与风格词例如a red panda stepping along a mossy log in a misty forest, cinematic。--width 与 --height分辨率与显存直接挂钩官方示例图是 960x544 分辨率入门建议从 640x384 起步。分辨率越高显存占用越大显存不够就先降分辨率。--video-frames视频帧数帧数决定时长配合 24 FPS25 帧约 1 秒124 帧约 5 秒。帧数越多显存与推理时间线性增长。--steps 与 --cfg-scale速度与质量的平衡H3 是蒸馏模型官方示例仅需4~8 步即可出片。--cfg-scale必须显式写成 1.0这是第二个必填参数——H3 是无 classifier-free guidance 的蒸馏模型默认值 7.0 会导致直接中止报错。--backend tecpu第三个必填参数--backend tecpu把约 12GB 的文本编码器放到 CPU 上运行避免挤占显卡显存这是本仓库 README 明确要求的默认配置。--diffusion-faFlash Attention 加速开启 Flash Attention 可显著降低注意力计算的显存与耗时建议一直加上。--output输出文件输出支持.webm等格式直接指向out.webm即可生成结果自带音轨。--offload-to-cpu小显存救星如果上述配置仍然显存不足追加--offload-to-cpu把部分层卸载到 CPU 换显存代价是速度下降。量化等级怎么选从 Q2_K 到 Q8_0量化档位fl2va 体积ref2va 体积适用场景Q2_K6.26 GiB6.22 GiB极低显存尝鲜UD-Q2_K_XL7.51 GiB—最小推荐档动态混合精度Q3_K8.16 GiB8.12 GiB入门UD-Q3_K_XL8.90 GiB—动态混合精度进阶Q4_K10.64 GiB10.60 GiB画质/体积均衡之选Q5_012.97 GiB12.94 GiB高质量Q6_K15.45 GiB15.42 GiB接近无损Q8_019.97 GiB19.94 GiB最高保真UD-前缀表示动态混合精度版本非均匀量化能效比更高普通档则全程使用同一精度。新手建议从UD-Q2_K_XLQ2_K_M文本编码器组合开始显存足够再升档。实用技巧三个必填项之外的调参心得固定 seed 复现效果示例中 seed 11 是官方验证过的参数组合960x544、124 帧、8 步、guidance 1.0先照抄再微调。控制变量法调参先固定分辨率与步数只调 prompt确认画面风格后再动分辨率。显存不够时的降级顺序降分辨率 → 减少 video-frames → 换更低的量化档 → 最后才加--offload-to-cpu。音频是模型输出的一部分生成的.webm自带立体声无需任何后期配音工具。两个去噪器切换零成本文本编码器与 VAE 共享只需多下载一个去噪器文件。常见问题FAQ问报错说 cfg-scale 不能大于 1.0答H3 是蒸馏模型务必显式写--cfg-scale 1.0不要依赖默认值。问--mode不写会怎样答sd-cli 会按图片模式解析 prompt 并立即报错所以--mode vid_gen必须显式声明。问生成的是无声视频答确认同时传入了--audio-vae minimax_h3_audio_vae_fp32.safetensors否则不会生成音轨。问显存只有 8GB 能跑吗答可以用UD-Q2_K_XLQ2_K_M分辨率降到 640x384、帧数降到 25必要时再加--offload-to-cpu。许可证提醒使用前请务必阅读仓库内的LICENSE与NOTICE文件本模型采用 MiniMax H3 Community License Agreement对适用区域有明确限定GGUF 文件属于量化后的 Model DerivativesNOTICE中已逐项列明修改内容与归属说明。这不是 MiniMax 官方产品也未经 MiniMax 背书。现在就去 clone 仓库用第一条 sd-cli 命令生成你的第一个带声音的视频吧【免费下载链接】MiniMax-H3-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/unsloth/MiniMax-H3-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价