资讯动态

MiniMax H3与Ornith:多模态生成+自进化训练实战指南

发布时间:2026/9/8 15:37:51 来源:尧图企业网站定制
前阵子MiniMax H3一放出消息我朋友圈里做视频生成的朋友基本都在转。原因很直接这是第一个把视频、图像、音频放进同一个扩散模型里做联合生成、而且还有开放权重的模型普通人下载下来就能在本地跑。紧接着Ornith-1.5-35B-A3B的权重和报告也出来了走的是“自进化训练”路线。这两个事情放在一起看特别有意思——一个在生成端把模态打通一个在推理端把训练成本打下来。这篇文章我会结合自己跑H3的实测把配置、ComfyUI工作流、提示词规范、常见坑一次讲清楚再聊聊Ornith那个自进化训练模式到底在解决什么问题。不管你是玩AI绘画、做短视频还是搞模型微调这两块内容都有直接参考价值。1. MiniMax H3 到底做了什么一个模型同时搞定画面和声音1.1 它不是又一个“视频生成套壳”而是重新定义了音画同步过去我们做AI视频流程基本是Cinematic风格提示词生成一段画面然后再跑到TTS或者音效网站里找配音、找环境声最后在剪辑软件里手动对齐。疯狂的是人物说话的口型永远对不上哪怕用后期工具一帧帧调也总有那么几帧是“鬼畜”的。H3这次把这个问题从源头解决了。它不是常见的UNet扩散模型而是走Transformer扩散路线把文本、图像、视频、音频统一映射成一个离散token空间去建模。也就是说模型在生成视频帧的同时会在同一个推理流程里把对应的音频轨也预测出来。你看到人物开口声轨里就是同样的语音节奏嘴型和发音天然对齐。我在测试时最直观的感受是一段几秒钟的人物说话视频生成出来就能直接听到台词和环境声不需要再做任何“音画同步”处理。如果只生成纯视频你也可以不输出音频轨自由度高很多。这种“音画一体”不是简单把视频和音频两个模型拼接而是训练时就做了多模态联合建模所以它特别适合对口型、人物访谈、影视预演这类场景。1.2 开放权重后的玩法文生视频、图生视频、参考模式、导演台H3的开放权重让本地折腾变得有意义。我整理了下目前社区里用得最多的几种玩法文生视频给一段文字描述直接出带声音的视频片段。图生视频给一张静态图让图里的人或物动起来。ref2va全能参考模式给一张角色参考图、一段音频参考让视频里的人物按照参考角色的外貌和参考音频的说话内容来表演。导演台这是整合包里的一个全能工作流把多镜头、转折、主体一致性整合到结构化界面里适合做短剧预告片级的分镜控制。这些能力不是各跑各的它们都在同一个H3权重上完成只是输入条件不同。这也是我建议新手优先玩ref2va的原因——它能把“人物长相保持一致”的问题大幅简化。后面第3部分我会专门讲ref2va的提示词怎么写因为这里有个容易踩的坑。2. 本地部署 MiniMax H3配置、整合包与工作流选型2.1 部署前先看配置我能用 8GB 显存跑吗这是我在评论区被问得最多的问题。先说结论H3的完整权重大概在33B视觉部分你指望8GB显存无脑跑高清长视频那是不现实的。但社区目前有很多整合包和量化方案我试过在一张8GB显存的卡上用512x512分辨率、生成几十帧短视频确实能跑起来只是需要接受两个代价慢、不能开太多花活功能。核心显存优化手段有这么几个开启Block Cache缓存机制。H3工作流里的Block Cache是专门降低重复计算、缓解显存压力的社区版本里常见的T8档位就是在缓存强度和画面质量之间取一个平衡。显存紧张时优先把这项开起来。使用低vram模式启动ComfyUI让权重按需加载到显存。跑H3这种大模型全程驻留显存会直接爆。控制分辨率和总帧数。我实测下来8GB卡上512x512、50到80帧是相对安全的上限分辨率再往上拉显存占用是几何级上涨的不是线性。关于“AMD CPU能本地部署吗”这里也一并回答H3本身依赖PyTorch推理AMD CPU完全可以跑CPU的指令集只是影响速度不会导致跑不起来。真正的问题是纯CPU推理H3这种规模的多模态模型速度会慢到让人怀疑人生。如果你只有AMD CPU没有NVIDIA显卡我建议直接考虑云GPU别为难自己。如果你是AMD显卡情况会复杂一些涉及ROCm的兼容性目前体验不如NVIDIA卡顺畅。2.2 ComfyUI 整合包与节点安装流程H3目前最舒服的落地方式还是ComfyUI。官方和社区已经做了比较完整的节点支持你不需要从零写代码。部署主要有三步准备一个最新版的ComfyUI。不管你是用官方安装包还是某个大佬的整合包先把ComfyUI本体更新到最新版H3节点有些依赖较新的ComfyUI核心接口。安装MiniMax H3相关节点。一般是通过ComfyUI Manager搜索节点安装如果网络条件允许也可以直接git clone到custom_nodes目录。装完之后重启ComfyUI界面上会出现MiniMax系列节点。下载模型权重。H3权重文件比较大注意放置路径要和你节点里填写的路径一致。我建议把权重统一放到ComfyUI/models/minimax/目录下后续不管是基础视频生成还是ref2va都能复用不用反复改路径。装完别急着直接跑文生视频先在ComfyUI里加载官方示例工作流把模型路径确认一遍然后跑一个低分辨率测试。很多人第一次报错就是因为路径没配对而不是模型坏了。2.3 导演台工作流director分支怎么选block cache 与自定义采样器现在打开ComfyUI你能搜到大量H3相关分支director分支、ref2va分支、全能工作流等等。不少朋友问我“director哪个分支最好”。我的看法很简单新手直接选整合包里自带的director分支尤其是带有“导演台”那种结构化UI的版本。原因有几点它把文生视频、图生视频、ref2va、音频参考等模式集成在同一套工作流里切换模式只换输入节点不用来回改连线。它默认开启了Block Cache和显存优化选项对低显存用户友好。社区维护活跃遇到bug更新快。相比之下某些魔改分支虽然加了特长功能但作者更新不稳定容易和最新版ComfyUI冲突。自定义采样器这块要多说一句H3工作流里你可以用KSampler系列也可以用采样器高级参数。很多人喜欢用它做“多参生成视频”也就是同一组提示词批量尝试不同Steps、CFG、采样器组合然后选效果最好的。这个思路没问题但H3本身要加载视频VAE和音频解码器批量并行跑时极其消耗显存ComfyUI会出现明显的卡顿甚至无响应。我建议多参测试时不要一次提交超过两到三组改成队列逐个执行每组跑完清一次缓存再跑下一组。3. H3 实操全记录提示词编写、参数调整与音画对齐3.1 ref2va 全能参考模式的提示词规范ref2va是H3最有价值也最容易被用错的功能。简单说input端给一张角色图或者物体图再给一段音频模型会生成一个以该角色为主角、按音频内容“表演”的视频片段。很多人以为“有参考图就不需要写提示词了”这是大错特错。ref2va参考的是角色外观和身份特征但场景、镜头运动、情绪氛围、光线风格仍然要用文字来限定。我把提示词拆成五个部分这套规范自己跑熟了之后很稳定主体描述明确角色是谁、穿什么、什么姿态。如果参考图足够清晰这部分可以简写但不能完全不写。场景描述交代环境室内还是室外白天还是晚上关键道具是什么。镜头语言H3对镜头指令理解得不错可以写“缓慢推进”“特写面部”“跟随人物侧面移动”这类描述。情绪与动作人物是怎么开口的、语气是激动还是平静头有没有转向镜头手部有无动作。音频约束如果输入了配音音频提示词里也要写清楚“人物的语音应当与参考音频一致”不然模型可能会让角色做出和音频节奏错位的表情。我自己遇到最典型的翻车案例是只给角色图和台词音频提示词只写了“cinematic, high quality”。结果视频里角色外貌确实像参考图但表情从头到尾一个样像在读字幕。后来我在提示词里补上“说话时配合台词情绪做出自然表情眉毛和嘴部动作要跟随语音重音”效果立刻好了很多。这说明ref2va不是“看图说话”它仍然需要文字去弥补参考图没有提供的信息。3.2 关键参数怎么设置采样器、Steps、CFGH3的参数设置和Stable Diffusion那套逻辑不完全一样因为它是Transformer扩散架构。我习惯在一开始就把它当成一个全新的模型来看而不是无脑套用之前的经验。先说Steps。H3对步数不是特别敏感但这不代表越少越好。我测下来20到30步是一个兼顾质量和速度区间低于15步画面容易出现明显噪点高于40步收益很小纯属浪费时间。CFG方面推荐3.5到5.5这个范围CFG太高会让画面色彩过饱和而且容易引发抽搐感。采样器我目前用下来比较稳的是euler和dpmpp_2m如果你是玩ComfyUI的老手也可以试试带a-series的调度器画面会柔和一点。时序和音频输出方面需要注意区分“帧率”和“总帧数”。H3默认输出帧率一般设置在16到24fps之间总帧数决定视频时长。很多人只改fps不改总帧数最后生成出来的只有1秒这就是典型的“预期时长和实际帧数对不上”。一个比较稳妥的做法先定总帧数再根据想要的时长倒推fps。比如想要5秒视频定80帧那fps就是16。分辨率不要盲目堆高H3对画面构图的理解不错但低显存下强行拉分辨率会让细节崩掉我建议先固定分辨率把提示词调好再考虑升级到更长视频。3.3 解决视频动作不一致与口型不同步“视频生成视频动作不一”这个问题在H3社区里讨论很多。所谓动作不一就是你用同一张参考角色图生成多段视频结果每段里角色长得像但动作风格、姿态习惯完全对不上。这在制作系列短视频时会很头疼。要解决它别指望靠提示词一劳永逸。最佳路径是用ref2va参考模式把角色的关键姿态和动作范围通过参考输入锁定住然后开启Block Cache并固定随机种子。固定种子这个细节很重要同一组提示词和参考图种子固定后动作和表情有大概率保持相似基础换了种子动作差异会大很多。想要更严格的帧间一致性可以把首帧、尾帧图也喂进去让模型在中间插值这样人物动作连贯性明显提升。口型不同步这个问题我用的是最直接的思路不要后期配音生成时就把音频喂给ref2va。H3能在模型内部完成语音节奏和嘴唇动作的对齐比任何外部对口型插件都自然。如果到这里仍然有轻微延迟多半是音频输入没做标准化你可以先把音频转成16kHz单声道WAV再导入问题能大幅缓解。注意ref2va的音频参考不是让你贴一段背景音乐进去而是需要有人声语音的音频模型才会去拟合说话时的嘴部动作。4. 常见报错与排查我踩过的坑和速查表4.1 视频只出 1 秒、显存瞬间爆炸这个问题不仅H3有Wan2.2用户也经常碰到“生成视频只有1秒”。说到底是ComfyUI里几个参数没对齐。第一件事检查总帧数。很多人设了fps16然后以为长度会自动拉长但实际上Video Length或者Batch Size并没有给足帧数。第二件事检查是否锁定了Latent的尺寸有的节点之间输出尺寸不一致最后解密出来只剩几帧。第三件事检查视频VAE是否正确接入。H3里视频帧生成完需要专门的Video Decode节点来还原为最终视频如果环节缺失画面会直接停在一帧上。显存瞬间爆炸多见于直接在低显存卡上跑了高分辨率。8GB卡跑720p以上几乎必爆爆了ComfyUI会直接提示OutOfMemory。这时先把分辨率降回576或512同时开启Block Cache并关闭ComfyUI的自动预览功能。自动预览本身不占多少显存但在H3这种大模型推理过程中多一个显存大户都可能是压垮骆驼的最后一根稻草。4.2 动作鬼畜、多参生成卡顿动作鬼畜和抽搐往往不是模型问题而是CFG和采样器搭配不对。CFG调太高会让模型对提示词“反应过度”每一帧都试图加强特征结果就是抖动。你可以先把CFG降到4左右采样器换回euler再测试。如果还是抽搐检查参考视频或首帧帧率是否和输出帧率差异过大H3在帧率不匹配时容易产生不自然的中间帧。“ComfyUI多参生成视频自定义采样器很卡”是我在群里看到的一条很实际的问题。多参生成本质是同一个工作流跑多个采样分支H3这种大模型会同时加载多套中间权重显存瞬间被占满。我的建议是把“多参”拆成队列串行每次只跑一个采样组合如果是想对比同一提示词下的不同CKPT或者不同LoRA组合那就更不要并行ComfyUI的队列机制本身就是为串行准备的。硬要并行你至少要把分辨率降到512x512并把生成总帧数控制在50帧以内。4.3 本地部署相关问题速查我把一些高频率问题整理成了速查表给遇到相同情况的朋友直接对号入座。问题排查思路解决建议权重加载后报错提示找不到模型节点和实际权重路径不一致确认权重放在models/minimax目录并在节点内重新选择8GB显存一开ref2va就崩音频tokenizer和视觉tokenizer同时加载导致爆显存先关ref2va跑纯视频模式开Block Cache音频参考转16kHz单声道在AMD CPU上跑得极慢纯CPU推理没有GPU加速降分辨率、降帧数有预算直接换云GPU视频生成结果画面全是水波纹采样器或CFG设置过激进降到CFG 3.5-4.5换euler采样器某个director分支装完报SyntaxError分支版本和ComfyUI本体不兼容更新ComfyUI或切换回main/ref2va维护分支提示H3的模型文件和ComfyUI节点是两个概念。下载了权重不等于节点安装好了节点安装好了也不代表权重路径配对成功报错时先分清是哪个环节出了问题。5. Ornith-1.5-35B-A3B 与自进化训练另一边同样重要的进展5.1 35B-A3B 是什么大参数、小激活的 MoE视频生成之外Ornith-1.5-35B-A3B这条消息在纯语言模型圈里的热度也很高。理解这个名字最关键的是后半段“35B-A3B”。前面35B指模型总参数量为35B后面A3B表示每次推理只激活3B参数。这是一个典型的混合专家结构MoE相当于一个35B参数量的大团队里每个任务只需要挑选一小部分专家上场。这种结构的意义在于部署门槛。一个35B的密集模型纯FP16推理要占70GB显存左右但A3B模型每个token只在3B参数上做计算显存需求更多来自总参数量而推理速度却接近小模型。对于本地部署和在线服务来说这种方式可以用更低的算力成本拿到接近大模型的效果。最近很多开源模型都在走这条路线Ornith这个方向并不让人意外。5.2 自进化训练没有人工标注的迭代闭环自进化训练是Ornith最有意思的地方。传统大模型训练从SFT到RLHF都需要高质量标注数据或者人工偏好排序。人工标注的成本高而且容易被人类偏好局限住。自进化训练的思路是让模型自己生成训练数据、自己评估这些数据的好坏、再把筛选后的数据喂回给自己继续训练迭代出一个能力更强的模型。具体到Ornith流程可以拆成三步来理解模型基于种子数据生成一批推理过程和答案。模型用自己或辅助策略对这些答案做筛选保留高分答案、丢弃低分答案甚至让模型反思自己的错误输出并重新生成。把筛选后的高质量数据作为下一轮训练集进行新一轮微调循环往复。这本质上是一个“自我博弈”过程类似于让AI既当老师又当学生。里面的关键点是筛选策略如果模型本身判断力不够很可能把错误答案当高质量数据用导致能力雪崩。现阶段比较好的实现方式是引入一个更强的外部模型或者规则校验器做初步筛选然后再交给目标模型自我反思。5.3 这个模式对行业意味着什么自进化训练最直接的价值是把数据瓶颈往前提了一步。以前做一个推理能力不错的小模型你需要掏钱买数据、找标注团队。现在有了自进化框架你只需要一个还算过得去的种子模型和一套可靠的打分过滤机制就能在不断迭代中提升模型能力。这对小团队特别友好。你不需要像OpenAI那样囤积海量人工反馈也能训练出能打的基础推理模型。当然它还没有成熟到能完全替代人类标注尤其在安全性和价值观约束上仍然需要人工兜底。但作为一个探索方向它已经给“模型能力还能怎么增长”提供了一个低成本答案。6. 这两件事放一起我的实际体会和建议6.1 如果你是内容创作者先别急着学训练H3的价值在于你不需要懂多模态模型原理也能做出以前要一个后期团队才能完成的视频。最快的上手路线就是下载一个整合包加载导演台工作流先用文生视频跑通流程再学习ref2va的提示词。不要一开始就追求多参对比、自定义采样器先固定一组你用起来稳定的参数组合把“出片”这个事跑顺。我见过太多人第一天装好ComfyUI就想着把所有模型、所有分支都塞进去结果连一个完整视频都跑不出来。H3默认工作流已经够强先让画面出来再慢慢调细节效率会高很多。6.2 如果你是工程师抓住两个趋势一边是视频生成模型把音画和参考信息统一了另一边是推理模型把训练数据的生产闭环自举了。这两个趋势合在一起意味着以后多模态应用的门槛会更低数据生产成本会更便宜留给开发者的想象力空间也更大。如果你接下来想做点相关产品我建议从“角色一致性”和“口型驱动”这两个点切入。H3已经让它们从实验室走到了本地哪怕是个人开发者也能拿它做个性化数字人、互动视频、动态故事板。前提是你得先把提示词规范练熟把ComfyUI的节点逻辑搞明白这不是能跳过的功课。6.3 最后分享一个我的使用技巧成片率这件事很多人以为是模型决定的其实更多是工作流顺序决定的。我现在的习惯是先用文生视频快速生成三到五个低分辨率草稿选出画面构图和人物动作最顺的一个再把草稿里的种子固定套进ref2va工作流做高清和音频对齐。这个“低草稿选片-高清精修”的流程比一上来就跑一次长视频要节省大量时间和显存推荐你试试。模型更新很快但工作流和排查思路是通用的。希望这篇能让你少走点弯路。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价