如果你最近经常刷 AI 新闻很难不眼花。Qwen、DeepSeek、MiniMax、混元、Wan 接连开源语言、图片、视频模型一起上新后面还跟着一排像暗号一样的型号另一边越来越多人在买大内存 Mac、迷你主机和大显存显卡说是要“在本地跑 AI”。普通人最想问的其实就几件事这些模型有什么用为什么值得专门买硬件我的电脑能跑哪个装好以后又有多好用我把这些问题整理成了一张选型地图先判断自己有没有必要本地部署再盘一遍当前值得关注的语言、图片和视频模型顺手讲清名字、参数、压缩版本、使用许可和电脑配置。盘点完我还会把模型真正装进 Mac 和 Windows用文字、看图、分镜和视频任务检查它们到底好不好用。读完之后你不必记住所有模型但会知道自己需要哪一类、电脑能不能带动以及它值不值得你折腾一个晚上。目录AI相关文章尾部跳转一、为什么大家开始把 AI 搬回家二、先看面板五步筛掉不属于你的模型三、语言赛区国产六雄比的不是同一件事四、图片赛区会画只是入场券五、视频赛区最强的模型可能根本进不了你的显卡六、硬件赛区你的电脑究竟装得下谁该不该买AIPC七、同一张图两代千问谁更会当导演八、把提示词交给 H3成片才是答案九、最后给你看一段视频一、为什么大家开始把 AI 搬回家大多数人不需要立刻买新电脑。本地模型有点像把一位 AI 助手搬进家里。云端 AI 住在别人的机房你通过网络找它干活本地 AI 住在你的电脑里文件可以留在本机断网后也能运行。你遇到下面任何一种情况才值得认真研究本地部署你的情况本地模型能帮什么经常处理合同、未公开图片或私人素材让文件尽量留在自己的电脑里网络不稳或者需要离线工作没网时仍能使用每天都要批量整理文件、图片和素材可以和本地文件夹、脚本、剪辑软件配合需要一个长期不变的固定版本自己保留同一份模型工作流更稳定如果你一个月只问几次问题只想用最新的模型也不想处理安装和更新继续用在线 AI 更省心。本地运行会占磁盘、吃内存或显存还会用掉时间和电费。还有一个容易踩坑的词“开源模型”。有些模型只是把可运行的文件开放下载训练数据和训练代码并没有全部公开。更准确的叫法是“开放权重”。这个区别不是学术抬杠因为能下载不等于能随意商用。许可证可以理解成模型自带的“使用合同”。下载前找到模型页里的 License至少把下面四件事查清楚能不能用于收费项目或公司业务生成的图片、视频公开发布时要不要注明 AI 或模型名称能不能用自己的材料继续训练或者和别的模型合并做成自己的版本能不能把原模型或修改后的版本再次分享给别人。Apache 2.0、MIT 通常比较宽松但仍可能要求保留版权与许可说明Non-Commercial 表示模型文件只能用于非商业场景。厂商自己写的社区许可还可能限制商用规模、要求发布时注明模型或者限制使用地区。只看“开源”两个字就默认什么都能做很容易出问题。二、先看面板五步筛掉不属于你的模型完整模型名被拆成四段信息按顺序看就行。先拿一个真实跑过的名字开刀Qwen3.5-35B-A3B-6bit它像 Wi-Fi 密码其实只要拆成四块你看到的翻译成人话对选型有什么用Qwen3.5品牌和版本用来区分家族与代际35B模型总共约 350 亿参数数字越大通常越占空间A3B每次干活时大约启用 30 亿参数它用了“专家分工”的 MoE 结构6bit压缩后的精度位数越低通常越省内存模型名里的 B 约等于十亿T 约等于一万亿。参数量可以粗略帮你判断模型有多大却不能直接代表它有多聪明。MoE 可以想成一家有很多专家的公司。所有专家的档案都要存在电脑里每次任务只请几位出来工作。所以它可能跑得很快下载文件却依然很大。再看另一个已经实测的版本Qwen3.8-27B-8bit它没有 A3B每次任务都会动用整个 27B 模型。这种“全员一起工作”的结构叫稠密模型。所以 3.8 的数字看起来更小实际运行可能比 3.5 慢很多。“量化”就是给模型做压缩4bit / 6bit / 8bit 是不同的压缩档位。压得越厉害模型越容易装进电脑回答质量也可能受到影响。选型时先看它能不能装下再看实测质量。后缀不用全背。普通用户优先找 Instruct / Chat这是已经学会按要求回答的版本Base 主要留给开发者继续训练。Thinking 更愿意花时间推理通常也更慢VL / Vision 表示能看图片或视频但“能看”不等于“能画”。剩下三个词只管文件怎么运行MLX 适合 Apple 芯片 MacGGUF 是 Mac、Windows、Linux 都常见的格式safetensors 只是文件格式不能说明模型强不强。但看懂名字只是开始。为了不让后面的全景再次变成名单给你一条五步筛选线步骤要回答的问题游戏里的说法1. 任务我要聊天、读图、改图还是生成视频最终要交付什么先选赛区2. 设备我有多少可用的内存或显存用 Mac 还是 NVIDIA 显卡看召唤成本3. 许可能否商用、公开发布、继续训练或者把修改版分享给别人查通行证4. 候选在前三项都满足的模型里留下最多三个组队不囤卡5. 实测用自己的十个真实任务比较质量、速度和稳定性上场打一局后面看到任何榜单都按这五步走。先排除用不上、装不下和许可不合适的模型剩下的才值得下载。三、语言赛区国产六雄比的不是同一件事语言模型榜单很像总成绩表可榜上的模型并不在做同一份工作。有的负责冲能力上限有的负责进入普通电脑。看一家厂商时要把“今年最新的旗舰”与“这家已经开放、适合个人设备的型号”分开。六家都在做语言模型但擅长的任务、开放的小型号以及现成工具和教程的数量都不同。把六家的官方模型库放在一起看千问的个人型号最齐但能在普通电脑上运行的国产模型远不止千问一家。表里的“多模态”指一个模型除了文字还能处理图片、视频等内容“长上下文”指它一次能读进去更多材料。国产阵营英雄称号2026 年旗舰看什么个人设备有哪些真实入口一句话结论Qwen全栈工程师Qwen3.8 同时有个人设备可以研究的 27B以及面向实验和服务器的两款 MoEQwen3.5 有 0.8B、2B、4B、9B、35B-A3B另有 27B 等版本与大量压缩格式尺寸、看图能力和运行格式最齐最容易找到适合自己电脑的一档DeepSeek推理判题王V4-Pro-0813、V4-Flash-0731 主攻推理、代码和一次读取很长的材料R1 蒸馏版有 1.5B、7B、8B、14B、32B、70B个人电脑可以跑 R1 蒸馏版它学了 R1 的推理方法并非缩小后的 V4Kimi长卷侦察员K3 是 2.8T 的多模态旗舰Kimi-VL-A3B 和 Moonlight-16B-A3B 都是总参数约 16B、每次激活约 3B有个人候选但型号梯队没有千问那么宽A3B 也不代表只需存 3B 权重GLM任务指挥官GLM-5/5.2 面向长任务、代码以及让 AI 自己调用工具、分多步干活GLM-Z1-9B、GLM-4.1V-9B、GLM-4.6V-Flash以及 31B 的 GLM-4.7-Flash文字和看图都有中小型号普通设备完全可以研究MiniMax跨媒体导演M3 是 427B、可处理多种内容的旗舰官方有 SynLogic-7B 等专用研究模型但通用语言主线没有完整的小尺寸梯队普通人想装通用聊天模型暂时不必优先从 MiniMax 开始混元重工业总工Hy3 是 295B 总参数、每次激活约 21B 的 MoE通用语言有 0.5B、1.8B、4B、7B看图还有 Youtu-VL-4B、Penguin-VL-2B/8B它和千问一样覆盖小模型只是社区教程和现成量化相对少“蒸馏”和“A3B”很容易看错。DeepSeek-R1-Distill-Qwen-7B 是把大模型的推理方法教给一个 7B 底座它不是 DeepSeek V4 的迷你版。Kimi-VL-A3B 的 A3B 表示每次大约激活 3B 参数完整的 16B 权重仍要下载和存放。海外模型也有大有小Gemma 有轻量版本gpt-oss-20b 适合本地推理和调用工具Llama 的教程与衍生版本很多Mistral 则以小模型和多语言见长。按自己的任务挑候选即可不需要一次全装。下面先按任务找候选电脑能装多大的模型第六章再看。你要做的事应该找什么能力第一批可测试的国产候选日常聊天、改写和文档摘要4B–9B 的Instruct/Chat模型Qwen3.5-4B/9B、Hunyuan-4B/7B、GLM-Z1-9B数学推理、代码分析推理版或代码版不要求看图DeepSeek-R1-Distill-7B/14B、GLM-Z1-9B、Qwen 对应尺寸的推理/代码型号看图片、表格、PDF 和写分镜名字或模型页明确写着VL/VisionQwen3.5-4B/9B、GLM-4.1V-9B、Kimi-VL-A3B、Youtu-VL-4B处理很长的材料一次能读进很多内容还要实测长文是否读得稳Kimi-VL-A3B、Qwen 和 GLM 的多模态型号只偶尔写文案、又想用最新旗舰不需要本地部署直接用云端四、图片赛区会画只是入场券图片模型已经分出好几门功课文字排版、修图、角色一致和参考图控制。只看一张官方样片就像只看球员的定妆照根本不知道上场会不会掉链子。先用四个问题缩小范围你要从零画还是改现有图片图里有没有中文角色要不要一直长得一样结果准备自己玩还是拿去接商单阵营英雄称号它最适合解决什么使用前先知道Ideogram 4海报排字手画面里有文字、海报和明确版式这个 NF4 压缩版采用非商业许可下载前还要同意条款Qwen Image中文排版师汉字、信息图和知识型画面在线新版本上线不等于同名模型文件已经开放本地安装前要核对官方下载页和许可HiDream-O1-Image修图老炮一套模型里做生成、编辑和人物一致采用 MIT 许可但现成教程和工作流程还不如 Stable Diffusion 多FLUX.2 [dev]质感重装画师高质感生成、修图和多张参考图原版体量大模型许可也不是 Apache/MIT先找明确的压缩版本和省内存教程Stable Diffusion模组百宝箱用风格小模块 LoRA、构图控制工具 ControlNet 和其他插件精确控制画面需要自己组合模型、插件和参数上手要多花一些时间HunyuanImage 3.0重型图像总工观察生成、理解、编辑和多图融合的能力上限官方本地示例默认使用多张显卡普通人不适合从它开始不用背这六个名字按任务留下候选就行中文海报和信息图先看 Qwen Image、Ideogram 4。修现有图片或保持同一个人物先看 HiDream-O1-Image、FLUX.2。固定画风、姿势和构图Stable Diffusion 的控制工具与教程最多。观察能力上限可以看 HunyuanImage 3.0偶尔生成几张图直接用云端更省事。接商单时要查两份规则模型文件能不能商用生成的图片能不能商用。两者可能不同。一个产品能在线使用也不能证明它的最新模型文件已经开放下载。五、视频赛区最强的模型可能根本进不了你的显卡有的模型能自己生成声音有的主打 720p 单卡运行还有的只适合研究机构。视频模型最吃硬件。一张图只处理一个画面视频还要连续管动作、镜头、角色长相和声音。2026 年的看点已经从“让图片动起来”变成了能不能听懂参考素材、保持人物一致、控制镜头甚至把对白和环境声一起做出来。进步很快硬件要求也很高。分辨率越高、时长越长通常越吃显存也要等得更久。选模型时要一起看它能接收哪些素材、会不会自己生成声音、实际分辨率、最低显存、耗时和许可证。阵营英雄称号它最适合解决什么使用前先知道MiniMax H3声画导演同时参考文字、图片、视频和音频连画面与立体声一起生成本地 H3-Base 直接生成 768p做到 2K 还要再跑一套放大流程并且使用专门的社区许可Wan2.2 TI2V-5B720p 实干派用同一个 5B 模型做文生视频和图生视频官方输出为 720p、24fps每秒 24 帧采用 Apache 2.0单张显卡运行时至少需要 24GB 显存HunyuanVideo 1.5显存精算师用“把部分计算暂放到内存”的办法降低显存门槛官方写的最低显存是 14GB但参考环境是 LinuxWindows 仍需单独实测LTX-2.5声画挑战者自己同时生成画面和声音支持多镜头也能用自己的材料继续训练压缩版怎么安装、能否商用都要按具体版本确认MAGI-2八卡极限组展示开放视频模型的研究上限官方要求八张面向机房的高端 NVIDIA 显卡个人设备不用考虑选视频模型时也按任务缩小范围画面、对白和环境声一起做先看 MiniMax H3。从文字或图片生成标准 720p 短片先看 Wan2.2 TI2V-5B。愿意多用系统内存换取更低显存要求可以研究 HunyuanVideo 1.5。LTX-2.5 适合继续研究声音、多镜头和训练MAGI-2 看看结果即可不必当作个人安装目标。“消费级”只是说这张显卡普通人可以买到并不代表每一张消费显卡都能运行同一个模型。如果只是偶尔生成几支短片又想随时用最新模型云端通常更省事。本地视频更适合三类人愿意等待、会反复使用同一套流程并且希望素材留在自己电脑里。六、硬件赛区你的电脑究竟装得下谁该不该买AIPC统一内存是 CPU 和 GPU 共用一池资源普通独立显卡电脑的系统内存和显存则是两池资源不能直接相加。模型选型最后会落到一个很朴素的问题它能不能住进你的电脑文中的 CPU 是电脑的主处理器GPU 是擅长同时做大量计算的图形处理器也是很多 AI 程序真正使用的部分。正准备买电脑先选硬件类型先别急着比较跑分。2026 年名字里带“AI”的电脑至少已经分成下面六类。它们的用途差别很大硬件类型常见代表适合做什么买前先知道NPU AI PCIntel Core Ultra、AMD Ryzen AI、Snapdragon X 系列笔记本NPU 是一块低功耗 AI 专用芯片适合会议降噪、实时字幕、系统搜索和受支持的小模型Copilot PC要求 NPU 达到 40 TOPS。TOPS 是每秒理论计算量这个数字不能证明机器能流畅运行 27B 大模型Apple 统一内存电脑Apple 芯片 MacCPU 和负责图形计算的部分共用一大池内存适合本地语言、看图和 MLX 软件内存大能放下较大的模型但很多为 NVIDIA 显卡开发的图片、视频插件不能直接在 Mac 上运行大内存 APU / 迷你工作站Ryzen AI Max 395一类设备APU 可以理解成处理器和集成显卡装在一起并共用内存这类设备最多有 128GB 统一内存大内存解决模型能否放下AMD 驱动和具体软件是否支持才决定它能否顺利运行NVIDIA 独显电脑GeForce RTX、RTX PRO 台式机和工作站NVIDIA 的 CUDA 加速平台拥有大量现成教程和插件图片、视频流程最成熟系统内存和显卡自带的显存不能直接相加能装下模型也未必跑得快桌面 AI 工作站NVIDIA DGX Spark与其他采用 GB10 芯片的设备配有 128GB 统一内存和整套 NVIDIA AI 软件官方定位是最高运行 200B 模型、继续训练 70B 模型它采用 Arm 处理器和 DGX OS软件环境不同于常见的 Windows 电脑。官方说“支持 200B”也没有承诺所有 200B 模型都跑得快国产 AI 专用机原型小米 AI Cube已公开演示在本地切换 120B 大模型和 3B 小模型说明国产厂商也在做专门运行本地 AI 的桌面盒子目前仍是原型机。价格、量产时间、完整规格和第三方模型兼容性都还不能当成确定信息选购时可以这样记AI PC 主要看低功耗 NPU本地大模型先看内存本地画图和视频先看显存与软件支持。 TOPS 表示理论计算量参数量表示模型规模内存或显存决定模型能否装下。三个数字各管一件事不能混在一起比较。已经有电脑直接看内存或显存回到目前最常见的个人设备Mac 和 NVIDIA 台式机的优势也不在同一个地方。Apple 芯片 Mac 使用“统一内存”处理器和图形部分可以共用这池内存。它像一间共用仓库比较容易放下较大的语言和看图模型。但标称容量不会全部交给模型系统和其他软件也要占一部分。NVIDIA 显卡则像一张速度很快的专用工作台。图片、视频、ComfyUI 和大量现成插件都优先支持它。但请记住系统内存和显卡显存是两件事。 比如一台电脑有 32GB 系统内存、8GB 显存判断图片和视频模型时先看的仍然是 8GB 显存。下面这些范围更适合拿来选择第一个模型。机器经过专门调试后可能跑得更多新手从这里开始更稳妥。语言、图片和视频的要求不同所以分成两张表。想聊天、写作、读文档或看图你手里的设备建议从哪档开始先明白什么只用 CPU或没有可用的独立显卡1B–4B 量化语言模型能跑但速度通常慢先用小模型确认自己是否真有本地需求8–16GB 统一内存的 Apple 芯片 Mac1B–7B 量化模型系统也要占内存8GB 机型要从更小的版本试24–36GB 统一内存的 Apple 芯片 Mac7B–14B 量化模型可以把文字和看图模型当主力但仍要留出系统空间48–64GB 统一内存的 Apple 芯片 Mac20B–35B 量化模型或总体量相近的 MoE“每次激活得少”会影响速度不代表整个模型不占内存6–8GB 显存的 NVIDIA 显卡1B–7B 量化模型超出显存后可以借系统内存但速度会明显变慢12–16GB 显存的 NVIDIA 显卡7B–14B 量化模型适合日常文字、代码和中小型看图模型20–24GB 显存的 NVIDIA 显卡14B–32B 量化模型能不能全放进显存还要看一次读入多少内容以及使用什么运行软件48GB 以上显存或多卡更大的量化模型与最新巨型模型开始进入工作站或服务器领域成本还包括供电、散热和软件配置想在本地画图或生成视频你手里的设备图片从哪里开始视频从哪里开始没有独立显卡优先用云端或只测有原生支持的轻量图片模型不建议把本地视频当第一个部署项目Apple 芯片 Mac可以跑明确支持 macOS 的图片流程常见关键词有 MLX、Metal能跑某个模型不代表主流插件都支持安装前先看项目是否明确写了 macOS6–8GB 显存的 NVIDIA 显卡从轻量或优化过的工作流开始优先云端别用一条社区成功案例代表所有模型12–16GB 显存的 NVIDIA 显卡大多数省过显存的本地图片流程只选别人已经明确跑通的压缩版、内存分担版或低显存流程20–24GB 显存的 NVIDIA 显卡更大的图片模型和更高分辨率可以进入 Wan2.2 5B 这类有官方单卡条件的 720p 路线48GB 以上显存或多卡重型图片模型与多图流程更高分辨率、更长时长和研究型模型AMD 或 Intel 独立显卡先查项目是否明确支持这类显卡NVIDIA CUDA 教程不能直接照抄软件兼容性比纸面显存更早决定能否开始选模型的最小流程就五步先写任务 → 查许可证 → 看内存或显存 → 留下候选 → 最后用自己的任务实测。然后准备十道你真的会遇到的任务。写作者放真实文稿设计师放参考图程序员放正在维护的代码视频创作者直接测分镜和提示词。榜单只负责给你候选这十道题才负责帮你做最后决定。你可以现在就复制这张选型卡text真实任务 最终要交付的东西 设备类型CPU / Apple 芯片 / NVIDIA / AMD / Intel 系统内存 显卡显存如果有 操作系统macOS / Windows / Linux 是否商用或公开发布 第一轮候选最多三个 十道真实测试题放在哪里这张卡能填完后面的安装才值得开始。它比在评论区问“哪个最好”可靠得多也能避免为了一个根本用不上的模型去买新硬件。七、同一张图两代千问谁更会当导演榜单只能帮我们缩小范围。参数更大、版本更新都不能直接推出“更适合我”。我选 Qwen 做这一轮实测看中的是它同时覆盖文字、看图和多个尺寸Apple 芯片又有现成的 MLX 版本。Qwen3.5 和 Qwen3.8 还能放进同一台 Mac、同一套运行工具里比较少掉许多无关变量。这里才需要把 Qwen3.8 的三个版本分开Qwen3.8-27B个人设备更有机会运行的稠密多模态版。Qwen3.8-Flash-NextQwen4 架构的实验预览语言主体 125B、每次激活约 6B整份模型依然很大并使用 Qwen Community License 1.0。Qwen3.8-2.4T-A95B总参数 2.4T、每次激活约 95B主要面向服务器。这轮测试选择 27B因为它能放进本机也能同时完成文字和看图任务。后两款体量与用途不同放进同一场个人电脑测试并不公平。本轮测试机是一台拥有 48GB 统一内存的 Mac M5 Pro。两位参赛者分别是 Qwen3.5-35B-A3B-6bit 和 Qwen3.8-27B-8bit。它们使用同一张 2100×1200 图片、同一份提示词控制回答随机程度的 temperature 都设为 0。3.8 另外复测一次因为软件第一次处理图片时要先做准备耗时会偏高。两款参赛模型的结构也不同3.5-35B-A3B 是 MoE3.8-27B 是稠密模型。我给它们的考卷很简单text1. 用 180 字向小白解释什么人需要本地模型什么人不需要 2. 提取图片里五项可以直接核对的信息 3. 把这张图片改成四个视频镜头 4. 分镜只返回 JSON不要添加其他格式。JSON 是一种字段整齐、方便程序继续读取的文本格式。四道题会依次检查它能不能把话讲明白、准确看图、写出能拍的分镜并把结果交给下一套工具继续处理。相比只问一道数学题这些任务更接近创作者平时会做的事。先看速度任务Qwen3.5Qwen3.8 复测本机差距文字科普1.75 秒18.59 秒3.5 约快 10.6 倍图片理解6.81 秒26.01 秒3.5 约快 3.8 倍看图分镜12.20 秒83.85 秒3.5 约快 6.9 倍模型名字里的总参数不等于每次回答实际要动用的参数。Qwen3.5 的 A3B正是它跑得快的重要原因。3.5 的速度几乎是断层领先。可我们还要看答案能不能直接用。图片信息提取这一题两者都是 5/5没拉开差距。到了科普题3.5 擅自加入“显存低于 16GB 难以流畅运行主流模型”的粗暴红线把小模型、量化和 Mac 统一内存一刀切掉。3.8 则从数据敏感、离线使用和深度定制三个真实需求出发还提醒普通问答用户不必为了本地部署买新硬件。分镜差距更直观。3.5 很快交出四镜但从“欢迎来到今天的科普短片”起手还把文件指纹和临时存放地址也就是哈希和缓存路径完整写进旁白像把截图重新念了一遍。3.8 会安排卡片依次亮起、文字逐行打印、终端泛起绿光动作更具体旁白也更短更接近能交给视频模型的拍摄清单。3.8 也没有满分。提示词要求“只返回严格 JSON”两个模型都在最外面多套了一层显示代码用的边框也就是 Markdown 代码框。人在聊天框里看不受影响交给程序读取时却可能报错。这种小毛刺榜单通常不会告诉你。这次三道题不能证明 3.8 在所有任务上都更强却足以帮我分工你更在意什么本机实测更适合谁批量打草稿、快速初筛之后自己修改Qwen3.5重点内容、少量高价值分镜愿意多等一会儿Qwen3.8不允许输出格式出错的自动流程两者都不能直接放行还要先删掉多余的代码框我最后留下 3.8理由很简单少量分镜的可执行性对我更重要。要是一天要批量跑几百条草稿我会做出相反的选择。分镜写得像样只能算纸面得分。把它交给视频模型能不能拍出来才是下一道题。八、把提示词交给 H3成片才是答案我把视频赛区里的 MiniMax H3 装到了另一台 Windows 电脑。它的本地 768p 工作流会同时生成画面和音轨正好适合检查开放视频模型已经走到哪一步。先看结果RTX 5070 Ti 16GB 成功生成了 1344×768、约五秒、带声音的视频。完整复测从 Mac 提交任务到下载成片用了 338.26 秒约 5 分 38 秒最高显存占用 13,885MiB约 13.6GiB。从左到右依次截取生成视频中的五个时间点。它能完成“任务发出—信号移动—台式机响应—结果出现”的连续表达但连接线和设备位置并非完全稳定。下面再看这次结果是怎么测出来的。这台测试机使用 RTX 5070 Ti 16GB 显存和 48GB 系统内存运行 ComfyUI 0.31.0 与本地压缩版 H3。ComfyUI 可以理解成视频模型的装配台每个方块负责一步工作例如加载模型、读取提示词、反复计算画面、把计算结果还原成视频或者保存文件。把这些方块连起来最后得到 MP4。我没有把“网页能打开”当作成功而是分三次往上加压力表里的“帧”可以理解成一张张连续画面24fps 就是每秒播放 24 帧。MiB / GiB 是电脑记录容量时常见的单位可以近似看成 MB / GB。实测输出这次确认了什么低分辨率压力测试608×352、124 帧、5.167 秒、20 steps20 轮生成计算约 61 秒完成最高记录到 15,452MiB约 15.1GiB显存、显卡利用率 99%没有因为显存不够而中断第一次 768p 成片1344×768、124 帧、24fps、5.167 秒文件里有常见的 H.264 画面和 AAC 双声道音轨但当时漏记了耗时和最高显存占用768p 复测1344×768、124 帧、24fps、5.167 秒、20 steps20 轮生成计算ComfyUI 自报 336.59 秒Mac 从提交到下载共 338.26 秒最高显存占用 13,885MiB约 13.6GiB显卡利用率到过 100%低分辨率测试与 768p 复测的显存数字来自不同时间记录方式也不同不能据此得出“分辨率越低反而越吃显存”。这些数字只能说明各自那次任务发生了什么。复测时我没有只靠眼睛盯着任务管理器。我从 Mac 提交任务同时每 1.5 秒记录一次 Windows 显卡状态。任务编号、决定生成结果随机变化的种子、显卡使用记录和成片信息都保存了下来。以后回看时可以知道这次任务用了什么设置、跑了多久、显卡占了多少。这支视频的要求并不复杂Mac 发出任务一束金色信号沿着连接线跑向 Windows 台式机显卡开始工作最后显示器出现成片。H3 基本拍对了这个顺序结尾画面也比较稳定。问题也很明显。提示词只写了一根连接线画面里却分裂成了多根发光线镜头移动时桌面设备的相对位置也会变化。另一支 864×480 测试更明显当我在最后 1.6 秒同时要求落地、屈膝、滑行、抓梯和回头约 3.4 秒后角色姿势、外观和镜头方向开始跳变。我后来把这次失败总结成一句提醒五秒视频不要塞进五个连续动作。H3 能把提示词变成一段视频但不会替你自动删掉过量的导演要求。音频也要单独检查。复测文件里确实有 32kHz AAC 双声道音量检测也能测到声音。这只能证明 H3 生成了音频并把它写进 MP4声音好不好听、能不能商用还需要真人试听。这次结果只代表这台机器和这套五秒任务。换成其他 16GB 显卡结果可能不同长视频、多人物和复杂动作也需要重新测试。本地跑通的是 H3-Base 768p。完整 2K 还没有在本地跑通。H3 使用自己的社区许可并未采用 Apache 2.0 或 MIT。公开发布这支成片时我会注明本视频由本地部署的 MiniMax H3 生成。