不少朋友最近都在问想在本地跑 ComfyUI 生成图片和视频再用本地大模型写剧本、拆镜头做一部“AI 短剧”出来到底该怎么配主机、怎么装环境、怎么把流程串起来网上的资料往往只讲某一个环节比如只教 ComfyUI 安装或者只讲显卡参数很少有人把“硬件搭配 软件部署 工作流串联 后期合成”整个路线讲完整。这篇文章就围绕“ComfyUI 本地大模型主机搭配方案 AI 短剧免费生成”这条主线从硬件选型开始一步步带你搭出一套能实际产出短剧片段的本地 AI 工作台。文中涉及的方案都以开源工具和免费模型为主全程不需要订阅付费服务但要注意免费指的是软件和模型的使用成本硬件投入和电费仍然存在。下面我们正式开始。1. 背景与核心概念1.1 AI 短剧是怎么生成的AI 短剧并不是某个工具一键生成一部电视剧而是一条“多环节流水线”。以目前最常见的做法为例大致链路如下用大语言模型生成剧本、角色设定、分镜描述。根据分镜描述使用 Stable Diffusion 系模型生成图像。使用图生视频模型或视频生成模型把静态图像变成动态镜头。用剪辑工具或 FFmpeg 把多个片段拼接起来配上字幕和音乐。这条链路里第 2 步和第 3 步最吃硬件也是最核心的部分。ComfyUI 在这里负责“图生图”和“图生视频”的节点化调度本地大模型则负责剧本创意和提示词生成。1.2 ComfyUI 是什么ComfyUI 是一个基于 Stable Diffusion 的开源图形化工作流工具。它把文生图、图生图、图像放大、视频生成等能力拆成一个个“节点”开发者通过连线把节点组织起来得到一个可复用的工作流。相比常见的 WebUIComfyUI 的优势主要体现在节点化操作让流程透明适合复杂组合和自动化。工作流可以导出为 JSON 文件方便保存、分享和二次开发。可以调用 API 接口适合批量出图和程序化控制。对显存管理更灵活部分场景下相比 WebUI 占用更低。对于 AI 短剧这种“批量生成、流程固定、需要反复调整”的场景ComfyUI 非常合适。1.3 本地大模型在这里承担什么角色本地大模型指的是部署在自己电脑或服务器上的大语言模型比如千问、Llama 3 等开源模型。它们负责短剧流水线里“内容创意”的部分根据一句话主题扩写完整剧本。把剧本拆成一幕幕分镜。把分镜内容转换成适合图像生成的英文提示词。生成角色对白便于后期配音和字幕。这里推荐使用 Ollama 这类工具来管理本地大模型部署简单命令少还提供了兼容 OpenAI 格式的本地 API方便 Python 脚本调用。1.4 为什么需要本地主机方案有人会问直接用在线工具不是更方便吗但从实际项目角度看本地方案有这几个核心价值无按张计费出图成本主要在电费。隐私可控剧本素材不出本机。断网也能继续生成部分内容。可以用 API 批量控制适合做长系列短剧。当然本地方案也有门槛最明显的就是硬件成本和技术门槛。这篇文章就是来降低这两个门槛的。2. 主机搭配方案2.1 核心选型思路先定 GPU再定整机AI 图像和视频生成主要依赖 GPU尤其是显存大小直接决定你能用什么模型、生成多大分辨率、一次能跑多长的视频。选主机的时候我建议先确定 GPU 型号和显存再围绕它选择其他配件。当前主流开源图像模型对显存的需求大致是这样生成任务建议显存说明SD 1.5 文生图4GB - 6GB入门体验出图速度快SDXL 文生图8GB - 12GB画质更好是目前短剧画面主力图生视频AnimateDiff 等12GB - 16GB可生成较短动画片段高质量视频生成模型16GB - 24GB分辨率更高、镜头更自然注意这里的数值是“建议显存”不同模型、步数、分辨率、视频帧数都会影响实际占用实际使用时应留出富余。2.2 三档主机配置参考下面给出三档配置思路价位和具体品牌请结合当前市场价格调整。重点是理解每一档的取舍逻辑。入门档以能跑 SDXL 出图为目标GPUNVIDIA RTX 4060 Ti 16GB 或同级 16GB 显存显卡。CPUIntel i5 或 AMD R5 级别的 6 核以上处理器。内存32GB DDR4 或 DDR5。硬盘1TB NVMe SSD推荐 2TB。电源650W 以上金牌电源。进阶档目标跑图生成视频流畅GPUNVIDIA RTX 4070 Ti Super 16GB 或 RTX 4080 系列。CPUIntel i7 或 AMD R7 级别。内存64GB。硬盘2TB NVMe SSD 4TB 机械仓库盘。电源850W 以上。生产力档目标多模型并行、长视频、批量渲染GPUNVIDIA RTX 4090 24GB 或多卡方案。CPUIntel i9 或 AMD R9 级别。内存128GB。硬盘4TB NVMe SSD 多块机械盘组 RAID。电源1000W 以上注意散热。NVIDIA 显卡目前对 PyTorch、CUDA 生态支持最好建议优先选择。AMD 和 Intel 显卡的兼容性在逐步改善但遇到算子兼容问题时排查成本较高新手不建议作为首选。2.3 操作系统与驱动操作系统方面Windows 11 和 Ubuntu Linux 都可以。Windows 对新手更友好大部分教程都是以 Windows 为基础写的Linux 在长任务稳定性和资源调度上有优势适合已经有 Linux 使用经验的人。驱动环境需要安装NVIDIA 显卡驱动。CUDA 工具包也可以安装 PyTorch 官方预编译版时自动带上对应的 CUDA 运行库。推荐使用 Anaconda 或 Miniconda 管理 Python 环境。3. 软件环境搭建3.1 安装 Python、Git 和基础环境ComfyUI 依赖 Python 和 Git。建议先安装 Miniconda再创建独立的 Python 虚拟环境。以 Python 3.10 环境为例conda create -n comfyui python3.10 conda activate comfyui pip install --upgrade pip如果你不确定使用哪个 Python 版本请以 ComfyUI 官方 README 推荐的版本为准。版本不匹配时最常见的现象是 pip 安装依赖时报二进制包冲突。3.2 安装并启动 ComfyUIComfyUI 支持直接通过 Git 克隆官方仓库运行git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI pip install -r requirements.txt国内网络环境下GitHub 拉取慢时可以改用国内镜像域名或者使用代理加速类工具这一点在 3.4 节详细讲。安装完成后启动python main.py正常情况下终端会输出本机地址To see the GUI go to: http://127.0.0.1:8188浏览器打开这个地址看到节点编辑界面就说明 ComfyUI 装好了。3.3 部署本地大模型 Ollama 千问Ollama 是一个开源的大模型管理工具支持一条命令下载并运行多种开源模型。千问是适合中文剧本生成的模型推荐从qwen2.5:7b开始体验。安装 Ollama以 Linux / macOS 为例curl -fsSL https://ollama.com/install.sh | shWindows 用户直接下载安装包即可。安装完成后拉取模型ollama pull qwen2.5:7b启动服务ollama serve验证接口是否可用curl http://localhost:11434/api/generate -d {model: qwen2.5:7b, prompt: 你好}看到模型返回文本内容说明部署成功。默认端口是 11434本地脚本调用时使用这个端口即可。3.4 模型下载与国内加速配置ComfyUI 和 Ollama 都需要下载模型文件体积少则几个 GB多则几十 GB。国内用户直接访问 Hugging Face 和 GitHub 时经常遇到速度慢、连接不稳定的情况。这里提供几种合规的加速思路使用国内的模型托管平台比如魔搭社区 ModelScope搜索所需模型后直接下载。设置 Hugging Face 镜像环境变量export HF_ENDPOINThttps://hf-mirror.com使用 GitHub 加速镜像拉取仓库比如将https://github.com/xxx/yyy.git替换为https://ghproxy.com/https://github.com/xxx/yyy.git。注意镜像地址和可用性可能随时间和网络环境变化如果失效请查看对应项目的最新说明不要盲目使用网上过时的命令。ComfyUI 的模型目录结构如下ComfyUI/ ├── models/ │ ├── checkpoints/ # 大模型文件如 SDXL、SD 1.5 │ ├── loras/ # LoRA 小模型 │ ├── vae/ # VAE 文件 │ ├── controlnet/ # ControlNet 模型 │ └── diffusers/ # diffusers 格式模型把下载好的模型文件放进对应目录回到 ComfyUI 页面点击“刷新”即可看到新模型。4. 核心工作流拆解4.1 用大模型生成剧本和分镜提示词AI 短剧的第一步是让本地大模型产出剧本。与其手动复制粘贴不如写一个 Python 脚本调用 Ollama API批量生成分镜提示词。示例脚本文件路径tools/generate_script.pyimport json import urllib.request OLLAMA_URL http://localhost:11434/api/generate def generate(prompt: str, model: str qwen2.5:7b) - str: data { model: model, prompt: prompt, stream: False } req urllib.request.Request( OLLAMA_URL, datajson.dumps(data).encode(utf-8), headers{Content-Type: application/json} ) with urllib.request.urlopen(req) as resp: result json.loads(resp.read().decode(utf-8)) return result.get(response, ) if __name__ __main__: topic 一个机器人穿越到古代开面馆的短剧 prompt f请为主题《{topic}》写一个短视频剧本要求 1. 共6个分镜 2. 每个分镜包含画面描述、镜头提示词、对白 3. 输出 JSON 格式。 print(generate(prompt))运行python tools/generate_script.py脚本的思路是通过 Ollama 的/api/generate接口让大模型直接输出结构化 JSON。有了 JSON 分镜数据之后下一步就可以把每个分镜的“画面描述”转换为英文章图提示词再喂给 ComfyUI。4.2 ComfyUI 文生图基础工作流ComfyUI 的界面由节点和连线组成一个最基础的文生图流程包含这几类节点模型加载器Load Checkpoint选择底模比如 SDXL。正向提示词CLIP Text Encode输入画面描述。空潜空间Empty Latent Image设置宽、高、批量数量。KSampler采样器控制步数、采样器类型、CFG。VAE 解码VAE Decode将潜空间数据转换为图像。保存图像Save Image输出最终图片。节点连接顺序是Load Checkpoint - KSampler - VAE Decode - Save Image CLIP Text Encode - KSampler Empty Latent Image - KSampler把分镜的提示词填入正向提示词节点点击“运行”即可出图。这里需要理解几个关键参数steps采样步数一般 20~30 步画质和速度平衡较好。CFG提示词引导强度SDXL 一般在 4~8 之间。sampler_name采样器推荐 Euler、Euler a、DPM 2M Karras。seed随机种子固定 seed 可以复现相同构图。4.3 图生视频节点当静态分镜生成后需要让画面“动起来”。ComfyUI 生态里常用的免费图生视频方案包括AnimateDiff在 SD 1.5 或 SDXL 底模上生成短动画序列。Stable Video DiffusionSVD通过单张图像生成短视频。Wan 2.1 视频生成模型支持文生视频和图生视频。CogVideoX 等开源视频模型。这些模型对应不同的自定义节点包。以 AnimateDiff 为例需要安装 ComfyUI 的自定义节点管理器然后搜索 AnimateDiff 相关节点进行安装。大致的节点扩展流程在 ComfyUI-Manager 中安装对应自定义节点。下载视频模型文件放入ComfyUI/models/animation_models或对应目录。在工作流中加入 AnimateDiff Loader 节点。设置帧数frame count比如 16 帧或 32 帧。运行后输出一组连续图片代表一个动态镜头。图生视频比文生图更吃显存如果显存不足建议降低分辨率、减少帧数或者开启 VAE tiled 解码。4.4 短剧素材与后期合成ComfyUI 批量生成的是一组组图片或视频片段真正变成“短剧”还需要后期合成。这里最有用的工具是 FFmpeg免费开源、命令行效率高。假设你已经在一个分镜目录下生成了frame_00001.png、frame_00002.png等序列帧可以用下面的命令合成视频片段ffmpeg -framerate 24 -i frame_%05d.png -c:v libx264 -pix_fmt yuv420p clip_01.mp4也可以把多个片段直接连接ffmpeg -f concat -safe 0 -i list.txt -c copy output.mp4list.txt的格式file clip_01.mp4 file clip_02.mp45. 完整实战从一句话剧本到短剧片段下面我们把上面介绍的流程串起来完成一个最简短的实战项目输入一句话主题自动生成剧本分镜再用脚本调用 ComfyUI API 批量出图最后用 FFmpeg 合成一段短视频。5.1 创建项目结构mkdir ai-short-drama cd ai-short-drama mkdir -p scripts prompts images output/clip_01结构说明scripts存放生成剧本和调用 ComfyUI 的 Python 脚本。prompts存放大模型生成的提示词文件。images存放批量生成的图片。output存放最终视频。5.2 生成剧本分镜 JSON沿用 4.1 节的脚本改造输出到一个 JSON 文件python scripts/generate_script.py prompts/script.json打开script.json你应该能看到一个包含 6 个分镜的 JSON每个分镜字段包含scene、description、prompt、dialogue等信息。这一步用到了刚才部署的千问本地大模型。5.3 批量生成图片提示词文件由于 ComfyUI 的 API 调用需要完整 workflow JSON这里介绍一种更稳健的思路不使用 API而是把提示词写到文件人工在 ComfyUI 节点中批量替换。先写一个脚本把每个分镜的提示词分别输出为 txt# 文件路径scripts/export_prompts.py import json with open(prompts/script.json, r, encodingutf-8) as f: script json.load(f) for i, scene in enumerate(script[scenes], start1): with open(fprompts/scene_{i:02d}.txt, w, encodingutf-8) as f: f.write(scene[prompt])这样得到prompts/scene_01.txt到prompts/scene_06.txt每个文件内容就是一个分镜的画面描述。5.4 使用 ComfyUI API 批量出图进阶ComfyUI 支持通过 HTTP API 提交工作流接口为POST http://127.0.0.1:8188/prompt调用前需要先在 ComfyUI 界面中设计好工作流然后通过界面菜单导出为 JSON。导出后的 JSON 结构类似{ prompt: { 3: { class_type: KSampler, inputs: { steps: 25, cfg: 7, seed: 12345 } } } }这里不展开完整 JSON因为不同版本节点编号不同。核心思路是解析导出的 workflow JSON把CLIPTextEncode节点的text字段替换成scene_XX.txt里的内容再把 seed 换成随机值然后 POST 到/prompt。Python 脚本伪代码import json import urllib.request def send_prompt(workflow: dict) - None: payload json.dumps({prompt: workflow}).encode(utf-8) req urllib.request.Request( http://127.0.0.1:8188/prompt, datapayload, headers{Content-Type: application/json} ) with urllib.request.urlopen(req) as resp: print(resp.status) # 替换文本并提交 workflow json.load(open(workflow.json)) workflow[6][inputs][text] open(prompts/scene_01.txt).read() send_prompt(workflow)这种方式适合已经熟悉 ComfyUI JSON 结构的朋友。第一次尝试时建议先在界面上把一张图跑通再考虑 API 自动化。5.5 用 FFmpeg 合成最终视频图片生成后进入images目录执行合成命令cd images ffmpeg -framerate 24 -i scene_%02d.png -c:v libx264 -pix_fmt yuv420p ../output/short_drama_clip.mp4 cd ..这样你就得到了一个由 6 张分镜图合成的 MP4 片段。如果分镜图是一组视频帧命令类似只是输入文件名模式会变成帧序号。加上音频的示例ffmpeg -i output/short_drama_clip.mp4 -i bgm.mp3 -c:v copy -shortest output/short_drama_audio.mp46. 常见问题与排查思路本地部署 AI 工具链报错是常态。下面整理一些高频问题按“现象 - 原因 - 解决”的方式给出建议。问题现象常见原因解决思路ComfyUI 启动后无法打开页面端口被占用 / 启动过程报错查看终端日志换端口启动python main.py --port 8189报错 CUDA not availablePyTorch 版本与显卡驱动不匹配检查nvidia-smi驱动版本重新安装对应 CUDA 版本的 PyTorch生成图片全黑或花屏缺少 VAE / 模型与 VAE 不匹配下载对应 VAE 文件放到 models/vae并在工作流中加载显存不足 OOM分辨率、batch、帧数设置过高降低分辨率batch size 设为 1开启 tiled VAE模型下载慢或中断网络环境导致国际站点访问不稳定使用 ModelScope 或国内镜像下载Ollama 接口连接失败服务未启动 / 端口错误运行ollama serve确认 11434 端口未被占用AnimateDiff 节点报错未安装对应依赖或模型文件缺失检查自定义节点文档补齐模型和 Python 依赖FFmpeg 找不到文件文件名序号不连续或通配符不匹配用ls查看实际文件名调整%05d的位数这里挑两个典型问题展开说明。第一个是“CUDA not available”。大部分情况不是显卡驱动没装而是 PyTorch 下载到了 CPU 版本。安装 PyTorch 时务必根据你的驱动 CUDA 版本选择对应的安装命令不要直接用默认的pip install torch。第二个是“显存不足”。短剧工作流中文生图和图生视频对显存需求量很大。遇到 OOM 时优先按这个顺序排查降低出图分辨率把 batch size 调成 1关闭不需要的后台程序使用 ComfyUI 的--lowvram启动参数。7. 最佳实践与工程建议7.1 工作流要版本化管理ComfyUI 的工作流 JSON 是纯文本强烈建议纳入 Git 管理。每次调整节点、参数、模型后及时提交方便回滚到可用的版本。短剧规模越大工作流版本越重要否则遇到一次误操作可能损失整套流程配置。7.2 显存与批处理策略优先追求稳定再追求速度。批量生成时建议先单张验证提示词效果再扩大到多 batch。需要反复生成的短剧镜头固定 seed 可以提高一致性方便后期挑选。7.3 素材与模型目录规范为短剧项目单独建立素材目录按集数、场次、镜头命名。模型文件按类型放入 ComfyUI 对应目录不要混放。项目做到一半时最怕找不到哪个模型对应哪一组图片规范命名能节省大量时间。ai-short-drama/ ├── episodes/ │ └── ep01/ │ ├── scenes/ │ ├── images/ │ ├── audio/ │ └── output/7.4 合规使用模型与内容免费使用开源模型不等于可以随意使用生成内容。需要留意部分开源模型采用特定的许可证商用和二次分发有条件限制。不要使用真实人物肖像生成不当内容不要生成违法违规、侵犯他人权益的素材。配乐、字体、图片素材也需要确认授权范围。AI 工具只负责生成内容责任在创作者本人。7.5 定期备份模型文件动辄几十 GB重装系统或误删除后重新下载非常痛苦。建议把重要模型文件备份到机械硬盘或 NAS生成好的关键帧素材也定期导出。生产环境长期跑批处理时可以编写一个简单的备份脚本把关键目录同步到备份盘。8. 总结与接下来可以学什么本篇文章从硬件选型开始讲清楚了 AI 短剧生成的完整链路本地大模型负责剧本和分镜提示词ComfyUI 负责图像和视频生成FFmpeg 负责后期合成。同时给出了三档主机搭配方案、软件安装步骤、核心工作流拆解以及一个从一句话剧本到短视频片段的实操案例。接下来如果你想继续深入可以从这几个方向入手学习 ComfyUI 自定义节点开发把短剧流程做成一键运行的工作流。研究 ControlNet让分镜构图更可控比如用姿态、深度图约束角色动作。学习 LoRA 训练让同一角色在不同镜头中保持脸部一致。尝试接入更多开源视频生成模型探索属于自己的短剧风格。AI 短剧的本地生成流程仍在快速发展模型和工具更新很快但底层的硬件思路、工作流思想和工程化方法不会过时。只要把基础环境搭稳后续新增模型和工作流都只是“下载文件 添加节点”的事。如果这篇文章对你有帮助可以收藏备用。下次你准备配新主机或者想跑通一条完整的本地 AI 短剧流水线时再翻出来对照着一步步做能少走不少弯路。