资讯动态

SadTalker 音频驱动说话头像视频:模型文件下载与配置完整指南

发布时间:2026/9/12 15:35:57 来源:尧图企业网站定制
SadTalker 音频驱动说话头像视频模型文件下载与配置完整指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一个音频驱动的单图说话头像视频生成项目CVPR 2023输入一张肖像图片和一段音频输出带口型与头部动作的视频。代码仓库本身不含任何模型权重跑推理前必须先完成 SadTalker 模型下载把 checkpoints 与 GFPGAN 增强模型放到指定目录。本文给出模型文件清单、下载方式对比、期望的目录结构和最小验证命令帮你把 SadTalker 模型配置一次做对。模型文件清单SadTalker 实际会读取的文件先建立「文件 → 功能」的映射再开始下载文件作用规格/分辨率是否必需checkpoints/SadTalker_V0.0.2_256.safetensors新版打包主权重audio2pose 姿态网络、audio2exp 表情网络、facevid2vid 渲染模型--size 256时加载256×256 面部渲染必需256/512 按渲染分辨率二选一checkpoints/SadTalker_V0.0.2_512.safetensors同上--size 512时加载512×512 面部渲染必需与 256 版二选一checkpoints/mapping_00229-model.pth.tarMappingNet把人脸特征映射到 StyleGAN 潜空间默认 crop 模式使用—必需默认模式checkpoints/mapping_00109-model.pth.tar同上--preprocess full全身模式使用—仅全身模式必需gfpgan/weights/下 4 个.pthalignment_WFLW_4HG、detection_Resnet50_Final、parsing_parsenet、GFPGANv1.4人脸对齐、检测、语义解析与 GFPGANv1.4 人脸增强—可选加--enhancer gfpgan时必需注意src/utils/init_path.py的分发逻辑checkpoints/目录下只要存在任意.safetensors就按新版加载文件名中的分辨率必须与--size一致否则打印 WARNING 并回退到逐个加载旧版.pth文件。混用新旧版本是加载报错的常见根源。下载方式对比与选型途径适用场景说明官方脚本scripts/download_models.shLinux/macOS首选一条命令下齐 checkpoints 与 gfpgan 权重内部使用wget -nc已下载文件自动跳过中断可续传GitHub ReleasesOpenTalker/SadTalker 的 v0.0.2-rc 标签只缺个别文件、需要手动补下逐文件下载适合断点续传后的单文件重试Google Drive / 百度网盘提取码 sadt直连 GitHub 受限的环境官方离线打包国内环境优先百度网盘推荐顺序先跑脚本失败再切到 Releases 单文件下载国内网络不稳时直接走网盘包。脚本方式只需bash scripts/download_models.sh若仓库尚未克隆先执行git clone https://gitcode.com/GitHub_Trending/sa/SadTalker再按 docs/install.md 创建 Python 3.8 环境并安装requirements.txt中的依赖模型下载与依赖安装互不阻塞。落盘与目录核对期望的 checkpoints 目录结构脚本执行成功后项目根目录应呈现如下结构checkpoints/ ├── mapping_00109-model.pth.tar ├── mapping_00229-model.pth.tar ├── SadTalker_V0.0.2_256.safetensors └── SadTalker_V0.0.2_512.safetensorsgfpgan/weights/目录也由脚本创建放入清单表中 4 个.pth文件。代码中init_path写死从./checkpoints和./gfpgan/weights两个路径取文件把权重放到仓库根目录、src/或其他子目录推理启动时就会抛出 FileNotFoundError。最小验证命令跑一次确认配置依赖装好后用仓库自带素材跑一条最简推理python inference.py \ --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/art_0.png --cpu预期输出特征日志先打印3DMM Extraction for source image结尾打印The generated video is named: results/....mp4且results/下出现对应 mp4 文件。若日志中出现using safetensor as default说明新版.safetensors权重被正确选中。看到最终 mp4 命名行即为配置成功。故障速查现象可能原因处理方法下载中断文件大小偏小网络波动重新执行同一脚本wget -nc会自动续传并跳过已完成文件写盘失败、空间不足模型包总量数 GB预留至少 5GB 可用空间清理无关大文件后重试启动时打印 WARNING 并回退旧版权重checkpoints/缺.safetensors或--size与文件名分辨率不匹配按上文目录树补下对应分辨率的.safetensors保持--size一致FileNotFoundError: .../similarity_Lm3D_all.mat等路径错误文件放错目录或下载的是旧版目录结构逐项对照目录树摆放新版 BFM 相关.mat位于src/config/RuntimeError: unexpected EOF, expected ... bytes文件截断或损坏核对文件体积删除后重新下载对应单个文件完成以上步骤SadTalker 模型下载与配置即告完成后续参数调优、全身模式与增强选项的使用可查看 docs/best_practice.md运行期报错可先检索 docs/FAQ.md。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价