资讯动态

SadTalker:部署实战指南(音频驱动说话人脸动画)

发布时间:2026/9/12 9:25:20 来源:尧图企业网站定制
SadTalker部署实战指南音频驱动说话人脸动画【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 能把你的一张人像照片和一段音频变成会说话的头像视频输入输出都走本地命令行不依赖任何在线服务。这份安装部署指南面向第一次跑它的新手有基础 Linux 操作经验即可全程只依赖 conda、pip 和 bash 脚本。跑通后你还能顺带理解它的模型文件和推理参数该怎么配。30 秒快速通道如果你的机器有 NVIDIA 显卡、显存 4GB 以上三条命令就能出片# 1. 拉取代码仓库 git clone https://gitcode.com/GitHub_Trending/sa/SadTalker.git# 2. 创建 conda 环境、装 PyTorch、装依赖、装 ffmpeg conda create -n sadtalker python3.8 conda activate sadtalker pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113 conda install ffmpeg pip install -r requirements.txt# 3. 下载全部模型权重 cd SadTalker bash scripts/download_models.sh跑一条推理输入和音频仓库里都带了示例直接抄python inference.py --source_image examples/source_image/art_2.png \ --driven_audio examples/driven_audio/chinese_poem1.wav输出会存到results/$时间戳/*.mp4。赶时间的话到这一步已经能出视频了剩下四节讲每一步为什么这么做、卡住时怎么修。选配置并搭好 Python 环境先按显存对号入座SadTalker 的吃显存大户是渲染分辨率4GB 是 256 分辨率的可用下限硬件档位GPU显存推荐参数10秒音频预期耗时入门GTX 1060 6G / RTX 30504~6GB--size 256 --batch_size 11~2 分钟主流RTX 3060 / 30708~12GB--size 512 --batch_size 230~60 秒高端RTX 3090 / 409016GB--size 512 --batch_size 420~40 秒纯 CPU任意 x8616GB 内存--cpu --size 25610 分钟以上conda 环境是最省心的选择原因是 requirements.txt 里锁死的 numpy 1.23.4、face_alignment 1.3.5 这些包只提供了 Python 3.8 的预编译二进制换新 Python 版本装的时候很容易在编译环节翻车。# 建环境并激活 conda create -n sadtalker python3.8 conda activate sadtalker依赖分两层装。必装层PyTorch 单独立户带 CUDA 11.3 构建再装 ffmpeg 和其余依赖——这样做是因为 requirements.txt 里没有 torch先装好可保证不会被后续依赖悄悄替换版本# GPU 用户CUDA 11.3 pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113# CPU 用户没有 NVIDIA 显卡 pip install torch1.12.1cpu torchvision0.13.1cpu torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cpu# ffmpeg 负责编解码输出视频依赖锁版防止互相打架 conda install ffmpeg pip install -r requirements.txt关键版本一览冲突时对照它就能定位包版本干什么用torch1.12.1推理主框架numpy1.23.4数值计算被大量库锁版face_alignment1.3.5人脸关键点检测先于裁剪librosa0.9.2音频转梅尔频谱kornia0.6.8可微几何变换basicsr / facexlib1.4.2 / 0.3.0GFPGAN 人脸增强的底座可选层只有一个Gradio 网页演示想带文本转语音时才需要pip install TTS纯命令行推理完全用不到。装完随手验证一下设备是否识别正常# 确认 CUDA 可用true 即代表 GPU 模式就绪 python -c import torch; print(torch.cuda.is_available())把模型文件放对位置SadTalker 的模型文件分两处落盘checkpoints/放核心权重gfpgan/weights/放人脸增强权重。清单如下先建立全局认知文件大小量级放置路径作用SadTalker_V0.0.2_256.safetensors~1.2GBcheckpoints/256 分辨率面部渲染SadTalker_V0.0.2_512.safetensors~1.2GBcheckpoints/512 分辨率面部渲染mapping_00229-model.pth.tar~200MBcheckpoints/MappingNet默认 crop 模式mapping_00109-model.pth.tar~200MBcheckpoints/MappingNet--preprocess full用4 个 .pth 增强权重50~300MBgfpgan/weights/人脸检测/对齐/修复GFPGAN下载只走一条主路径项目自带的 scripts/download_models.sh它会建好目录并把上表 8 个文件全部 wget 到对应位置断网重跑还能续传# 在项目根目录下执行全程显示进度 bash scripts/download_models.sh脚本跑完只覆盖 8 个权重文件还有BFM_Fitting/这个 3D 面部模型文件夹不在其中。如果你按 FAQ 里similarity_Lm3D_all.mat缺失的报错对过目录补法是从官方 releases 的完整模型离线包含 checkpoints 全量内容手动下载解压覆盖到项目根目录即可。最终目录树长这样对着它检查你的目录SadTalker/ ├── checkpoints/ │ ├── mapping_00109-model.pth.tar │ ├── mapping_00229-model.pth.tar │ ├── SadTalker_V0.0.2_256.safetensors │ ├── SadTalker_V0.0.2_512.safetensors │ └── BFM_Fitting/ └── gfpgan/ └── weights/ ├── alignment_WFLW_4HG.pth ├── detection_Resnet50_Final.pth ├── GFPGANv1.4.pth └── parsing_parsenet.pth选哪个分辨率模型由 src/utils/init_path.py 按你传的--size参数自动匹配所以 256 和 512 两个文件都要留着。按你的硬件选参数没有 GPU 专属配置章节因为 inference.py 已经做了设备自动检测torch.cuda.is_available()为真就走 CUDA加--cpu参数可强制切回 CPU。你要关心的只有两件事——分辨率和 batch size硬件档位推荐--size推荐--batch_size10秒音频预期4~6GB 显存25611~2 分钟8~12GB 显存512230~60 秒16GB 显存512420~40 秒纯 CPU256110 分钟起步开箱即用的启动命令GPU 版8GB 显存以上直接抄# 512 分辨率 GFPGAN 人脸增强输出到 results/ python inference.py --source_image examples/source_image/art_2.png \ --driven_audio examples/driven_audio/chinese_poem1.wav# 上面这条的增强参数按需拼接 --size 512 --batch_size 2 --enhancer gfpganCPU 版参数全部往小处收# CPU 模式 256 分辨率 batch 1 python inference.py --cpu --source_image examples/source_image/art_2.png \ --driven_audio examples/driven_audio/chinese_poem1.wav# 分辨率与批量参数 --size 256 --batch_size 1输入除了头像照片全身照也能用加--still --preprocess full会先做局部动画再贴回原图保持原始姿态。故障速查Top 5 高频问题症状、原因、一句话解法症状原因一句话解法ffmpeg: command not foundffmpeg 没装或不在 PATH项目环境下conda install ffmpegFileNotFoundError: BFM_Fitting/similarity_Lm3D_all.mat模型文件没下全或路径错位重跑bash scripts/download_models.sh并按上文补BFM_Fitting/CUDA out of memory显存不够或碎片化见下面展开的三步法音频解码报Invalid data喂了 m4a 等格式只支持 wav/mp3用ffmpeg -i in.aac -ar 16000 -ac 1 out.wav转一下Mac M1/M2 报Illegal hardware instructiondlib 二进制与芯片架构不匹配pip uninstall dlib后重新pip install dlibCUDA 显存不足OOM是最常见也最好治的按这个顺序递进调整先设环境变量抑制显存碎片多数情况到这步就够了# 再执行推理命令 export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128降到--size 256 --batch_size 1渲染分辨率是显存消耗的大头。去掉--enhancer gfpgan人脸增强是独立的第二份显存开销。仍不行就加--cpu慢但一定能跑完适合先验证流程再换机器。下一步到这里项目已可正常运行results/里应该有你的第一条视频。想玩进阶参数--expression_scale加强表情、--ref_eyeblink借眨眼动作、4D 自由视角看 docs/best_practice.md或者直接bash webui.sh起一个 Gradio 本地网页版点点鼠标出片。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价