资讯动态

SadTalker 上手指南:照片加音频生成说话人视频

发布时间:2026/9/12 6:35:53 来源:尧图企业网站定制
SadTalker 上手指南照片加音频生成说话人视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一个 CVPR 2023 的说话人动画项目给一张真人照片加一段语音音频它会输出嘴型、头部运动和眨眼都随音频走的说话人视频。下面按装环境、备素材、跑第一条命令、调效果的顺序讲一遍中途把常见报错直接标在对应步骤里。启动前需要装什么环境与模型权重先克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker项目基于 Python 3.8需要独立环境PyTorch 和 ffmpeg 要先装好缺 ffmpeg 会报 is not recognized 一类的命令错误conda create -n sadtalker python3.8 conda activate sadtalker pip install torch torchvision torchaudio conda install ffmpeg pip install -r requirements.txt⚠️ 注意macOS M1 若出现 Illegal Hardware Error在环境里单独再跑一次pip install dlibWindows 用户确认 ffmpeg 已加入 PATH。代码不带模型权重要单独执行下载脚本bash scripts/download_models.sh文件落在两处./checkpoints/存 mapping_00229-model.pth.tar、SadTalker_V0.0.2_256.safetensors 等核心权重./gfpgan/weights/存人脸增强模型。个别网络跑不了脚本时按 README 的 Pre-Trained Models 一节手动下载放到同样路径之后运行若报 unexpected EOF 或 file might be corrupted说明某个文件没下完整重新下载并核对大小即可。想启用 3D 脸可视化--face3dvis的话再补装pip install -r requirements3d.txt。图片和音频素材有什么要求图片模型只支持写实真人或写实风格的人像动漫角色不支持人脸要正面、清晰、光照正常。人脸检测不出来时预处理会直接打印 Cant get the coeffs of the input 并中止不会产出视频。第一次跑可以用仓库自带的examples/source_image/里的示例图比如 art_0.png音频只支持 wav 和 mp3 两种格式其他格式会在解码阶段报 stream 错误。examples/driven_audio/下有 14 个 wav 示例包括中文新闻、古诗、日语等。源图也可以传一段人像视频inference.py 的--source_image接受图片路径或视频路径但音频必须是单独一段人声。第一条命令跑出第一个说话人视频在仓库根目录执行python inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/art_0.png --enhancer gfpgan结果默认写在results/时间戳.mp4例如results/2026_09_11_05.30.45.mp4同名的中间帧目录跑完会自动删除加--verbose可以保留调试用。默认参数值得知道渲染分辨率--size 256、--batch_size 2、姿态随机策略--pose_style 0输出目录可用--result_dir改。显存不够报 CUDA out of memory 时在命令前设置环境变量PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128再跑。画面僵硬或模糊时调哪些参数效果主要由四组参数决定完整表格见 docs/best_practice.md每个选项的效果对比 GIF 都在里面建议对照看取景方式--preprocess默认crop只输出人脸区域全身照用full并必须配合--still系统动画化脸域后再贴回原图resize会把整图压到目标分辨率只适合证件照这类近景用在全身图上效果很差。表情幅度--expression_scale默认 1.0调大表情更夸张--still则去掉眨眼和头部运动只动嘴适合需要保持原始姿态的场景。清晰度--enhancer可选gfpgan或RestoreFormer做人脸修复--background_enhancer realesrgan对全图做超分两者可以叠加。增强逻辑在 src/utils/face_enhancer.py想知道换哪个模型能改什么可以看这里。参考视频--ref_pose/--ref_eyeblink指定一段头部动作视频从里面借姿态和眨眼节奏examples/ref_video/ 里有两段可直接用的样本参考视频比音频短时会自动循环播放。调完仍不自然时优先换源图——人脸区域质量直接决定输出上限要批量生成时用--size 256保速度确认效果后再考虑 512。不想敲命令起一个本地 WebUIpython app_sadtalker.pyLinux/Mac 也可以直接bash webui.shWindows 双击webui.bat。页面里上传图片、传音频Settings 面板能逐项切换上面提到的参数非 Windows 系统若要用文本转语音功能需先pip install TTS。环境是 macOS、WSL 或 Docker 的话按 docs/install.md 走遇到报错先对照 docs/FAQ.md 的清单那里按错误信息列了对应解法。跑通第一条命令后建议下一步把--expression_scale和--preprocess full组合各试一次感受同一素材下的差异再深入就看 best_practice.md 里 4D 自由视角--input_yaw等的用法。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价