资讯动态

SadTalker 新手教程:一张照片加一段音频生成说话视频

发布时间:2026/9/12 11:24:27 来源:尧图企业网站定制
SadTalker 新手教程一张照片加一段音频生成说话视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker手上一张静态人像照片和一段录音想把它变成一段会说话的头部视频时SadTalker 可以直接完成输入图片和音频输出带口型的 mp4 视频。本文按环境、素材、参数、排错四个环节说明如何把它跑起来并调好。 先判断适不适合SadTalker 擅长什么、做不了什么先看边界再决定是否投入安装成本。擅长真实人像真人照片或接近真人的写实图驱动生成说话头部视频默认人脸渲染 256×256另有 512×512 模型可选全身图动画--preprocess full --still组合下自动裁剪人脸区域生成再贴回原图从参考视频借用眨眼轨迹--ref_eyeblink和头部姿态--ref_pose自由视角用--input_yaw等参数控制单张照片生成多角度头部动作做不了动漫、插画风格模型只在真人数据上训练官方在 docs/best_practice.md 中注明二次元版本未来才会发布语音合成音频文件需要自己准备且只接受 wav 和 mp3 两种格式大幅动作它生成的是头部级别的动画身体不会动全身模式也只是在原图上动脸如果你的素材是动漫角色或只有文本没有音频现在可以停下来了否则继续。 最短路径跑起来环境要求与各平台启动环境要求项目要求说明Python3.8命令行路径WebUI 脚本兼容 3.7–3.11Windows 上 WebUI 要求 3.10安装时勾选 Add Python to PATHGit任意版本用于克隆仓库FFmpeg系统级安装视频编码依赖缺失会直接报错显卡NVIDIA 卡 CUDA 11.3对应 torch 1.12.14GB 显存可跑 256 模式纯 CPU 可用--cpu但明显变慢Windows装好上述三件套后克隆仓库双击webui.bat即可脚本会自动建虚拟环境、装依赖并启动浏览器界面。Linux / macOSgit clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker bash webui.shwebui.sh会自动创建 venv 虚拟环境、安装依赖然后启动 Gradio WebUI浏览器打开脚本打印的本地地址默认 7860 端口即可上传图片和音频。装过 TTS 包后界面里还能直接输入文本让工具替你配音。模型权重文件checkpoint即训练好的模型参数不包含在仓库里需要单独下载两种方式任选脚本方式bash scripts/download_models.shLinux/macOS手动方式从 GitHub Releases 或百度云盘下载放到checkpoints/和gfpgan/weights/目录结构说明见 README.md不想用图形界面时用这条命令等价完成结果写入results/时间戳.mp4python inference.py --driven_audio audio.wav --source_image portrait.png --enhancer gfpgan 照片与音频选不对时达标与不达标对照大部分翻车出在输入素材先对照下表自查项目达标不达标人像正面、单人脸、面部无遮挡、光线均匀、真人照片动漫/插画、大侧脸、手部或物体挡脸、模糊低清图全身图头部占画面比例足够大且可清晰识别配--preprocess full --still使用全身图配resize模式——官方文档明确标注会产生坏结果音频wav 或 mp3人声清晰、背景噪音低m4a/flac 等格式需先转码、底噪大、多说话人混录仓库自带素材里有典型的达标样例。这张近景照是标准正面、单人脸、光线均匀全身图也能用系统会自动定位人脸区域做动画再贴回整图⚙️ 不同场景该用哪些参数按场景查表以下组合都加在python inference.py基础命令上按你的目标取用即可场景追加参数常规说话头部默认自动裁剪人脸--enhancer gfpgan人脸修复网络让面部更锐利想要更清晰的 512×512 人脸细节--size 512每帧更慢、更吃显存全身图保留原姿态--preprocess full --still证件照构图整图口型对齐--preprocess resize仅限近景/证件照类图片表情偏僵硬想要更丰富--expression_scale 1.2默认 1.0值越大表情幅度越大头部动得太碎想接近静止--still眼睛呆滞想要自然眨眼--ref_eyeblink 参考视频想复用某段视频的头部姿态--ref_pose 参考视频可与上行共用同一文件自由视角 / 多角度头部--input_yaw -20 30 10可另加--input_pitch、--input_roll参考视频模式下系统从参考视频提取眼部动作轨迹再应用到生成结果参考视频比音频短时会自动循环使用。自由视角则用同一张照片输出不同角度的头部动作示意如下 从能跑到跑得好三个关键调整先用 256 验证流程再上 512。默认--size 256完整跑一遍确认素材和参数没问题后再改成 512直接上高分辨率时出错后很难分辨是素材问题还是参数问题。全身输入走full still组合。full 模式是裁剪人脸区域生成动画、再贴回原图不加--still时头部姿态会偏离原图贴回边缘处容易出现错位感。面部锐度交给增强器。--enhancer gfpgan只处理人脸区域若对整段视频的清晰度有要求可再加--background_enhancer realesrgan需先pip install realesrgan。 报错速查问题、原因与解法问题原因解法ffmpeg is not recognizedFFmpeg 未安装或不在 PATH安装 FFmpegWindows 下确认已加入%PATH%找不到BFM_Fitting\similarity_Lm3D_all.mat模型文件未下载或目录放错跑scripts/download_models.sh核对目录结构unexpected EOF文件疑似损坏checkpoint 下载不完整单独重新下载对应文件CUDA out of memory显存不足或碎片化启动前设PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128或调低--batch_size默认 2Error while decoding streamInvalid data音频格式不受支持仅支持 wav/mp3先转码再喂入Illegal Hardware ErrorApple 芯片dlib 编译不兼容单独执行pip install dlib重装更多条目见 docs/FAQ.mdmacOS 等平台的安装细节在 docs/install.md。 这套流程适合谁适合手里有真人照片和现成录音、需要制作讲解或演示视频的场景不适合做二次元角色也不替代语音合成——音频文件得先备好。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价