ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

SadTalker 完整安装指南:从零跑通 AI 语音驱动人脸动画的 4 道关

2026/9/15 10:22:12 拓冰建站 浏览量
SadTalker 完整安装指南:从零跑通 AI 语音驱动人脸动画的 4 道关 SadTalker 完整安装指南从零跑通 AI 语音驱动人脸动画的 4 道关【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是 CVPR 2023 的开源项目给一张人物肖像 一段音频它就能生成一张开口说话的逼真头部动画视频。第一次搭环境的人最常卡住的不是代码而是版本对不上Python / PyTorch / CUDA 三件套和模型文件没下全这两件事。这篇指南按环境体检 → 装依赖 → 下模型 → 首次跑通 → 调优 → 排障一条主线推进跟着一步步做你就能拿到自己的第一条说话视频。上面这类写实人物肖像是 SadTalker 的理想输入。官方强调模型只对真人或接近真人的肖像有效纯动漫风效果会明显变差。仓库自带了不少这类样例在 examples/source_image/ 目录里音频样例在 examples/driven_audio/首次跑通时可以直接拿来用。一、装前体检一张表确认你的环境这一节帮你解决我到底能不能装、按哪套方案装的问题。先花 2 分钟对照下表比装到一半报错再回退快得多。检查项要求说明Python3.8强烈建议README 的安装命令就是按 3.8 写的换高版本容易踩依赖坑系统Linux / Windows / macOSmacOS 和 WSL 有额外动作见下表ffmpeg必装音频解码和写视频都靠它没装一定报错GPUNVIDIA CUDA无 GPU 也能跑但极慢不推荐显存8GB 起步256 模型够用512 模型或开增强建议 12GB各系统的差异动作Linux / macOSffmpeg 直接conda install ffmpegmacOS 用户需要额外pip install dlib原始 dlib跳过它会报 Illegal Hardware Error。Windows把 ffmpeg 加进%PATH%确认命令行里ffmpeg -version能出结果。WSL启动环境前加一句export LD_LIBRARY_PATH/usr/lib/wsl/lib:$LD_LIBRARY_PATH。图省事社区有 Docker 镜像docker run一条命令就能跑适合只想快速验证、不打算改代码的人用法见 docs/install.md。建议单独建一个 conda 环境如conda create -n sadtalker python3.8别混进现有项目环境——这是后面所有排障省时间的关键。二、依赖装配先 PyTorch再清单最后可选项这一节帮你解决装什么、按什么顺序装的问题。核心原则一句话顺序错了后面全是雷。第 1 层PyTorch 单独先装版本跟着你的 CUDA 走。README 给出的标准组合是torch 1.12.1 cu113对应--extra-index-url https://download.pytorch.org/whl/cu113。装错这一层后面所有模型加载都会失败而且报错信息往往不直指原因。第 2 层一键装主依赖清单。仓库提供的 requirements.txt 把关键包都钉了版本numpy 1.23.4、face_alignment 1.3.5、librosa 0.9.2、kornia 0.6.8、facexlib 0.3.0、gfpgan 等直接执行pip install -r requirements.txt钉版本不是保守是这些库和 PyTorch 1.12.1 的兼容组合别手滑升上去。第 3 层按需装可选项。可选项什么时候装TTS只在你用 Gradio 网页 demo 且想文字直接变语音时realesrgan想用--background_enhancer增强整段视频背景时装完可以做个 30 秒自检python -c import torch, face_alignment, librosa, gfpgan; print(torch.__version__)能打印版本就没问题。三、模型就位一键脚本 离线清单这一节帮你解决哪些文件要下、放到哪的问题。这是新手翻车率最高的一步代码装好了、模型没下全运行时才在报错里发现。在线环境直接跑官方脚本一次下齐bash scripts/download_models.sh离线环境对照下面这张清单把文件传到对应目录即可。脚本内容都在 scripts/download_models.sh 里可以逐行对照文件名。文件存放目录作用SadTalker_V0.0.2_256.safetensorscheckpoints/256 分辨率渲染模型日常首选SadTalker_V0.0.2_512.safetensorscheckpoints/512 分辨率渲染模型质量更高、更吃显存mapping_00109-model.pth.tarcheckpoints/映射网络mapping_00229-model.pth.tarcheckpoints/映射网络alignment_WFLW_4HG.pth、detection_Resnet50_Final.pth、GFPGANv1.4.pth、parsing_parsenet.pthgfpgan/weights/人脸检测 GFPGAN 面部增强下完顺手检查文件大小是否完整几百 MB 的模型文件如果只有几 KB多半是断点下载坏了后面会报 file might be corrupted。四、首次跑通用仓库自带样例出第一条视频这一节帮你解决到底跑没跑通的问题。别用自己的素材先用仓库现成的样例排除所有变量python inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/happy.png \ --result_dir ./test_output \ --preprocess crop \ --still成功标志有两个终端一路走完没报错且./test_output/不指定--result_dir时默认在results/时间戳/下生成了.mp4。跑通这一条说明环境、依赖、模型三关全部通过——后面再出问题基本可以定位到参数/素材而不是环境。五、效果调优两个决定成败的开关这一节帮你解决能跑了但效果不满意的问题。80% 的观感问题由--preprocess和--still这两个开关决定先搞懂它们再谈微调。--preprocess选哪种取决于你的输入图模式适用输入效果特点crop默认人脸清晰的大图只动脸和头部表情与姿态最真实默认首选full半身 / 全身图动画只作用于裁剪出的脸部再贴回原图务必搭配--stillresize证件照式构图整图缩放后驱动全身照千万别用效果很差常用参数的取舍完整说明见 docs/best_practice.md参数怎么调适合什么--still加上 头部姿态锁定为原图全身图、人物该站得稳的场景缺点是少眨眼、少头动--expression_scale默认 1.0调大更夸张调小更收敛表情过头就降到 0.8 左右试试--enhancer gfpgan加上 用 GFPGAN 修脸分辨率偏低、糊的时候加代价是更慢更吃显存--background_enhancer realesrgan对整段视频做背景超分追求成片质量、不赶时间时一个稳妥的组合参考半身人像图 →--preprocess full --still --enhancer gfpgan大脸头像 → 默认的crop模式即可。六、故障速查按症状对号入座这一节帮你解决报错了去哪找答案的问题。先看 docs/FAQ.md再对照下面这张表症状多半原因解法ffmpeg is not recognizedffmpeg 没装或不在 PATHconda install ffmpegWindows 手动加 PATH 后重开终端CUDA out of memory显存不够换 256 模型、去掉--enhancer并设置环境变量PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128后重试unexpected EOF ... might be corrupted模型文件下载残缺对照第三节清单重新下载对应文件核对大小ModuleNotFoundError: No module named aiepoch_20.pth之类的检查点损坏重新下载并确认文件大小Illegal Hardware ErrorMac M1dlib 装的是二进制轮子单独pip install dlib重装音频解码报错输入不是 wav / mp3项目只支持 wav 或 mp3其他格式先转码口型不同步 / 表情怪异素材或参数问题换正面清晰肖像--expression_scale降一点全身图改用full still进阶一句话与继续深入的方向跑通之后还有几个值得试的玩法点到为止细节都在 docs/best_practice.md--ref_eyeblink 视频借一段参考视频给生成结果借眨眼和眉动更自然--input_yaw / --input_pitch / --input_roll控制头部朝向做自由视角说话头--face3dvis输出 3D 渲染脸需要额外装环境见 docs/face3d.md不想敲命令行python app_sadtalker.py起一个 Gradio 网页版Windows 双击webui.bat也行。想改代码的话按这条链读源码最高效音频 → 系数在 src/audio2exp_models/ 和 src/audio2pose_models/头部姿态生成在 src/facerender/贴回原图等工具在 src/utils/模型超参在 src/config/ 的 yaml 里。最后一句提醒SadTalker 只适合真人肖像。输入越正面、越清晰、光照越均匀出片效果越稳——环境装对了只是及格选对素材才是观感的第一决定因素。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考