公司动态

SadTalker 使用教程:如何用一张静态照片生成会说话的数字人视频

📅 2026/8/21 18:48:40
SadTalker 使用教程:如何用一张静态照片生成会说话的数字人视频
SadTalker 使用教程如何用一张静态照片生成会说话的数字人视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker上周一位做线上课程的朋友在微信上跟我诉苦PPT 做好了逐字稿写好了就差一个讲师出镜。真人录怕露脸找人配音又肉疼我干脆推荐他试试 SadTalker——一个 CVPR 2023 收录的开源项目专门解决一个需求输入一张肖像图片和一段音频输出一段人物开口说话、口型对得上音轨的数字人视频。这个项目解决的问题非常聚焦一句话就能概括让一张静态图片照着音频动起来。它不会换掉你的图也不会改掉你的画风只是在图上激活那张脸。你可以把 SadTalker 想成一位照片配音动画师它先听一遍你的音频再指挥图片里那张脸按节奏张嘴、挑眉、微微转头。你只需要做两件事——给它一张图给它一段音。三分钟让 SadTalker 跑起来先出片再深究安装环节最容易劝退人所以我们不追求一步到位先拿到第一条成片再说。三步就够git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker pip install -r requirements.txt bash scripts/download_models.sh第一句拉代码第二句装依赖第三句自动下载模型网络不畅时也可以手动下载模型文件放进checkpoints目录。搞定后直接用项目自带的素材跑一条命令python inference.py \ --source_image examples/source_image/art_0.png \ --driven_audio examples/driven_audio/chinese_news.wav等几十秒到一两分钟results/目录下就会多出一个 mp4——画面里的人物正对着你说话。第一次跑通别急着调参数先把能出片这个正反馈握在手里。想更省事还有两条捷径Windows 用户直接双击webui.batLinux/macOS 用户执行bash webui.sh会自动拉起一个图形界面上传图片、上传音频、点按钮出片用起来跟普通网页应用没区别。这张全身照被喂给 SadTalker 后脸部会自然动起来而构图和姿态几乎不被破坏为什么它比贴图对嘴高级三个记住它的理由很多对嘴工具的套路是拿一张张嘴的贴图硬糊到人脸上——嘴是动了整张脸却像戴了面具。SadTalker 的做法完全不同这也是它最值得记住的三点。理由一口型是长出来的不是拼出来的。它先把人脸拆解成一组 3D 运动系数——嘴型、眉毛、头部姿态都变成可计算的数值然后从音频里学这些系数随时间变化的规律最后驱动原图重新渲染。打个比方贴图法像给石膏像换嘴SadTalker 是让脸上的肌肉自己活过来。所以它生成的开合、抿嘴、微张都带着自然的过渡而不是一卡一卡的跳变。理由二你的图是什么画风出来的就是什么画风。这是它最让人上瘾的地方。写实照片、数码厚涂、古典油画它都尽量保留原图质感只动该动的部分。一张古典油画风格的肖像也能自然地开口说话笔触与色彩几乎不受影响如果你手头有一批风格各异的插画素材可以轮流试一遍挑最顺眼的那张当你的虚拟形象。理由三全身照也能动硬件要求比想象中友好。配合full预处理模式和--still参数SadTalker 能把脸部动画做完后贴回原图——于是那张站着的人物全身照也能变成一段会说话、有微表情的完整画面。而且它没有把门槛抬到必须高端显卡的级别普通配置跑 CPU 也能出片只是慢一些。crop、resize、full 怎么选按图索骥的决策表--preprocess是新手最容易忽略、却最影响效果的一个选项。它有三档与其背参数不如看你的图属于哪一类你的图片长这样推荐模式为什么证件照、大头贴式特写resize整图缩放处理脸占画面主体效果最稳半身照、构图较复杂的图crop自动裁出脸部区域单独动画脸部细节最自然全身照、讲究完整构图的图full--still脸部动画完成后再贴回原图构图不破坏表格之外还有几个什么时候用的决策点想要画质更好加--enhancer gfpgan相当于给生成的脸做一次修复美颜。但建议先跑一版不带增强的预览确认满意再上强度否则小显存或纯 CPU 的机器容易又慢又热。想要表情更夸张调--expression_scale默认 1.0往 1.5 方向调表情幅度变大往 0.5 方向调更克制。想要自然的眨眼和转头用--ref_eyeblink和--ref_pose各自借一段参考视频的眨眼、头部动作数字人会活得多。想要保持原图头部姿态--still就是干这个的配合full模式使用效果最好。一个小故事三分钟生成一位虚拟讲师回到开头那位朋友。他的实际需求是给一门新课做 30 秒片头画面里有一位讲师对着镜头念一段开场白。他的做法很简单。第一步从项目examples/source_image/里挑了一张风格合适的写实人像当讲师第二步用手机录了一段 30 秒的 wav 台词不想出声也可以先写稿再用项目自带的src/utils/text2speech.py合成语音第三步跑一条命令python inference.py \ --source_image examples/source_image/art_0.png \ --driven_audio examples/driven_audio/chinese_news.wav \ --preprocess crop \ --expression_scale 1.1成片出来他先看口型惊讶于张嘴闭嘴的节奏居然跟重音对得上再看表情眉眼有一点微动不会像木头人。他又加了--still想让讲师少点头、多直视镜头效果满意后把片段直接拖进剪辑软件——一个没有真人出镜、却有人在讲课的片头就这样完成了。整个过程从他打开终端到导出 mp4大概十来分钟其中一半时间花在挑参数上。新手最容易踩的五个坑帮你提前绕开坑一它其实挑脸。项目文档里写得很直白SadTalker 主要对真人照片或接近真人的写实图效果好二次元、卡通脸容易崩。如果你试了动漫头像发现嘴型诡异那多半不是参数问题而是风格问题。坑二resize模式处理全身照会翻车。证件照用resize很稳但拿它跑全身照脸会被压得比例失调。记住决策表那句话全身照找full特写照找resize。坑三报错 ffmpeg not found 先别慌。这是环境缺 ffmpeg不是项目坏了。Linux 用包管理器装一下Windows 把它加进系统路径即可。坑四音频格式影响口型。建议准备 16kHz 采样率的 WAV。采样率太怪或编码很冷门的音频对口型时很可能差半拍。坑五别一上来就叠满所有增强。--enhancer加--background_enhancer加高分辨率在小显存机器上是又慢又爆显存套餐。正确姿势是默认参数出预览 → 满意了再逐级加增强。往深处挖文档、源码与素材从哪找跑通之后真正的乐趣在探索。这些路径都写在项目里顺着看下去就对了安装与多平台教程docs/install.md参数与最佳实践建议docs/best_practice.md常见问题汇总docs/FAQ.md3D 人脸可视化与自定义训练docs/face3d.md音频→表情模型源码src/audio2exp_models/音频→头部姿态模型源码src/audio2pose_models/面部渲染引擎src/facerender/3DMM 人脸重建src/face3d/现成素材examples/source_image/、examples/driven_audio/、examples/ref_video/批量出片脚本src/generate_batch.py开了增强模式之后的出片效果脸部细节与整体画质都有明显提升给你的第一个小任务不用做任何准备现在就打开终端用项目自带的examples素材跑一次上文那条命令亲眼看看那张图开口说话的瞬间——这个哇就是最好的入门仪式。跑通之后换成你自己的照片和一段录音对比crop、resize、full三档的差别再慢慢试着动--expression_scale和--still。等技术熟了还有两个进阶方向可以钻一是读一读src/audio2pose_models/的代码理解声音如何变成动作二是用参考视频参数给数字人定制专属的眨眼节奏和头部习惯让它越来越像你。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考