MuseTalk 数字人对口型部署教程(新手向)
MuseTalk 是由腾讯音乐娱乐 Lyra 实验室开发的开源数字人唇形同步项目,只需提供一段视频和一段音频,即可自动生成口型与语音完美匹配的数字人视频,支持中文、英文、日文等多种语言。
对于新手,推荐两种部署方式:一键整合包(推荐)和手动部署。
硬件与环境要求
| 项目 | 最低要求 | 推荐配置 |
|---|---|---|
| 显卡 | NVIDIA GPU,显存 ≥ 8GB | RTX 3060 及以上(10GB+ 显存) |
| 操作系统 | Windows 10/11 64位 | Windows 11 |
| Python | 3.10 | 3.10 |
| CUDA | 11.7 | 11.8 |
️ 重要提醒:安装路径中不能包含中文,否则会导致各种报错。
方式一:一键整合包(新手首选)
社区开发者制作了离线整合包,解压即用,无需手动配置环境。
下载整合包:从社区渠道获取 MuseTalk 离线整合包。
解压文件:将整合包解压到一个纯英文路径下(如
D:MuseTalk)。启动程序:双击运行"一键启动.exe",等待命令行窗口出现。
打开界面:加载成功后,在浏览器中访问
http://127.0.0.1:7860/即可进入操作界面。
️ 方式二:手动部署(进阶用户)
第一步:安装基础环境
安装 Python 3.10:前往 python.org 下载,安装时务必勾选 "Add Python to PATH"。
安装 Git:前往 git-scm.com 下载安装。
安装 CUDA 11.8:前往 NVIDIA CUDA Toolkit 下载安装。
安装 FFmpeg:下载后将
bin目录添加到系统环境变量Path中。
第二步:克隆项目并创建虚拟环境
打开命令提示符(管理员模式),依次执行:
# 克隆仓库 git clone https://github.com/TMElyralab/MuseTalk cd MuseTalk # 创建虚拟环境 python -m venv musetalk_venv # 激活虚拟环境(Windows) musetalk_venvScriptsactivate
第三步:安装依赖
# 设置国内镜像源(加速下载) pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple # 安装 PyTorch(CUDA 11.8 版本) pip install torch==2.0.1 torchvision==0.15.2 torchaudio==2.0.2 --index-url https://download.pytorch.org/whl/cu118 # 安装项目依赖 pip install -r requirements.txt # 安装 mmlab 相关依赖 pip install --no-cache-dir -U openmim mim install mmengine mim install "mmcv==2.2.0" mim install "mmdet==3.2.0" mim install "mmpose==1.2.0"
第四步:下载模型权重
项目需要以下预训练模型,需下载后放入 ./models/ 目录:
| 模型名称 | 存放路径 |
|---|---|
| MuseTalk 主模型 | models/musetalk/ |
| DWpose 姿态估计 | models/dwpose/ |
| Face-Parse 面部解析 | models/face-parse-bisent/ |
| SD-VAE 图像编解码 | models/sd-vae-ft-mse/ |
| Whisper 音频编码 | models/whisper/ |
国内用户可使用阿里云 ModelScope 镜像加速下载:
from modelscope import snapshot_download snapshot_download('TMElyralab/MuseTalk', cache_dir='./models')
第五步:启动运行
# 图形化界面模式(推荐新手使用) python app.py
启动后在浏览器访问 http://127.0.0.1:7860/ 即可进入操作界面。
使用方法:四步生成对口型视频
上传视频:准备一段人物正面视频(建议 25FPS,正面平视角度,偏转 < 15°)。
上传音频:准备一段录音文件(建议采样率 16kHz)。
调整参数:
嘴巴张开度(bbox_shift):范围
[-9, 9],默认 0,可根据效果微调。其他参数保持默认即可。
7` 点击生成:等待处理完成,右侧会显示生成的对口型视频。
常见问题排查
| 问题 | 可能原因 | 解决方案 |
|---|---|---|
| 唇部抖动 | DWpose 权重不完整 | 重新下载 dwpose 模型文件 |
| 口型幅度不足 | 参数设置偏低 | 调大 bbox_shift 值 |
| 面部扭曲 | 原视频角度过大 | 使用正面平视的视频素材 |
| 显存不足 | 显卡显存不够 | 降低视频分辨率或使用云端部署 |
| 首次生成很慢 | 模型初始化 | 正常现象,首次约 10-30 分钟,后续会快很多 |
️ 备选方案:云端部署
如果你的电脑显卡配置不够,也可以使用云端 GPU 平台(如算家云等)进行部署,选择 4090 或 A100 显卡实例,按量付费,无需本地硬件支持。
需要我把这两个整合包的对比整理成一张选型表吗?方便你根据硬件和场景快速做决定。
来源:酷虎GPU租用平台

沪ICP备14003863号
贵公网安备 52010202003147号