新 闻 - 正文

MuseTalk 数字人对口型部署教程

来源:酷虎云 分类:AI技术 gpu 阅读(10)

MuseTalk 数字人对口型部署教程(新手向)

MuseTalk 是由腾讯音乐娱乐 Lyra 实验室开发的开源数字人唇形同步项目,只需提供一段视频和一段音频,即可自动生成口型与语音完美匹配的数字人视频,支持中文、英文、日文等多种语言。

对于新手,推荐两种部署方式:一键整合包(推荐)手动部署


硬件与环境要求

项目最低要求推荐配置
显卡NVIDIA GPU,显存 ≥ 8GBRTX 3060 及以上(10GB+ 显存)
操作系统Windows 10/11 64位Windows 11
Python3.103.10
CUDA11.711.8

重要提醒:安装路径中不能包含中文,否则会导致各种报错。


方式一:一键整合包(新手首选)

社区开发者制作了离线整合包,解压即用,无需手动配置环境。

  1. 下载整合包:从社区渠道获取 MuseTalk 离线整合包。

  2. 解压文件:将整合包解压到一个纯英文路径下(如 D:MuseTalk)。

  3. 启动程序:双击运行"一键启动.exe",等待命令行窗口出现。

  4. 打开界面:加载成功后,在浏览器中访问 http://127.0.0.1:7860/ 即可进入操作界面。


️ 方式二:手动部署(进阶用户)

第一步:安装基础环境

  1. 安装 Python 3.10:前往 python.org 下载,安装时务必勾选 "Add Python to PATH"

  2. 安装 Git:前往 git-scm.com 下载安装。

  3. 安装 CUDA 11.8:前往 NVIDIA CUDA Toolkit 下载安装。

  4. 安装 FFmpeg:下载后将 bin 目录添加到系统环境变量 Path 中。

第二步:克隆项目并创建虚拟环境

打开命令提示符(管理员模式),依次执行:

# 克隆仓库
git clone https://github.com/TMElyralab/MuseTalk
cd MuseTalk

# 创建虚拟环境
python -m venv musetalk_venv

# 激活虚拟环境(Windows)
musetalk_venvScriptsactivate

第三步:安装依赖

# 设置国内镜像源(加速下载)
pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple

# 安装 PyTorch(CUDA 11.8 版本)
pip install torch==2.0.1 torchvision==0.15.2 torchaudio==2.0.2 --index-url https://download.pytorch.org/whl/cu118

# 安装项目依赖
pip install -r requirements.txt

# 安装 mmlab 相关依赖
pip install --no-cache-dir -U openmim
mim install mmengine
mim install "mmcv==2.2.0"
mim install "mmdet==3.2.0"
mim install "mmpose==1.2.0"

第四步:下载模型权重

项目需要以下预训练模型,需下载后放入 ./models/ 目录:

模型名称存放路径
MuseTalk 主模型models/musetalk/
DWpose 姿态估计models/dwpose/
Face-Parse 面部解析models/face-parse-bisent/
SD-VAE 图像编解码models/sd-vae-ft-mse/
Whisper 音频编码models/whisper/

国内用户可使用阿里云 ModelScope 镜像加速下载:

from modelscope import snapshot_download
snapshot_download('TMElyralab/MuseTalk', cache_dir='./models')

第五步:启动运行

# 图形化界面模式(推荐新手使用)
python app.py

启动后在浏览器访问 http://127.0.0.1:7860/ 即可进入操作界面。


使用方法:四步生成对口型视频

  1. 上传视频:准备一段人物正面视频(建议 25FPS,正面平视角度,偏转 < 15°)。

  2. 上传音频:准备一段录音文件(建议采样率 16kHz)。

  3. 调整参数

    • 嘴巴张开度(bbox_shift):范围 [-9, 9],默认 0,可根据效果微调。

    • 其他参数保持默认即可。

      7`
  4. 点击生成:等待处理完成,右侧会显示生成的对口型视频。


常见问题排查

问题可能原因解决方案
唇部抖动DWpose 权重不完整重新下载 dwpose 模型文件
口型幅度不足参数设置偏低调大 bbox_shift
面部扭曲原视频角度过大使用正面平视的视频素材
显存不足显卡显存不够降低视频分辨率或使用云端部署
首次生成很慢模型初始化正常现象,首次约 10-30 分钟,后续会快很多

️ 备选方案:云端部署

如果你的电脑显卡配置不够,也可以使用云端 GPU 平台(如算家云等)进行部署,选择 4090 或 A100 显卡实例,按量付费,无需本地硬件支持。


需要我把这两个整合包的对比整理成一张选型表吗?方便你根据硬件和场景快速做决定。


来源:酷虎GPU租用平台

数字人工智能

立即注册

客服微信

点击聊天

请打开手机微信,扫一扫联系我们

在线咨询

点击咨询

7x24h售后支持

400-663-6698

返回顶部