LiveTalking 实时交互流式数字人部署教程(新手向)
LiveTalking(原名 metahuman-stream)是由 lipku 开发的开源实时交互流式数字人引擎,采用 Apache-2.0 许可证,支持商用。它的核心能力是:用一段人物视频 + 任意文字/音频输入,实时生成口型同步的数字人音视频流,支持 WebRTC 浏览器交互、RTMP 直播推流、虚拟摄像头等多种输出方式。
与前两个项目(HeyGem、MuseTalk)不同,LiveTalking 是一个生产级框架,不仅能生成对口型视频,还能实现实时对话、多路并发、打断重说、声音克隆等高级功能。
硬件与环境要求
| 项目 | 最低要求 | 推荐配置 |
|---|---|---|
| 显卡 | NVIDIA GPU,显存 ≥ 6GB | RTX 3060 12GB 及以上 |
| 内存 | 16GB | 16GB+ |
| 操作系统 | Windows 10/11 64位 / Ubuntu 22.04+ | Windows 11 / Ubuntu 24.04 |
| Python | 3.10 | 3.10 |
| CUDA | 12.4 | 12.4+(50系显卡需 12.7.1+) |
重要提醒:安装路径中不能包含中文或空格,否则会导致各种报错。
第一步:安装基础软件
在开始之前,请确保已安装以下软件:
Miniconda(推荐)或 Anaconda:用于创建隔离的 Python 虚拟环境,避免与系统环境冲突。
Git:用于克隆项目代码,前往 <git-scm.com> 下载安装。
FFmpeg:音视频处理核心工具,下载后将
bin目录添加到系统环境变量Path中。OBS Studio(可选):如果需要直播推流,前往 <obsproject.com> 下载安装。
第二步:克隆项目并创建虚拟环境
打开命令提示符(Windows)或终端(Linux),以管理员身份运行,依次执行:
# 克隆项目 git clone https://github.com/lipku/LiveTalking cd LiveTalking # 创建 Python 3.10 虚拟环境 conda create -n livetalking python=3.10 -y conda activate livetalking
第三步:安装依赖
根据你的显卡情况,选择对应的安装命令:
有 NVIDIA 独立显卡的用户:
# 安装 PyTorch(CUDA 12.4 版本) conda install pytorch==2.5.0 torchvision==0.20.0 torchaudio==2.5.0 pytorch-cuda=12.4 -c pytorch -c nvidia -y # 安装项目依赖 pip install -r requirements.txt
无独立显卡 / 纯 CPU 用户:
pip install torch torchvision torchaudio pip install -r requirements.txt
国内用户建议先设置 pip 镜像源加速下载:
pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple
第四步:下载模型与数字人形象
LiveTalking 支持多种口型渲染模型,新手建议从 Wav2Lip 开始(速度最快、兼容性最好)。
4.1 下载口型模型
| 模型 | 特点 | 推荐显卡 | 实时 FPS |
|---|---|---|---|
| Wav2Lip | 速度最快,兼容性好 | RTX 3060+ | 60–120 |
| MuseTalk | 质量更高,自然度更好 | RTX 3080Ti+ | 42–72 |
| ER-NeRF | 3D 神经辐射场,支持多角度 | 高端 GPU | — |
| Ultralight-DH | 轻量化,低 GPU 需求 | 低端 GPU | — |
将下载的 wav2lip256.pth 模型文件放入项目的 models/ 目录,并重命名为 wav2lip.pth。
4.2 准备数字人形象
项目自带基础数字人形象,解压到 data/avatars/ 目录即可使用。你也可以用自己的 MP4 视频生成自定义形象(后面会讲到)。
第五步:启动服务
# 有独立显卡的用户(新手首选) python app.py --transport webrtc --model wav2lip --avatar_id wav2lip256_avatar1 # 纯 CPU 用户 python app.py --transport webrtc --model wav2lip --avatar_id wav2lip256_avatar1 --device cpu
启动成功后,在浏览器中访问:
http://127.0.0.1:8010/webrtcapi.html
即可看到数字人控制台界面。
第六步:使用界面操作
LiveTalking 最新版包含三个主要页面:
主页面(交互页面)
点击"立即连接"按钮,建立与数字人的连接。
朗读模式:输入文字,数字人实时播报。
复读模式:输入文字,数字人原样复述。
连接大模型(Chat LLM):接入大语言模型,实现智能问答对话。
音频驱动:上传音频文件,数字人根据音频内容对口型播报。
数字人生成页面
选择模型(Wav2Lip / MuseTalk)。
上传一段 MP4 人物视频。
点击"提交生成任务",即可生成自定义数字人形象。
后台管理页面(Admin)
查看当前运行状态:使用的模型方案、TTS 引擎、流媒体协议、端口号等。
支持多路并发的 Session 管理。
进阶配置
接入本地大模型实现智能对话
安装 Ollama:前往 <ollama.com> 下载安装。
下载开源大模型:
ollama run qwen:7b
打开项目中的
app_config.yaml,将 LLM 模块地址改为http://127.0.0.1:11434,保存即可。
OBS 直播推流
打开 OBS Studio,添加"浏览器"来源,输入
http://127.0.0.1:8010/webrtcapi.html。调整画面布局,添加背景、字幕等。
在直播平台的创作者中心复制推流地址和密钥,填入 OBS 的"设置 → 推流"中即可开播。
声音克隆
项目支持 XTTS 等语音克隆引擎,可以在 tts/ 目录下配置自定义声音参考文件,让数字人使用指定的音色说话。
常见问题排查
| 问题 | 可能原因 | 解决方案 |
|---|---|---|
启动报错 ModuleNotFoundError | 依赖未安装完整 | 重新执行 pip install -r requirements.txt |
| 页面打不开 | 端口被占用或服务未启动 | 检查终端是否有报错,确认 8010 端口未被占用 |
| 数字人画面卡顿 | 显存不足或模型过大 | 切换为 Wav2Lip 模型,或降低视频分辨率 |
| 口型不同步 | 音频采样率不匹配 | 确保音频为 16kHz 采样率 |
| CUDA 报错 | PyTorch 与 CUDA 版本不匹配 | 确认 PyTorch 版本与 CUDA 版本对应 |
| 首次运行很慢 | 模型加载中 | 正常现象,首次需加载模型权重,后续会快很多 |
与 HeyGem / MuseTalk 的定位对比
| 维度 | HeyGem | MuseTalk | LiveTalking |
|---|---|---|---|
| 定位 | 离线视频生成 | 离线对口型 | 实时交互推流 |
| 输入 | 视频 + 音频 | 视频 + 音频 | 文字/音频/大模型对话 |
| 输出 | MP4 文件 | MP4 文件 | WebRTC / RTMP / 虚拟摄像头 |
| 实时性 | 离线 | 离线 | 实时流式 |
| 适合场景 | 短视频制作 | 对口型视频 | 直播、客服、虚拟教师 |
| 上手难度 | 低(整合包) | 中 | 中高 |
简单来说:如果你只需要生成对口型视频文件,用 HeyGem 或 MuseTalk 就够了;如果你需要实时交互、直播推流、智能对话,LiveTalking 是更合适的选择。
要不要我把这三个项目整合成一张对比选型表,方便你根据硬件和场景快速做决定?
来源:酷虎云GPU显卡租用平台

沪ICP备14003863号
贵公网安备 52010202003147号