新 闻 - 正文

LiveTalking实时交互流式数字人开源

来源:酷虎云 分类:AI技术 gpu 阅读(14)

LiveTalking 实时交互流式数字人部署教程(新手向)

LiveTalking(原名 metahuman-stream)是由 lipku 开发的开源实时交互流式数字人引擎,采用 Apache-2.0 许可证,支持商用。它的核心能力是:用一段人物视频 + 任意文字/音频输入,实时生成口型同步的数字人音视频流,支持 WebRTC 浏览器交互、RTMP 直播推流、虚拟摄像头等多种输出方式。

与前两个项目(HeyGem、MuseTalk)不同,LiveTalking 是一个生产级框架,不仅能生成对口型视频,还能实现实时对话、多路并发、打断重说、声音克隆等高级功能。


硬件与环境要求

项目最低要求推荐配置
显卡NVIDIA GPU,显存 ≥ 6GBRTX 3060 12GB 及以上
内存16GB16GB+
操作系统Windows 10/11 64位 / Ubuntu 22.04+Windows 11 / Ubuntu 24.04
Python3.103.10
CUDA12.412.4+(50系显卡需 12.7.1+)

重要提醒:安装路径中不能包含中文或空格,否则会导致各种报错。


第一步:安装基础软件

在开始之前,请确保已安装以下软件:

  1. Miniconda(推荐)或 Anaconda:用于创建隔离的 Python 虚拟环境,避免与系统环境冲突。

  2. Git:用于克隆项目代码,前往 <git-scm.com> 下载安装。

  3. FFmpeg:音视频处理核心工具,下载后将 bin 目录添加到系统环境变量 Path 中。

  4. OBS Studio(可选):如果需要直播推流,前往 <obsproject.com> 下载安装。


第二步:克隆项目并创建虚拟环境

打开命令提示符(Windows)或终端(Linux),以管理员身份运行,依次执行:

# 克隆项目
git clone https://github.com/lipku/LiveTalking
cd LiveTalking

# 创建 Python 3.10 虚拟环境
conda create -n livetalking python=3.10 -y
conda activate livetalking

第三步:安装依赖

根据你的显卡情况,选择对应的安装命令:

有 NVIDIA 独立显卡的用户:

# 安装 PyTorch(CUDA 12.4 版本)
conda install pytorch==2.5.0 torchvision==0.20.0 torchaudio==2.5.0 pytorch-cuda=12.4 -c pytorch -c nvidia -y

# 安装项目依赖
pip install -r requirements.txt

无独立显卡 / 纯 CPU 用户:

pip install torch torchvision torchaudio
pip install -r requirements.txt

国内用户建议先设置 pip 镜像源加速下载:

pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple

第四步:下载模型与数字人形象

LiveTalking 支持多种口型渲染模型,新手建议从 Wav2Lip 开始(速度最快、兼容性最好)。

4.1 下载口型模型

模型特点推荐显卡实时 FPS
Wav2Lip速度最快,兼容性好RTX 3060+60–120
MuseTalk质量更高,自然度更好RTX 3080Ti+42–72
ER-NeRF3D 神经辐射场,支持多角度高端 GPU
Ultralight-DH轻量化,低 GPU 需求低端 GPU

将下载的 wav2lip256.pth 模型文件放入项目的 models/ 目录,并重命名为 wav2lip.pth

4.2 准备数字人形象

项目自带基础数字人形象,解压到 data/avatars/ 目录即可使用。你也可以用自己的 MP4 视频生成自定义形象(后面会讲到)。


第五步:启动服务

# 有独立显卡的用户(新手首选)
python app.py --transport webrtc --model wav2lip --avatar_id wav2lip256_avatar1

# 纯 CPU 用户
python app.py --transport webrtc --model wav2lip --avatar_id wav2lip256_avatar1 --device cpu

启动成功后,在浏览器中访问:

http://127.0.0.1:8010/webrtcapi.html

即可看到数字人控制台界面。


第六步:使用界面操作

LiveTalking 最新版包含三个主要页面:

主页面(交互页面)

  • 点击"立即连接"按钮,建立与数字人的连接。

  • 朗读模式:输入文字,数字人实时播报。

  • 复读模式:输入文字,数字人原样复述。

  • 连接大模型(Chat LLM):接入大语言模型,实现智能问答对话。

  • 音频驱动:上传音频文件,数字人根据音频内容对口型播报。

数字人生成页面

  • 选择模型(Wav2Lip / MuseTalk)。

  • 上传一段 MP4 人物视频。

  • 点击"提交生成任务",即可生成自定义数字人形象。

后台管理页面(Admin)

  • 查看当前运行状态:使用的模型方案、TTS 引擎、流媒体协议、端口号等。

  • 支持多路并发的 Session 管理。


进阶配置

接入本地大模型实现智能对话

  1. 安装 Ollama:前往 <ollama.com> 下载安装。

  2. 下载开源大模型:

    ollama run qwen:7b
  3. 打开项目中的 app_config.yaml,将 LLM 模块地址改为 http://127.0.0.1:11434,保存即可。

OBS 直播推流

  1. 打开 OBS Studio,添加"浏览器"来源,输入 http://127.0.0.1:8010/webrtcapi.html

  2. 调整画面布局,添加背景、字幕等。

  3. 在直播平台的创作者中心复制推流地址和密钥,填入 OBS 的"设置 → 推流"中即可开播。

声音克隆

项目支持 XTTS 等语音克隆引擎,可以在 tts/ 目录下配置自定义声音参考文件,让数字人使用指定的音色说话。


常见问题排查

问题可能原因解决方案
启动报错 ModuleNotFoundError依赖未安装完整重新执行 pip install -r requirements.txt
页面打不开端口被占用或服务未启动检查终端是否有报错,确认 8010 端口未被占用
数字人画面卡顿显存不足或模型过大切换为 Wav2Lip 模型,或降低视频分辨率
口型不同步音频采样率不匹配确保音频为 16kHz 采样率
CUDA 报错PyTorch 与 CUDA 版本不匹配确认 PyTorch 版本与 CUDA 版本对应
首次运行很慢模型加载中正常现象,首次需加载模型权重,后续会快很多

与 HeyGem / MuseTalk 的定位对比

维度HeyGemMuseTalkLiveTalking
定位离线视频生成离线对口型实时交互推流
输入视频 + 音频视频 + 音频文字/音频/大模型对话
输出MP4 文件MP4 文件WebRTC / RTMP / 虚拟摄像头
实时性离线离线实时流式
适合场景短视频制作对口型视频直播、客服、虚拟教师
上手难度低(整合包)中高

简单来说:如果你只需要生成对口型视频文件,用 HeyGem 或 MuseTalk 就够了;如果你需要实时交互、直播推流、智能对话,LiveTalking 是更合适的选择。


要不要我把这三个项目整合成一张对比选型表,方便你根据硬件和场景快速做决定?



来源:酷虎云GPU显卡租用平台

数字人工智能

立即注册

客服微信

点击聊天

请打开手机微信,扫一扫联系我们

在线咨询

点击咨询

7x24h售后支持

400-663-6698

返回顶部