5分钟跑通实时数字人直播:LiveTalking 完整部署指南
【免费下载链接】metahuman-streamReal time interactive streaming digital human项目地址: https://gitcode.com/GitHub_Trending/me/metahuman-stream
LiveTalking 是一套实时交互流式数字人直播引擎:把一段文字或语音丢给它,数字人立刻开口、口型跟着内容走,说话中途还能被打断。适合想搭虚拟主播、数字人客服、直播互动的开发者与内容创作者,零基础也能照着跑通。
一|场景切入:3个真实用法
- 无人电商直播:数字人 24 小时播产品话术,不说话时按编排播放自定义动作视频
- 前台数字人客服:用户语音提问,数字人实时回答,问错了随时打断重说
- 视频会议出镜:数字人变成一台"摄像头",Zoom、腾讯会议里照常开会
二|上手路径:4步从0到跑通 🚀
第1步|克隆仓库、装依赖(3步跑通环境)
目标:建好 Python 3.12 环境,装上 PyTorch 和项目依赖。
git clone https://gitcode.com/GitHub_Trending/me/metahuman-stream cd metahuman-stream conda create -n livetalking python=3.12 pip install torch==2.9.1 torchvision==0.24.1 torchaudio==2.9.1 --index-url https://download.pytorch.org/whl/cu128 pip install -r requirements.txt跑完没有红色报错即通过;若机器 CUDA 不是 12.8,先执行nvidia-smi确认版本,再换装对应的 PyTorch。
第2步|模型文件各归其位(2个文件,2条命令)
目标:让口型模型和数字人素材就位。模型文件从 README 给出的官方网盘下载,然后:
cp wav2lip256.pth models/wav2lip.pth tar -xzf wav2lip256_avatar1.tar.gz && cp -r wav2lip256_avatar1 data/avatars/验证:models/wav2lip.pth与data/avatars/wav2lip256_avatar1两个路径都存在,即算成功。
第3步|一条命令启动服务
python app.py --transport webrtc --model wav2lip --avatar_id wav2lip256_avatar1日志显示服务在 8010 端口监听且无报错,即启动成功;注意服务器需放行 TCP 8010 与 UDP 1-65536。
第4步|浏览器里验证数字人开口
打开http://<服务器IP>:8010/index.html,点击"开始连接",在文本框输入任意文字并提交。
画面里的数字人开口说话、口型跟着语音走,就算跑通了。
三|能力拆解:你拿它能做什么
换模型不换流程—— wav2lip256(推理快、入门首选)、musetalk(画质更好)、ernerf(神经辐射场渲染的 3D 头部)、ultralight(轻量方案),四种数字人模型只改--model和--avatar_id两个参数。
让数字人用你的声音说话—— 在 config.yaml 里填REF_FILE(16kHz 单声道 wav)和REF_TEXT,就是声音克隆;TTS 侧 EdgeTTS、GPT-SoVITS、CosyVoice、腾讯等多家方案可切换。
说话中途打断—— 调用/interrupt_talk接口或点页面上的"打断"按钮,数字人立刻闭嘴、转听你的新问题,这是直播互动的关键体验。
输出去向按场景挑—— WebRTC 给浏览器用,RTMP 推到直播平台,虚拟摄像头则能插进 OBS、腾讯会议:
一切用 API 驱动——/human发文本、/humanaudio发音频,每个连接有唯一 sessionid,支持多人并发;完整参数见 docs/api.md。整条链路的数据流如下:
四|硬件与性能:显卡怎么选
日志里inferfps(GPU 推理帧率)与finalfps(最终推流帧率)都 ≥25 才算实时。实测数据:
| 模型 | 显卡 | 实测帧率 (FPS) |
|---|---|---|
| wav2lip256 | RTX 3060 | 60 |
| wav2lip256 | RTX 3080Ti | 120 |
| musetalk | RTX 3080Ti | 42 |
| musetalk | RTX 3090 | 45 |
| musetalk | RTX 4090 | 72 |
选型一句话:入门和跑通最小示例,wav2lip256 + RTX 3060 就够;追求更强真实感,musetalk 至少 RTX 3080Ti 起步。
五|懒人路线与进阶路线:Docker一键部署
懒人路线:Docker 一条命令🐳
docker run --gpus all -it --network=host --rm registry.cn-beijing.aliyuncs.com/codewithgpu2/lipku-metahuman-stream:2K9qaMBu8v容器起来后开放 8010 端口,后续操作与第二节完全相同;官方另提供 AutoDL、UCloud 的在线 GPU 镜像,可免安装直接开实例。
进阶路线—— 需要高清画质、实时语音互动、同步字幕、透明背景叠加、实时换人等交付级能力,可看商用版(在开源版基础上新增 wav2lipls 等);想二次开发,用 registry.py 的注册机制扩展 TTS、数字人形象或推流模块。
六|避坑指南:5个高频问题 ⚠️
Q1 页面连不上、视频不出画面?放行服务器防火墙的 TCP 8010 和 UDP 1-65536——WebRTC 强依赖 UDP 端口段。
Q2 模型下载失败、HuggingFace 连不上?先设镜像,再重新执行下载命令:
export HF_ENDPOINT=https://hf-mirror.comQ3 虚拟摄像头报 "virtual camera output could not be started"?先安装 OBS Studio,启动一次再关闭(激活虚拟摄像头设备),然后执行pip install pyvirtualcam pyaudio,详见 docs/virtualcam_guide.md。
Q4 RTMP 推流被 ffmpeg 报错卡住?运行ffmpeg看输出,必须包含libx264,没有就换用带--enable-libx264构建的版本(社区验证 4.2.2 可用)。
Q5 pytorch3d、protobuf 等依赖装不上?对照 assets/faq.md 处理:pytorch3d 需要下载源码编译安装,protobuf 固定装 3.20.1 版本。
浏览器里数字人开口的瞬间,整条"文字→语音→口型→推流"链路就真正通了,这也是判断部署是否成功的唯一标准。下一步建议:先把音色换成你克隆的声音,再决定用 WebRTC 还是 RTMP 推向目标平台——先跑通最小示例,再谈定制。
【免费下载链接】metahuman-streamReal time interactive streaming digital human项目地址: https://gitcode.com/GitHub_Trending/me/metahuman-stream
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考