HeyGem.ai 本地部署实战:3 步跑通离线 AI 视频生成
2026/8/24 16:53:16 网站建设 项目流程

HeyGem.ai 本地部署实战:3 步跑通离线 AI 视频生成

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

HeyGem.ai 是一个纯离线的数字人视频生成工具:上传一段 10 秒的说话视频即可克隆形象和声音,输入文案自动生成口播视频。这份 HeyGem.ai 本地部署指南覆盖从拉代码、起服务到排查卡点的全部过程。

一、最短路径跑通 HeyGem.ai 环境

前置条件只有一句话:英伟达显卡 + 装好驱动的机器(nvidia-smi能认出显卡),另有 Node.js 18、Docker,⚠️ 内存 32G 起、磁盘留 100G 空闲。

拉代码并进入部署目录:

git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai/deploy

一条命令启动服务端,会拉取 ASR、TTS、视频合成三个镜像,约 70G 流量,耐心等它下完:

docker-compose up -d

客户端有两种拿法:下官方安装包直接双击,或从源码跑开发版(cd .. && npm install && npm run dev)。

验证只有一条命令:

docker ps

预期输出是 duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video 三个容器全部Running;此时打开客户端首页能看到作品和模特列表,说明客户端已连上服务端。

二、核心能力,逐个拆给你看

形象克隆:10 秒视频定制数字模特

解决"每次出镜都要真人拍"的问题。在客户端点"快速定制"上传一段本人清晰说话的视频,系统训练出面型模型,之后这张脸可以无限复用。适合个人 IP、企业播报、培训内容这类反复出镜的场景。

声音克隆:和形象同一次训练完成

解决"克隆的脸配机器音"的违和问题。训练形象时视频里的音频会同步用于声音克隆(ASR 转写 + TTS 参考生成),不用单独录干声。适合要求"脸是自己的、声音也是自己的"的成片。

口型驱动:文案直接变视频

解决"写稿快、拍口播慢"的矛盾。输入文案或上传音频文件,点"创建视频",TTS 合成语音后驱动模特口型输出成片。适合短视频日更、资讯播报、多语言翻译视频。

开放 API:把整条流水线接进自己的系统

解决"批量和自动化"的问题。Docker 起好后本地暴露18180(ASR/TTS)和8383(视频合成)端口,模特训练、音频合成、视频合成各是一个 HTTP 接口。适合接自己的后端做批量生成或产品集成。

三、部署方式怎么选

方式适合谁核心命令
本地直跑(源码客户端 + Docker 服务)要图形界面操作、有 NVIDIA 卡的 Windows / Ubuntucd deploy && docker-compose up -d
Docker 纯服务端服务器 / 无桌面环境,只走 API 调用docker-compose -f docker-compose-lite.yml up -d(只起合成服务)

用 50 系显卡(或 30/40 系 CUDA 12.8)就把命令换成docker-compose -f docker-compose-5090.yml up -d,它基于 torch 官方预览版,配置见 deploy/docker-compose.yml。

性能调优:显卡、内存、存储各留余量

  • GPU:本项目算力全在本地,nvidia-smi认不出显卡时三个服务起不来,先重装驱动。
  • 内存:32G 是硬门槛,16G 下 ASR 服务可能启动不了,克隆时表现为 Connection refused。
  • 存储:Windows 下 C 盘镜像区留 100G、D 盘数据区留 30G;Linux 整机留 100G 空闲即可。

四、卡住了,按这个顺序排查

  • ⚠️ 拉镜像超时(request canceled / context canceled)→ Docker Hub 官方源连接不稳 → Docker Desktop 的 Docker Engine 里给 daemon.json 加registry-mirrors配国内镜像源,Apply & restart 后重跑docker-compose up -d

  • 新增模特报错"视频必须有声音"→ 上传的视频静音或不是人在说话 → 换一段 10 秒左右、人声清晰的视频重传。
  • 定制模特报 Connection refused → ASR 服务冷启动慢,WebSocket 还没建好 → 服务端起来后等几分钟再操作,别急着点。
  • 客户端连不上服务端或页面异常 → 容器没全部 Running →docker ps逐个看状态,重启挂掉的容器,细节翻客户端 logs 目录下的main.log
  • 服务反复起不来 → GPU 没识别或驱动缺失 →nvidia-smi验证驱动,认不出就先装驱动再谈别的。

服务日志的读法:点开对应容器的 Logs 页,找最近的 Traceback 和返回码,多数问题在这一屏就能定位。

五、跑通之后还能玩什么

  • 批量与集成:直接调 8383 / 18180 端口做无人值守的批量合成,接口调用示例参考 src/main/service/ 里的 model.js、video.js、voice.js。
  • 多语言文案:脚本支持中、英、日、韩、法、德、阿、西八种语言,同一模特一键切换语言版本。
  • 多模特管理:导入多个数字模特按业务场景切换,首页的 My Avatars 里统一维护。

更多细节和报错对照,翻仓库里的 doc/常见问题.md。

三个镜像加一个客户端,HeyGem.ai 本地部署就这么简单。clone 下来跑一遍,比看三篇教程都快。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询