HeyGem.ai 本地部署:从 10 秒素材到数字人口播视频
2026/8/23 10:52:06 网站建设 项目流程

HeyGem.ai 本地部署:从 10 秒素材到数字人口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

HeyGem.ai 是一款能完全离线跑的 AI 视频生成平台:上传一段 10 秒左右人说话的视频,它克隆形象和声音,再用文字或音频驱动数字人合出口型、生成数字人视频。本地部署后全程不需要联网,素材和成片都留在你自己的机器上。下面把它能做什么、怎么跑起来、怎么把效果做顺,一次讲清楚。

🎬 它到底解决了什么问题

商用链路贵,素材还要出门

商用的数字人服务按条计费,素材和成片都得过一遍云端。HeyGem.ai 把全部算力压到你自己的 NVIDIA 显卡上:模型在本地、素材在本地、成片在本地,隐私自己掌握。开源协议也支持全球免费商用,商用场景用不卡壳。

装好之后能干三件事

  • 克隆形象与声音:上传一段约 10 秒的人说话视频,程序自动分离音画,完成声音克隆;
  • 文字或音频驱动口型:输入文案由 TTS 转成语音,或直接上传自己的音频,数字人跟着说话,这条"文字 → 语音 → 视频"链路就是完整的多模态视频生成;
  • 多语言脚本:中、英、日、韩、法、德、阿、西 8 种语言都支持。

界面很直白:首页两个大入口,"创建视频"和"创建形象",下面挂着作品库和数字模特列表。

跑起来之前你需要什么

装完依赖就能直接跑?差得远。HeyGem.ai 是 Electron 桌面客户端 + 三个 Docker 服务(语音识别、语音合成、视频合成)的组合,动手前先看硬件和磁盘。

先对一遍机器

项目要求说明
显卡NVIDIA 显卡 + 驱动装好全部算力靠它,nvidia-smi查不到显卡就起不了服务
内存32G 及以上16G 可能撑不起三个服务
磁盘镜像约 100G,数据再留 30GWindows 下镜像默认在 C 盘
系统Windows 10 19042.1526+ 或 Ubuntu 22.04Ubuntu 桌面版已做过适配验证

C 盘紧张的话,在 Docker Settings → Resources 里把 Disk image location 改到大容量的盘。70G 镜像下载完 C 盘爆满,是最容易先踩到的坑。

提前拉好三个镜像

三个镜像分别是guiji2025/fun-asr(语音识别)、guiji2025/fish-speech-ziming(语音合成)、guiji2025/duix.avatar(视频合成),总下载量约 70GB,看网速要等半小时以上。连 Docker Hub 慢的话,先在 Docker Engine 设置里配国内镜像源再动手:

从零到出片的完整路径

第一步:克隆仓库、启动客户端

先把代码拉下来,以开发模式跑客户端(需要 Node.js 18;嫌折腾的话也可以直接用官方构建好的安装包):

git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai npm install npm run dev

第二步:拉起三个服务端

服务端用的 docker-compose 文件在deploy/目录里,到那个目录执行,一条命令把三个服务全拉起来:

cd deploy docker-compose up -d

Docker 里看到 asr / tts / gen-video 三个容器、状态都是 Running,服务端就齐了。

第三步:创建数字人,出第一条片

点"创建形象",上传那段 10 秒的人说话视频。注意素材必须有清晰人声——程序要拿这段声音去克隆,静音的片子会直接失败。上传后别急着点下一步:ASR 服务是启动最慢的一个,Docker 起来后等几分钟再操作。虚拟角色建好后输入文案或上传音频,数字人视频生成流程就走完了,几分钟后得到一条口型对齐的口播视频。

让效果更好的几个关键点

素材质量决定上限

后面的参数都是在克隆质量基础上做加法。源素材越长越好吗?不一定,10 秒左右就够,正面、脸部无遮挡、声音干净没有背景音乐,素材越好口型上限越高。

显存不够就换 lite 版

完整版一次拉三个服务,其中视频合成最吃显存。显存紧张、只需要口型合成这一步的话,用 lite 的 compose 文件:

cd deploy docker-compose -f docker-compose-lite.yml up -d

它只起Duix.Avatar-gen-video一个服务(端口 8383)。如果是 5090 这类 50 系显卡,改用docker-compose -f docker-compose-5090.yml up -d,官方已实测可用。

开放 API 接进自己的程序

服务端起来后,核心能力以本地 API 暴露:语音合成走 18180 端口,视频合成走 8383,http://127.0.0.1直接调。客户端自己的调用代码就是最好的参照,src/main/service/ 里三个文件分别是模型训练、语音合成、视频合成的实际实现,比看文档直接。

翻车了怎么办

服务起不来

按概率排序:三个容器没全部 Running(打开 Docker 逐个看);NVIDIA 驱动挂了(nvidia-smi查不到显卡就起不了服务,这是本项目最硬的约束——所有算力都在本地);版本旧了(项目更新频繁,到deploy/重新执行docker-compose up -d把服务端刷一遍)。

建形象报 Connection refused

基本是 ASR 服务还没启动完,再等几分钟重试。如果机器内存只有 16G,服务可能直接起不来,32G 是硬门槛,别抱侥幸。

先查日志的这两个位置

  • 客户端:右上角设置菜单里"打开日志目录",重点看里面的main.log
  • 服务端:点开各个 Docker 服务,进容器日志,把报错段直接复制出来。

更典型的报错和解法,直接翻项目里的官方 FAQ doc/常见问题.md。

下一步就三件事:把仓库 clone 下来、拉好三个镜像、花一个下午让第一条数字人口播片跑出来。先用完整版把流程走通,再按自己的显存切 lite 或用 API 接进你自己的工具链。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询