Duix.Avatar 完全教程:10秒视频免费克隆数字人,本地离线生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一个可以完全在本地离线运行的开源数字人工具:上传一段 10 秒左右的视频,就能克隆你的形象和声音,之后只要输入文案或上传一段音频,它就能自动生成你这个"数字分身"的口播视频。全程不联网,素材和成片都只留在你自己的电脑上。
每次改一版脚本就要重新拍,是不是特别崩溃
假设你要给公司内部培训录一批讲解视频。第一版录到一半,市场那边说改两句口播词——对不起,重新拍;再录完,说换个结尾——继续重拍。更扎心的是,如果出镜的是真人,片约、档期、妆造都是成本;如果你本身不爱出镜,这个需求基本就卡死了。
Duix.Avatar 想解决的正是这件事:先花 10 秒"拍一次",把形象+声音克隆成数字人,后面不管改多少版脚本,都是文字驱动自动生成视频,一次克隆反复使用。
为什么选它:三个理由够说服你
过渡一句:市面上数字人工具不少,为什么偏偏是它?
- 全离线,隐私放心:所有算力都在你的本地显卡上跑,形象和音频不上传到任何服务器,商用场景里这一点非常关键。
- 10 秒视频同时克隆脸和声音:传统方案往往要分别录形象、录音色,它一段说话的视频就够用,口型同步也是自动完成的。
- 免费且可商用:开源协议下全球免费商用(用户量超 10 万或年营收超 1000 万美元的企业需签商业许可,见 LICENSE),个人和小团队基本零成本。
- 显存要求也不苛刻,8G 显存的卡有对应的 lite 轻量版本可以跑。
从零到第一次成功运行:最短路径
过渡一句:说回正事,先把它跑起来,看到画面再谈别的。
先做一件事:确认你的电脑有 NVIDIA 显卡并且装好了驱动。打开命令行执行下面的命令,能看到显卡信息就说明硬件没问题(本项目所有计算都依赖 NVIDIA 显卡,这是硬性条件,驱动请到 NVIDIA 官网按你的显卡型号下载最新版):
nvidia-smi这一步确认显卡正常后,把源码拉下来:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar💡 小贴士:它由"服务端 + 客户端"两部分组成。服务端是 Docker 里的 AI 模型(首次拉取约 70G 镜像,务必连 WiFi),客户端是一个桌面软件。下面分开装。
启动服务端:在仓库的deploy/目录执行(Windows 用默认文件,Linux/Ubuntu 换-f docker-compose-linux.yml;8G 显存换成-f docker-compose-lite.yml):
cd deploy docker-compose up -d然后耐心等半小时左右(下载镜像的时间)。打开 Docker 看到三个服务都是 Running 状态,服务端就算成功了;lite 版本只有一个服务duix-avatar-gen-video。
启动客户端:回到仓库根目录,装依赖再启动(需要 Node.js 18):
npm install npm run dev看到弹出一个写着 "Create Video / Create Avatar" 的桌面窗口,就代表你完整跑通了一遍!
把核心功能玩明白:先造分身,再产视频
过渡一句:软件跑起来了,两个入口分别负责"造人"和"拍片",搞懂这两步,剩下的都是重复劳动。
第一步:创建数字人(Create Avatar)。上传一段 10 秒左右你正脸说话的视频,程序会自动拆出画面和声音:画面用来建你的数字形象,声音用来克隆你的音色。
⚠️ 提醒:这段视频必须带人声,且是人在说话——声音克隆全靠它。上传纯背景音乐或者静默视频,创建必失败。
第二步:创建视频(Create Video)。选好刚建好的形象,然后二选一:直接输入文案(系统自动配音),或上传一段现成的音频。提交后系统自动对齐口型、合成视频,几分钟到十几分钟(取决于显卡和时长)即可在 "My Works" 列表里看到成片。
想让效果更好:视频用 1080p、光线均匀、正对镜头、说话时别大幅度转头,这些"老演员"经验在数字人身上同样适用。
一个完整场景走一遍:60 秒产品介绍口播
过渡一句:把前面的步骤串起来,按这个流程走完,你就有第一条成片了。
- 手机架稳,正对镜头录 10 秒自我介绍,语气就是希望数字人说话时的语气(克隆的是你的声音,语调也会一起被学走)。
- 客户端点Create Avatar上传,等待训练完成,"My Avatars" 里出现你的数字分身。
- 打开Create Video,选中这个形象,粘贴 60 秒左右的产品介绍文案。
- 点生成,去倒杯水回来——任务完成后列表里多了一条作品,点开即可播放或保存到本地。
- 想改文案?复制这条任务改文字重新生成就行,形象和声音不用动,这就是"一次克隆反复用"的含义。
踩坑记录与提速技巧
过渡一句:第一次部署基本都会遇到一两个坑,我把社区里出现频率最高的几个整理好了,对号入座。
坑一:Docker 拉镜像超时、转圈半天。这是 Docker Hub 官方源连接不稳定的锅。解决方式是给 Docker 配置国内镜像源:Docker Desktop 右上角齿轮进 Settings,在 Docker Engine 的 JSON 里加上registry-mirrors数组(具体可用的镜像源地址可参考 常见问题 中的配置示例),保存后重启 Docker 再执行docker-compose up -d。
坑二:C 盘空间不够 100G。Docker 的虚拟磁盘默认放在 C 盘,可以把它挪到空间更大的盘:Settings → Resources → Advanced,点 "Disk image location" 旁的 Browse 换个位置即可。
坑三:服务起不来 / 功能报错。先查两个地方——客户端日志:右上角 Setting 菜单里点 "Open Log";
服务端日志:在 Docker 里点开对应容器的 Logs 页签,看到红色报错就右键复制到社区求助。经验上,90% 的"服务起不来"都是显卡驱动没装好(nvidia-smi先验一遍);"创建模特报错"基本都是上传的视频没有人声。
提速技巧:显存 8G 左右的卡用 lite 版(docker-compose-lite.yml);生成进度卡在 20% 附近不动,通常是显存吃紧,降低输出分辨率或分批处理就能过;另外服务端更新很频繁,遇到问题先在deploy/目录重新docker-compose up -d拉一次新版,说不定已经修好了。
接下来可以玩什么
过渡一句:能出片之后,这条路还能延伸出不少玩法。
- 接进自己的系统:服务端启动后会在本地开放 API(模特训练、音频合成、视频合成三个接口),参考 src/main/service/ 下的调用代码,就能把自己的后台、小程序接上,实现批量自动生成口播视频。
- 做多语言口播:文案支持中、英、日、韩、法、德、阿、西八种语言,换个语言版本的产品介绍只需要重新生成一次。
- 保持更新:服务端在
deploy/目录重新执行docker-compose up -d即可,客户端拉取最新代码重新构建;遇到新坑先看 doc/常见问题.md,那里有完整的自查步骤和报错对照。
现在,先录那 10 秒的视频吧——你的数字分身,离上线只差一次docker-compose up -d。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考