本地部署实战:5 步跑通离线数字人口播视频生成)
HeyGem.aiDuix.Avatar本地部署实战5 步跑通离线数字人口播视频生成【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar想做一个会说话的数字人却要忍受上传隐私、排队等待、按条收费HeyGem.aiDuix.Avatar把数字人克隆和离线视频生成整套搬到了你自己的电脑上提交一段 10 秒左右的视频就能克隆你的形象和声音之后输入文案或上传音频自动生成口型匹配的播报视频。下面按准备 → 拉起服务 → 客户端出片 → 调优 → 排障 → 落地这条路线走一遍每一步都能独立跑通。一分钟认识它Duix.Avatar 是什么、适合谁HeyGem.aiDuix.Avatar是一款可本地部署、支持 API 调用的开源数字人工具箱。它的核心价值是全离线外貌克隆 声音克隆 文字/语音驱动 视频合成全部跑在本机数据不出电脑。适合三类人——内容创作者反复出片、批量口播不想为每一条付费技术型用户想拿到代码做二次开发或直接调开放 API注重隐私的团队内部资料、客户数据不想上传到云端。它的身体由三个 Docker 服务组成声音合成TTS基于 fish-speech、语音识别ASR基于 fun-asr、视频合成数字人驱动。你只需把它们拉起来客户端就能指挥它们干活。第一关把机器和依赖准备好部署前先把这台机器体检一遍缺一样后面都会卡住。项目推荐配置说明CPUi5-13400F 或同档影响预处理与合成速度内存32G 及以上官方标注为必要项显卡RTX-4070NVIDIA 独显必须有 N 卡且装好驱动所有算力在本地磁盘D 盘 30G、C 盘 100GD 盘存模特和作品C 盘存 Docker 镜像系统Windows 1019042.1526或 Ubuntu 22.04Ubuntu 已验证内核 6.8.0-52-generic运行时Node.js 18客户端与构建依赖⚠️风险提示没有 NVIDIA 显卡或没装驱动三个服务是起不来的这是本地部署最常见的零号杀手。Windows 上先确认 WSLWindows 子系统Docker 的底层运行环境是否就绪wsl --list --verbose预期效果能列出已安装的发行版说明装过了没有则执行wsl --install再执行wsl --update更新一次。网络不稳时多试几次即可。第二关一条命令拉起服务端项目已经自带了deploy/目录下的编排文件里面预定义了三个服务。你只需进入该目录然后git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai/deploy docker-compose up -d预期效果开始拉取镜像大约消耗 70G 流量建议连 WiFi约半小时后 Docker 里出现 3 个 Running 状态的容器分别对应duix-avatar-tts→ 端口 18180声音合成duix-avatar-asr→ 端口 10095语音识别duix-avatar-gen-video→ 端口 8383视频合成小贴士不同硬件/系统有对应变体直接换一条命令即可。低配想先跑通只启动视频合成docker-compose -f docker-compose-lite.yml up -dNVIDIA 50 系显卡已测 509030/40 系 CUDA 12.8 也可用docker-compose -f docker-compose-5090.yml up -dUbuntu 22.04先装好 Docker 与 NVIDIA Container Toolkit再docker-compose -f docker-compose-linux.yml up -d三个服务都 Running这一关就通了。第三关装上客户端生成第一条视频服务端只是后厨客户端才是你操作的前台。直接下载官方构建的安装包Windows 是setup.exeUbuntu 是AppImage后者可直接运行、无需安装双击安装即可。打开后就是熟悉的两大入口左侧我的作品 / 我的数字模特顶部创建视频和快速定制。出片只需三步克隆模特上传一段约 10 秒、有人在对镜头说话的视频程序用它同时克隆外貌与声音写文案 / 传音频输入播报文字或直接上传一段语音合成视频客户端把音频发给 TTS 服务、把模特和音频发给视频合成服务自动对齐口型产出口播视频。 如果你是开发者想直接接开放 API三个端点分别是模特训练http://127.0.0.1:18180/v1/preprocess_and_tran、音频合成http://127.0.0.1:18180/v1/invoke、视频合成http://127.0.0.1:8383/easy/submit用/easy/query?code...轮询进度。客户端源码可参考 src/main/service/ 下的model.js、video.js、voice.js。配置与调优让磁盘和镜像都不拖后腿默认能跑但下面几处调一下体验会顺很多。1. 把 Docker 镜像盘挪到空间够的大盘。进入 Docker Desktop → Settings → Resources → Advanced在Disk image location处把镜像位置改到剩余空间 100G 的磁盘预期效果镜像不再写爆 C 盘拉取和启动更稳。2. 拉镜像慢 / 失败配一个国内镜像源。编辑 Docker 的daemon.json加入registry-mirrors镜像源会随时间变动以官方文档为准{ registry-mirrors: [ https://hub.fast360.xyz, https://docker.m.daocloud.io, https://docker.1ms.run ] }预期效果重启 Docker 后三个镜像的下载速度明显提升。3. 显存吃紧时的取舍。生成时优先保证视频合成服务的shm_size与显存余量降低导出分辨率比硬堆参数更有效高配机可放心开 1080p。避坑与排障三个最常卡住的地方坑一docker-compose up -d报Connection refused或拉镜像超时。多为 Docker Hub 官方源连不上。打开daemon.json配好上面的registry-mirrors再重启即可。坑二新增模特时报错。九成是上传的视频没有声音、或人没在说话——克隆声音必须有可识别的语音样本重拍一段对着镜头念 10 秒文案的片段即可。坑三合成时日志反复出现file not exists/ 连接失败。这通常是三个服务没全 Running或客户端与服务端版本不一致。先按官方提问前自查过一遍取日志的姿势报障时基本都要附客户端日志点右上角设置 → 打开日志文件一般在%AppData%\Roaming\heygem.ai\logs下服务端日志在 Docker 里点开对应容器看日志并复制。⚠️ 排障顺序建议先看服务是否都 Running → 再确认 N 卡与驱动 → 最后核对版本服务端在/deploy重跑docker-compose up -d客户端pull后重新build。社区更新频繁很多问题在新版里已经修了。能落地到哪些场景教育培训克隆一位虚拟讲师文案一换就出新课程口播24 小时在线数字营销批量产出不同卖点的带货/品牌口播省去反复棚拍内容创作把一篇稿子直接变成数字人出镜视频产能拉满远程沟通用数字形象代替真人出镜保护隐私的同时保持一致人设。配合开放 API还能把它接进你自己的业务流程实现文案进、成片出的自动化流水线。一句话收尾HeyGem.aiDuix.Avatar把克隆形象 声音 口型合成这一整套数字人能力做到了全离线、可自建、可二次开发只要一台带 N 卡的机器就能稳定产出口播视频。现在可以动手了你准备用第一个数字人形象讲一段什么内容呢【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考