
Duix.Avatar本地部署教程用10秒视频克隆数字人并生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个支持本地部署和 API 调用的开源 AI 数字人视频生成项目。你只需提交一段 10 秒左右的视频即可克隆数字人的外貌和声音再输入文案或上传音频驱动口型生成口播视频。全程离线运行适合想做数字人内容创作者、教育工作者以及想集成数字人接口的轻度开发者。1. 项目概览Duix.Avatar 是什么定位全离线视频合成工具核心链路是形象克隆 → 声音克隆 → 文案驱动 → 口型合成不需要联网。开源协议采用 DUIX.COM 社区许可协议见 LICENSE全球范围内可免费商用用户量超 10 万或年营收超 1000 万美元的企业需另签商业许可协议。部署形态Docker 容器化部署服务端语音识别、语音合成、视频生成三个服务 Electron 桌面客户端也可通过本地端口 API 调用。解决什么问题商业数字人服务按条计费且数据上云Duix.Avatar 让你在自有显卡上零成本批量生成口播视频素材不出本机。主界面分为创建视频创建数字人我的作品我的数字人四个入口操作路径非常短2. 跑起来之前硬件与系统要求部署前先对照检查任何一项不满足都会卡住操作系统Windows 1019042.1526 及以上或 Ubuntu 22.04显卡NVIDIA 显卡RTX 30/40/50 系列驱动必须装好可用nvidia-smi验证内存32GB 及以上16GB 可能导致 ASR 服务起不来磁盘Windows 下 C 盘需 100GB 以上存 Docker 镜像D 盘 30GB 以上存数字人数据Linux 空闲空间大于 100GB依赖Node.js 18、Docker 与 docker-composeC 盘空间不足时可在 Docker Desktop 的 Settings → Resources → Disk image location 处改到其他磁盘3. Docker 部署 Duix.Avatar 服务端从克隆到三个服务 Running第一步获取代码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar第二步安装 DockerWindows先执行wsl --list --verbose检查 WSL没有则wsl --install再用wsl --update更新然后安装 Docker DesktopUbuntusudo apt install docker.io docker-compose另需安装 NVIDIA 驱动和nvidia-container-toolkitREADME 中有完整命令第三步启动服务。服务端配置都在 deploy/ 目录按系统选一条命令# Windows cd deploy docker-compose up -d# Ubuntu 22.04 cd deploy docker-compose -f docker-compose-linux.yml up -dNVIDIA 50 系列显卡或 30/40 系列 CUDA 12.8使用docker-compose-5090.yml。镜像总大小约 70GB首次拉取约需半小时建议连 WiFi。第四步验证成功。Docker 中出现三个 Running 状态的服务即部署完成Duix.Avatar-asr语音识别基于 fun-asr、Duix.Avatar-tts语音合成基于 fish-speech、Duix.Avatar-gen-video视频合成。第五步装客户端。从 Releases 页下载官方安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Linux 双击.AppImage直接运行root 用户需加--no-sandbox参数。4. 上手实操克隆数字人并生成第一条口播视频第 1 步创建数字人。打开客户端点击右侧蓝色卡片的 Create Avatar上传一段 10–20 秒的真人出镜视频。注意两点人物面部清晰、视频中必须在说话——声音克隆就靠这段音频。上传后等待训练完成模型出现在 My Avatars 列表中。第 2 步生成视频。点击紫色卡片的 Create Video选择刚创建的数字人输入文案或上传音频文件提交生成。系统先把你输入的文字转成克隆音色再驱动口型合成视频。第 3 步管理作品。生成结果进入 My Works支持关键词搜索和分页可以二次编辑或导出。第 4 步查日志与切语言。右上角 Setting 菜单里可以打开客户端日志、查看用户协议、切换界面语言支持中、英、日、韩、法、德、阿拉伯、西 8 种语言的文案合成。5. 核心能力速览外貌 声音一次克隆一段视频同时提取面部特征和音色后续生成不用重复提供素材这是与只换口型类工具的最大区别。文案直驱口型输入文字即可产出有声口播视频多语言脚本8 种语言共用同一套流程做跨语言内容时不用换工具。本地 API 可直接集成服务启动后在127.0.0.1暴露端口语音合成 18180、视频合成 8383模型训练、音频合成、视频合成三步接口的完整参数说明在 src/main/service/ 下的 model.js、video.js、voice.js适合把它接进自己的自动化流程。6. 排查部署与生成常见问题现象docker-compose up -d报request canceled/context canceled原因Docker Hub 官方源连接不稳定镜像拉不下来。 解决在 Docker Desktop 的 Docker Engine 配置中加入国内registry-mirrors再点 Apply restart现象新增模特报错原因创建模特的视频里没有说话声。程序必须用视频中的声音做声音克隆。 解决重新录制确保视频中有人清晰说话时长 10–20 秒。现象克隆时报Connection refusedASR 连接失败原因Duix.Avatar-asr服务启动较慢服务端刚拉起就操作会被拒绝内存低于 16GB 也可能导致起不来。 解决三个服务都 Running 后等几分钟再克隆内存不足需升级硬件。现象生成视频进度卡住不动原因某个服务内部异常最常见的是音频文件路径问题或 TTS 服务重启。 解决分两步定位——客户端在 Setting → Open Log 打开日志再到 Docker 中点开对应服务容器的 Logs 页签复制报错栈把日志贴到项目 Issues 里提问社区响应较快。现象三个服务根本起不来原因没有 NVIDIA 显卡或驱动未装好——本项目所有算力都在本地 GPU。 解决执行nvidia-smi确认能输出显卡信息不行就重装驱动。7. 典型使用场景自媒体创作者可以把它当不出镜的口播产线录一次 10 秒素材之后每天只改文案就能产出新视频多语言版本也只是改一下输入文字。企业和教育机构更适合拿 API 这条路部署一套服务端上层系统调用三个本地接口即可批量生成产品介绍、培训讲解类数字人视频素材全程不出内网。部署过程中任何一步卡住先看 doc/常见问题.md 和 README 的提问前自查步骤问题没解决时带上完整日志去项目 Issues 提问通常能得到较快的回应。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考