ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

如何用Duix.Avatar免费打造你的AI数字分身:开源数字人本地部署实战指南

2026/9/11 16:56:35 拓冰建站 浏览量
如何用Duix.Avatar免费打造你的AI数字分身:开源数字人本地部署实战指南 如何用Duix.Avatar免费打造你的AI数字分身开源数字人本地部署实战指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar 第一章项目速览——它解决了什么问题Duix.Avatar 是一个完全开源的 AI 数字人项目上传一段 10 秒左右的真人说话视频就能克隆你的形象和声音再输入文本或音频驱动数字人自动生成口型对齐的口播视频全程在自己电脑上离线跑完影像与声音数据不出本地。它是一款全离线视频合成工具适合自媒体创作者、讲师、企业市场团队以及想给产品接入数字人能力的开发者。它带来的价值很直接数字人制作从数万美元、数周周期降到一台 32G 内存的电脑 一块 NVIDIA 显卡。传统做法用 Duix.Avatar3D 建模加动捕流程费用数万美元周期数周10 秒真人视频本地克隆形象与声音素材要上传云端处理影像数据存在泄露风险全离线运行数据不离开设备项目完全开源、免费商用超大型企业的商用授权以仓库内许可协议为准源码也能按你的需求直接改。 第二章快速上手——5分钟跑起来命令本身执行很快但首次运行要下载约 70GB 的服务镜像按网速留半小时到一小时。参考配置32GB 内存、NVIDIA 显卡仓库推荐 RTX 4070、100GB 以上空闲磁盘系统为 Windows 10 19042 及以上或 Ubuntu 22.04。环境准备先确认显卡驱动可用再装好 Docker Desktop。 本项目算力 100% 在本地 GPU 上没有 NVIDIA 显卡或驱动装错后面三个服务都起不来。终端执行nvidia-smi做完这步你应该看到显卡型号和驱动版本。Windows 用户再检查一下 Docker Desktop 里 WSL2 磁盘镜像的位置C 盘需留 100GB 以上不够就在设置里换成空间更大的目录位置如下图中框出处。获取代码克隆仓库并进入部署目录。git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy做完这步你应该看到 4 个 docker-compose 文件分别对应不同部署模式。一键启动完整版一条命令即可轻量版只含视频合成服务把文件名换成docker-compose-lite.yml就行。docker-compose up -d # 启动完整三服务版 # 轻量版则执行: docker-compose -f docker-compose-lite.yml up -d第一次运行大部分时间花在拉镜像建议连 WiFi 耐心等待不再滚动下载进度即完成。验证成功先看容器状态再从仓库的发布页下载对应客户端安装包Windows 是 setup 包Ubuntu 是 AppImage并启动。docker ps做完这步你应该看到 3 个容器处于 Running 状态duix-avatar-tts语音合成、duix-avatar-asr语音识别、duix-avatar-gen-video视频合成轻量版只有最后一个。客户端打开后即是下面的主界面左侧进入首页可看到我的作品和我的数字人两个列表。 第三章核心能力拆解形象克隆10秒视频变数字资产一句话定义给系统一段 10 秒左右的真人说话视频产出一个可反复使用的形象 声音模型。具体流程是你上传素材后客户端把视频转成 H264 统一格式用 ffmpeg 分离出音轨把音频发给语音服务做 ASR 预处理得到参考音频和参考文本两样关键产物之后模特、视频、声音三条记录一并写进本地数据库。克隆完成后这个数字人随时可以被选中、复用、删除。你可以用它来给公司或个人 IP 建立一个标准代言人之后所有视频都用同一张脸、同一种声音出镜。核心逻辑位于 src/main/service/model.js 与 src/main/service/voice.js。视频生成文本或音频驱动自动对口型一句话定义输入文案或上传音频数字人生成口型匹配的口播视频。两个入口直接在文本框输入台词由克隆音色朗读或上传现成音频文件驱动。任务按队列顺序提交客户端每 2 秒轮询一次进度成品视频落到我的作品里支持在线播放和导出。文案支持中、英、日、韩、法、德、阿拉伯语、西班牙语 8 种语言。你可以用它来批量生产知识口播写好 10 条文案排队提交回来收 10 条成片。队列与进度逻辑在 src/main/service/video.js。本地化管理数据、模型、任务都留在自己手里一句话定义所有媒体与模型文件都存放在本机固定目录任务状态记录在本地数据库中。默认数据目录在 Windows 上是D:\duix_avatar_dataLinux 在用户主目录下的对应位置按声音素材、模特作品分区存放删除模型会连同对应文件一起清理视频也能导出到任意位置整个资产库完全由你掌控。你可以用它来沉淀自己的数字人资产一个形象、多段作品、多组声音全部本地可查、可复用。⚙️ 第四章它是怎么做到的架构与原理系统由三个容器加一个 Electron 客户端组成数据链路是输入 → 处理 → 输出。以视频生成为例输入是文案或音频文件加上模特素材视频处理分两段——语音服务用克隆音色把文本读成 WAV视频合成服务再按音频驱动模特画面做口型输出是成片文件写回本地我的作品。最有技术含量的是素材处理链路见 src/main/util/ffmpeg.js输入一段 10 秒说话视频客户端先把它转成 H264再用 ffmpeg 拆成静音视频 音频。静音视频是数字人的底板音频送去识别服务转写成文本与音频一起成为声音的参考对。之后每次合成语音客户端都带着这对参考文件和目标文本调用语音服务{ speaker: 唯一uuid, text: 要合成的口播文案, format: wav, reference_audio: 模特训练返回的 asr_format_audio_url, reference_text: 模特训练返回的 reference_audio_text }也就是说声音克隆并没有往云端传什么模型本质就是参考音频 参考文本这一对凭据每次合成时模型照着参考样本的音色实时发声。这也解释了为什么素材视频必须有声音、必须有人在说话。部署侧对应四个 compose 文件都在 deploy/ 目录按硬件挑一个部署文件包含服务容器数适用场景docker-compose.yml语音合成 语音识别 视频合成3Windows 完整功能docker-compose-lite.yml仅视频合成1只生成视频省资源docker-compose-linux.yml三个服务3Ubuntu 22.04docker-compose-5090.yml三个服务3NVIDIA 50 系30/40 系开 CUDA 12.8 也可理解了原理接下来看看实际能做什么。 第五章实战场景与进阶玩法自媒体口播生产个人创作者把 Duix.Avatar 当成个人演播室录 10 秒自己说话的视频完成克隆之后每天把口播文案丢进去自动产出带自己脸和自己声音的成片。相比拍摄加剪辑流程缩短到写稿 点生成更新频率和稳定性都更容易保证。企业统一 IP 与课程制作市场团队和教培机构可以把一个虚拟代言人固定为品牌统一形象产品讲解、新人培训、课程录制都由同一个数字人完成形象与音色始终一致。新内容只是新文本不用重新拍摄素材也不出内网合规压力小很多。多语言内容本地化文案支持 8 种语言同一段中文原稿可以转成日语、韩语、英语版本。对做跨境业务和出海自媒体的团队来说一次素材投入、多语言分发口型还会随新语言的音频自动匹配。二次开发把数字人能力接进自己的应用服务启动后仓库直接暴露本地 API详见 README_zh.md 的开放 API小节视频合成接口是http://127.0.0.1:8383/easy/submit进度查询用同端口的easy/query。最小调用长这样const res await fetch(http://127.0.0.1:8383/easy/submit, { method: POST, headers: { Content-Type: application/json }, body: JSON.stringify({ audio_url: D:/duix_avatar_data/face2face/temp/audio.wav, video_url: D:/duix_avatar_data/face2face/temp/model.mp4, code: task-001 }) })基于这个端点你可以搭批量生成工作流、内容后台插件或私有化工具。跑批量长任务时建议盯一下服务容器日志方便第一时间发现异常 第六章踩坑速查docker-compose up -d拉镜像报连接超时别急大概率是 Docker Hub 官方源连不通。在 Docker Desktop 的守护进程 JSON 配置里加上registry-mirrors国内镜像源仓库常见问题文档里给了可用列表保存后等 Docker 重启或者开全局代理。验证docker images预期看到 3 个guiji2025开头的镜像容器正常启动。三个服务起不来或反复重启别急大概率是机器上没有 NVIDIA 显卡、或驱动没装好——本项目算力全在本地。验证nvidia-smi预期显示显卡型号和驱动版本命令不存在或报错就去装驱动再重启 Docker。定制模特报 Connection refused别急大概率是语音识别服务启动慢还没就绪内存小于 32GB 也可能起不来。验证docker logs duix-avatar-asr预期服务端启动后等几分钟再操作克隆日志能看到服务就绪信息。新增模特失败提示和音频有关别急大概率是素材视频没有声音或没有人说话——声音克隆必须依赖音频。处理重录素材10 秒左右、面部清晰、连续说话。预期训练成功数字人出现在我的数字人列表。 以上都没解决先打开 doc/常见问题.md 对照自查再看容器日志的最后一行报错把这一行连同复现步骤带上提问。 第七章资源索引Duix.Avatar 把数字人制作从数万美元流程压缩到10 秒视频 一条命令全离线、开源、免费商用。现在打开终端跑通第二章的第一步一小时内你就会拥有一个会说话的 AI 数字分身。中文完整文档README_zh.md官方常见问题与自查清单doc/常见问题.md部署配置文件deploy/客户端核心服务与 API 参考src/main/service/【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考