ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Duix.Avatar 数字人本地部署指南:4 步跑通离线克隆与口播视频生成

2026/9/11 16:55:34 拓冰建站 浏览量
Duix.Avatar 数字人本地部署指南:4 步跑通离线克隆与口播视频生成 Duix.Avatar 数字人本地部署指南4 步跑通离线克隆与口播视频生成【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个面向本地部署的开源 AI 数字人工具包全流程离线运行提交约 10 秒视频即可完成形象与声音克隆再用文本或音频驱动数字人生成口播视频。项目面向需要批量制作口播视频、且不希望素材离开本机环境的内容创作者与开发者。本文基于仓库文档与 deploy/ 目录下的部署文件给出 Windows / Ubuntu 两套环境的最小部署路径、核心能力拆解和常见故障排查项。跑通后的效果预览部署成功后的交付物是一个桌面客户端包含两个主入口创建数字人模型、用已有模型生成口播视频。语音克隆、口型合成、视频渲染全部发生在本机不依赖外网。部署前检查清单硬件与软件项目最低要求推荐操作系统Windows 10 19042.1526 及以上 / Ubuntu 22.04同左NVIDIA 50 系显卡走专用 compose 文件显卡NVIDIA 显卡且驱动已安装必需3 个服务全部依赖 GPURTX 4070内存16G 可能无法启动32G 及以上磁盘WindowsC 盘 100G镜像 D 盘 30G数据Ubuntu100G 空闲SSD软件Docker构建客户端源码才需要 Node.js 18安装官方构建包则不需要最新版两点说明Windows 下 C 盘不足 100G 时可在 Docker 设置中把镜像目录改到空闲大于 100G 的磁盘如果只需要视频合成能力仓库提供 lite 配置只启动一个服务。最小路径4 步跑通服务端与客户端第 1 步克隆仓库git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar部署配置在 deploy/ 目录按系统选择docker-compose.ymlWindows、docker-compose-linux.ymlUbuntu、docker-compose-lite.yml仅视频合成服务。第 2 步准备 GPU 环境服务端 3 个容器均声明runtime: nvidia没有 NVIDIA 显卡或未装驱动时无法启动。先用nvidia-smi验证驱动Ubuntu 还需安装 NVIDIA Container Toolkit 并配置 Docker runtime完整命令见 README_zh.md「Ubuntu22.04 安装」一节。第 3 步启动服务cd deploy docker-compose up -dUbuntu 执行docker-compose -f docker-compose-linux.yml up -dNVIDIA 50 系显卡30/40 系 CUDA 12.8 亦可执行docker-compose -f docker-compose-5090.yml up -d。首次拉取约 70GB 镜像耗时半小时左右Docker 中出现duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个 Running 服务即成功。第 4 步安装客户端并访问Windows 用户安装项目 Release 中的Duix.Avatar-x.x.x-setup.exeUbuntu 用户直接运行Duix.Avatar-x.x.x.AppImageroot 用户需加--no-sandbox参数。客户端启动后进入主界面能创建模型、提交视频任务即为跑通。服务端端口参考TTS 18180、ASR 10095、视频合成 8383均绑定本地回环。核心能力拆解克隆、驱动与多语言按用户可感知的能力划分而不是源码模块形象 声音双克隆提交约 10 秒素材系统自动分离静音视频与音频音频侧走 fish-speech 做声音克隆视觉侧建立 face2face 形象模型。素材必须包含人在说话的声音否则无法完成声音克隆。双驱动方式文本驱动TTS 合成语音后驱动口型与音频驱动直接上传已有音频二选一。8 种语言脚本英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语。口型同步音视频高度同步、口型自然是duix.avatar服务端口 8383的核心产出。多模型管理支持创建多个模型并本地存储、按需切换。客户端对应逻辑集中在 模型服务、视频合成、语音处理 三个文件Docker 侧同时暴露本地 HTTP 接口可绕过客户端直接调用做集成。典型任务实操任务 1克隆自己的数字分身输入10 秒以上的正面视频光线充足、有清晰人声说话内容。操作主界面点击创建模型上传素材等待训练完成自动分离声音、做 ASR 与声音克隆。输出模型列表中一个可驱动的数字人模型。任务 2用文本脚本生成口播视频输入任务 1 的模型 一段文本脚本支持上述 8 种语言。操作视频创作入口选择模型粘贴文本确认语音参数后提交。输出作品列表中可预览、导出的口播视频。任务 3用音频驱动生成口播视频输入已有音频文件自录或他处合成。操作驱动方式切换为音频上传文件后提交。输出数字人按音频节奏与语调驱动口型的视频适合需要保留固定录音语气的场景。排查速查表常见症状对照症状排查项服务起不来、容器反复退出①nvidia-smi确认显卡与驱动 ② 内存是否达到 32G ③docker logs 容器名看具体报错docker-compose up -d拉镜像超时在 Docker 的daemon.json配置registry-mirrors镜像源后重启服务确认网络连通新增模特时报错素材问题素材视频必须带人声说话内容无声视频无法用于声音克隆训练报 Connection refusedASR 服务启动较慢服务端启动后等几分钟再操作确认duix-avatar-asr处于 Running功能异常、怀疑版本落后到deploy/重新执行docker-compose up -d更新服务端客户端更新到最新构建日志从两处获取服务端在 Docker 服务列表中直接复制日志客户端在设置页查看。资源部署配置deploy/docker-compose.yml、deploy/docker-compose-5090.yml50 系显卡常见问题与日志获取doc/常见问题.md客户端服务层src/main/service/model / video / voice许可LICENSE支持全球免费商用用户量超 10 万或年营收超 1000 万美元的企业需签署商业许可协议仓库内附协议 PDF【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考