
Duix-Avatar 本地部署完整指南一段 10 秒视频克隆出会说话的数字人【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix-Avatar 是一款开源、全离线运行的 AI 数字人工具只需一段 10 秒左右的视频就能克隆你的形象和声音再输入文案或上传音频即可生成口型同步的口播视频整个过程都在自己电脑上完成。这份指南带你从零走完先看电脑能不能跑再把服务全部拉起最后做出第一个数字人作品。Duix-Avatar 能做什么10 秒视频怎么变成口播视频 读完这一节你会明白这套工具里雇了哪三位角色以及它适合哪些场景。一句话概括提交一段约 10 秒的视频它学会你的长相和音色之后你只管输入文字或上传录音它就让你出镜开口说话。全程不联网素材和成片都不离开本机。拆开看它由三个服务协作完成角色干什么通俗说法语音合成TTS把任意文字用你的声音读出来一位声线和你一模一样的配音演员语音识别ASR把你视频里说的话转成文字作为克隆参照一位先帮你把台词抄下来的记录员口型合成face2face让画面里的嘴随音频动起来拼出成片一位负责对口型的剪辑师打个比方这就像在家里支起一间小视频工作室配音演员、记录员、剪辑师都齐了你只需要提供出镜的那个人。另外两个实用特性多语言口播内容支持中、英、日、韩、法、德、阿拉伯语、西班牙语八种语言开放 API模特训练和视频合成都开放了本地接口方便嵌进自己的产品下文会给出入口文件。你的电脑能不能跑硬件要求与部署前自查 读完这一节你可以用 3 分钟自查设备是否达标避免装到一半发现缺东西。官方推荐配置如下Windows 与 Ubuntu 22.04 Desktop 相同项目要求说明操作系统Windows 10 19042.1526 或更高 / Ubuntu 22.04 Desktop其他 Linux 版本未做兼容测试CPU第 13 代英特尔酷睿 i5-13400F推荐档官方推荐配置内存32G 及以上必须16G 可能连服务都起不来显卡NVIDIA 显卡 正确驱动必须推荐 RTX 4070项目全部算力在本地 GPU 上跑磁盘WindowsC 盘空闲 100G存服务镜像必须有 D 盘且空闲 30G存数字人和作品D 盘是数据默认存放位置磁盘Ubuntu空闲 100G—⚠️ 两条硬条件先记住必须有英伟达显卡CUDA 是 GPU 干 AI 计算的接口没有它 AMD 或核显都跑不动Windows 用户必须有 D 盘它是数字人数据和作品的默认落点。确认显卡已就绪在命令行执行nvidia-smi能打印出显卡型号说明驱动装好了打印不出来就先装英伟达官方驱动。另外说明一下 50 系显卡5090 已测试通过30、40 系列用 cuda12.8 的用户启动命令需要换一份专用配置下一节会给出。一次把环境跑通拉镜像、起三个服务 读完这一节你的电脑里会有三个或 lite 版一个服务全部 Running客户端随时能连上。Windows 路线准备 WSLWindows 里的 Linux 子系统Docker Desktop 靠它跑容器。执行wsl --list --verbose查看是否装过没装就用wsl --install因网络问题失败就多试几次安装过程中会要求设置用户名和密码记得存好。装完再执行wsl --update更新到最新版。装 Docker Desktop。Docker 可以把每个服务装进互相隔离的容器里跑好比给每个服务单独一套公寓互不干扰。首次启动接受协议、跳过登录看到任务栏托盘图标处于 Running 状态即可。获取代码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar进 deploy/ 目录启动服务cd Duix-Avatar/deploy docker-compose up -d首次启动要下载约 70G 的镜像文件耗时半小时左右速度取决于网速建议连 WiFi 放着跑。标准版之外的两种启动方式lite 版只起视频合成一个服务Duix.Avatar-gen-videodocker-compose -f docker-compose-lite.yml up -d50 系显卡docker-compose -f docker-compose-5090.yml up -d文件都在 deploy/ 目录成功后长什么样启动完成后三个服务对应关系如下服务容器名本地端口职责语音合成duix-avatar-tts18180文字转你的声音语音识别duix-avatar-asr10095说话转文字视频合成duix-avatar-gen-video8383口型合成在 Docker 容器列表里看到它们都是 Running 就算成功lite 版只有一个Ubuntu 22.04 路线先执行docker --version装过就跳过下一步没装则执行sudo apt update sudo apt install docker.io sudo apt install docker-compose装英伟达驱动并确认nvidia-smi正常然后安装 NVIDIA Container Toolkit让 Docker 容器能用上 GPU 的配套工具添加 NVIDIA 源后执行sudo apt-get install -y nvidia-container-toolkit接着配置 Docker 运行时并重启 Dockersudo nvidia-ctk runtime configure --runtimedocker sudo systemctl restart docker启动服务注意 Linux 用的是另一份配置文件 deploy/docker-compose-linux.ymlcd Duix-Avatar/deploy docker-compose -f docker-compose-linux.yml up -d拉镜像太慢时给/etc/docker/daemon.json加上国内镜像源registry-mirrors再试具体位置看下面卡住了一节的截图。装客户端Windows从项目发布页下载官方构建的安装包双击Duix.Avatar-x.x.x-setup.exe安装发布页入口见仓库 README客户端小节。Ubuntu下载 Linux 版的Duix.Avatar-x.x.x.AppImage双击即可运行无需安装root 用户桌面双击打不开时在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox启动。从第一个数字人到第一条口播视频客户端实操 读完这一节你就能做出第一条用自己脸和声音的口播视频。先拍好一段素材视频时长 10 秒左右人脸清晰、光线充足、背景简单头部自然即可视频必须有声音、且是人在说话——程序要靠这段音频做声音克隆。静音视频或只放音乐的视频训练时一定会报错这是新手最高频的坑。创建数字人模型客户端首页点击快速定制上传刚拍好的素材视频给模型起个名字开始训练训练完成后我的数字模特里多出新数字人。生成第一条口播视频首页点创建视频选择刚建好的数字人两种驱动方式二选一文字模式直接输入台词尝鲜时 50 字以内就够音频模式上传录音文件支持 mp3、wav、flac、m4a单个文件时长小于 30 分钟。注意要传纯干音背景杂音会直接影响成片效果生成完成后作品会出现在我的作品列表里可直接预览。想直接调 API服务起好之后本地就开放了模特训练和视频合成接口通过http://127.0.0.1调用语音侧端口 18180先调/v1/preprocess_and_tran处理参考音频再调/v1/invoke合成语音视频侧端口 8383调/easy/submit提交合成任务用/easy/query?code任务码查进度。参数细节不用背直接参考仓库里现成的调用代码src/main/service/voice.js、src/main/service/video.js服务地址配置在 src/main/config/config.js。卡住了本地部署排错自查清单 ️读完这一节大部分报错不用上网搜就能处理。更完整的案例见 doc/常见问题.md。提问前四步自查三个服务是否都是 Runninglite 版一个机器上是否有英伟达显卡、驱动是否正确——这两样缺了服务根本起不来服务端和客户端都更新到最新版服务端到 deploy 目录重新执行docker-compose up -d客户端换最新安装包翻一翻项目社区的 issue 列表很多问题已有现成答案。症状 → 处理速查看到的现象可能原因怎么处理docker-compose up -d报 registry 连接失败、超时Docker Hub 官方源连接不稳定给 Docker Engine 配置国内镜像源见下图再重新拉取镜像下载特别慢网速不够连 WiFi或换镜像源新增模特时报错训练视频没有声音或不是人在说话重拍素材清晰人声、自然表达定制模特时 Connection refused语音识别服务启动慢服务端起来后等几分钟再训练内存 16G 以下可能直接起不来服务完全起不来无英伟达显卡或驱动缺失用nvidia-smi检查装官方驱动镜像源配置位置Docker Desktop → Settings → Docker Engine在配置里加入 registry-mirrors 列表Apply restart镜像源地址会随时间失效仓库文档里列的只是参考搜一下当前可用的最新列表填进去即可。日志在哪找客户端首页右上角菜单里打开日志日志文件是数据目录AppData/Roaming 下对应目录的 logs 文件夹里的main.log服务端在 Docker 里点开对应服务的 Logs 标签页复制报错段落对照上面的速查表定位。做出第一条视频之后回顾一下完整闭环自查硬件 → Docker 拉起三个服务 → 上传 10 秒有声音的视频训练模型 → 输入文案生成口播视频。全程离线素材与成片默认存在本地D:\duix_avatar_dataUbuntu 在用户主目录的同名文件夹。接下来可以按需走深一点只需要出片、不需要重新克隆声音试试 lite 版配置少维护一个服务要多形象为不同场景训练多个数字人模型客户端支持多模型管理要嵌进自己的业务从 18180、8383 两个本地 API 入手无需改任何代码涉及商用先读 LICENSE 及仓库中的商用条款——用户量或营收达到一定规模的企业需要另行签署商业许可协议。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考