ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Duix Avatar 上手全解:离线克隆 AI 数字人,本地生成口播视频

2026/9/11 8:48:47 拓冰建站 浏览量
Duix Avatar 上手全解:离线克隆 AI 数字人,本地生成口播视频 Duix Avatar 上手全解离线克隆 AI 数字人本地生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix Avatar 是一款完全离线运行的开源 AI 数字人工具。上传一段 10 秒视频就能克隆出你的数字分身输入文案即可生成自动对口型的口播视频。读完这篇你可以完成服务端的本地部署并做出自己的第一条数字人视频。项目定位与背景Duix Avatar 由 Duix.com 团队经过七年技术积累后开源。团队走了一条不一样的路不做 3D 建模而是直接用真人视频数据训练数字人模型。这套方法改写了成本结构。传统 3D 数字人制作要花费数十万美元它把成本降到了约1000美元。官方数据显示已有10000多家企业在用教师、法律从业者等通过它生成了超过500000个专属形象。开源之后你在自己的电脑上就能免费制作数字人视频。相比在线服务素材与合成全程发生在本机文件不需要外传。项目更新很快。最新版本补齐了 Ubuntu22.04桌面版、客户端英文界面并支持 NVIDIA 50 系列显卡部署。本文以 Windows 部署为主线讲解。核心能力速览整个能力可以拆成三步克隆人、驱动说话、合成视频对应客户端的 Create Avatar 与 Create Video 两个入口。全程在本机完成。把 10 秒视频变成专属数字人客户端会把上传的视频自动拆成静音视频和音频两部分。音频交给语音识别ASR与声音克隆模型处理形象和声音打包成一个模型。拍摄时不需要专业设备只要画面里人脸清晰、有真人说话10秒素材就够用。用一段文案驱动数字人开口文案先由文本转语音TTS模型转成自然语音数字人再对着音频说话。你也可以直接上传录好的音频数字人会跟着节奏和语调调整口型。脚本支持中文、英文、日文、韩文、法文、德文、阿拉伯文、西班牙文共 8 种语言。把口型与音频逐帧对齐合成服务让静音视频的口型和生成音频逐帧匹配并智能优化音视频同步避免口型对不上的尴尬。合成任务可以在客户端实时看到进度。成品是一条可直接发布到短视频平台的口播视频。从 0 到 1 跑通全流程要求Windows 10 19042.1526或更高或 Ubuntu22.04桌面版、装有驱动的 NVIDIA 显卡、32GB内存、C 盘100GB与 D 盘30GB空闲空间、建议连 WiFi。先用git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar获取代码部署配置都在deploy目录里。在 Windows 上部署服务端与客户端先用wsl --list --verbose检查 Windows 子系统WSL没有就执行wsl --update更新。再安装容器平台Docker的 Desktop 版C 盘不足100G时在设置里把磁盘镜像位置改到空间充足的盘。接着进入deploy目录执行docker-compose up -d镜像下载约需半小时、流量约70GB。Docker 里出现三个 Running 服务即部署成功。安装官方客户端Duix.Avatar-x.x.x-setup.exe在 Create Avatar 上传 10 秒视频再到 Create Video 输入文案合成完成后在 My Works 里就能看到你第一条数字人视频。在 Ubuntu 22.04 上部署执行sudo apt install docker.io docker-compose安装 Docker。装好 NVIDIA 驱动后用nvidia-smi验证能显示显卡信息即可随后安装 NVIDIA Container Toolkit 并重启 Docker。进入deploy目录执行docker-compose -f docker-compose-linux.yml up -d。客户端是.AppImage文件双击运行root 用户启动需加--no-sandbox参数。50 系列显卡30、40 系列开 CUDA12.8也可改用docker-compose -f docker-compose-5090.yml up -d。硬件吃紧可选 lite 版docker-compose -f docker-compose-lite.yml up -d只启动一个合成服务。进阶用法与接口服务端跑通后会暴露几个本地端口你可以绕开客户端直接调用接口。调用模型训练与视频合成接口模型训练把视频拆成静音视频加音频音频放到D:\duix_avatar_data\voice\data再调用http://127.0.0.1:18180/v1/preprocess_and_tran拿参考音频信息。音频合成调用http://127.0.0.1:18180/v1/invoke传入文案和上一步的参考信息返回 wav 音频。视频合成向http://127.0.0.1:8383/easy/submit提交任务传audio_url、video_url、code三个关键参数进度用http://127.0.0.1:8383/easy/query?codetaskCode轮询。客户端的调用实现可以直接参考 src/main/service/ 下的model.js、video.js、voice.js三个文件。选择本地部署还是 API 服务开源本地部署数字人/克隆音 API适合技术型开发者、深度定制业务方、快速集成硬件需自购 GPU 服务器无需 GPU 服务器定制可修改扩展代码只能走 API 扩展开源版支持全球免费商用用户量超100000或年营收超1000万美元的企业需签署商业许可协议见仓库内商业许可协议。避坑与排查三个服务起不来客户端连不上本项目算力全在本地没有 NVIDIA 显卡或驱动没装对服务就起不了。先执行nvidia-smi能看到显卡信息说明驱动正常。docker-compose up -d超时提示 request canceled这是连 Docker Hub 不稳定。打开 Docker 设置在 Docker Engine 的registry-mirrors里加一个国内镜像源再重新拉取完整 JSON 见 doc/常见问题.md。新建模特报 Connection refused 或 file not existsASR 服务启动慢且上传的视频里必须有真人说话的声音它同时用于声音克隆。等服务启动几分钟再试内存只有16GB的机器可能起不了 ASR 服务。Duix Avatar 把数字人制作压缩成一段 10 秒视频加一张 NVIDIA 显卡。有硬件、想要完全离线数字人制作现在就能开始不想折腾部署官方 API 服务是更省事的路线。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考