ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Duix.Avatar 上手教程:用一段视频克隆 AI 数字人,本地生成口播视频

2026/9/11 12:56:02 拓冰建站 浏览量
Duix.Avatar 上手教程:用一段视频克隆 AI 数字人,本地生成口播视频 Duix.Avatar 上手教程用一段视频克隆 AI 数字人本地生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是免费开源的、支持本地部署的 AI 数字人工具上传一段 10 秒左右的视频即可完成形象与声音的数字人克隆之后输入文案或音频即可生成口播视频全部计算跑在本地 NVIDIA 显卡上不依赖外网。这篇笔记面向需要在自己的 GPU 机器上跑通一套数字人视频生成的读者先确认能力边界再按硬件核对、服务部署、客户端使用三步走最后讲开放 API 与高频故障点。成品长什么样数字人视频的能力边界它做的是非实时视频合成流程是一段 10 秒左右、有人声的视频作为素材系统从中提取面部与声音特征生成模特模型之后输入文本或上传音频就能产出这个形象的口播视频。几个具体能力脚本支持 8 种语言中文、英语、日语、韩语、法语、德语、阿拉伯语、西班牙语部署完成后全程离线运行素材和中间文件不出本机客户端支持导入和管理多个模特按场景切换支持全球免费商用用户量超过 10 万或年营收超 1000 万美元的企业需签署商业许可协议仓库内附中英文协议 PDF限制也要说清楚这是离线生成不做实时交互和数字人对话的场景不在这个开源项目范围内。另外全部算力在本地没有 NVIDIA 显卡或驱动没装好三个服务端容器直接起不来项目没有 CPU 兜底方案。克隆前需要核对的硬件与系统要求操作系统Windows 1019042.1526 或更高或 Ubuntu 22.04官方只验证过这一版桌面环境其他 Linux 发行版未做兼容测试显卡NVIDIA驱动正确安装30/40 系列走常规镜像50 系列用仓库里的 5090 专用 compose内存32GB 及以上是必要项16G 机器可能起不来服务端磁盘Windows 要求 C 盘留 100G 以上放 Docker 镜像、D 盘留 30G 以上放数字人和作品数据Ubuntu 要求 100G 以上空闲官方给出的参考配置i5-13400F / 32G 内存 / RTX 4070Windows 上 C 盘不够时装完 Docker 可以把镜像存储位置改到另一个剩余空间大于 100G 的磁盘文件夹从 docker-compose 到三个运行中的服务服务端由三个容器组成TTS 语音合成fish-speech端口 18180、ASR 语音识别fun-asr端口 10095、视频合成端口 8383定义都在 deploy/docker-compose.yml。Windows 路径执行wsl --list --verbose确认 WSL再执行wsl --update更新安装并启动 Docker Desktop在/deploy目录执行docker-compose up -d等待约半小时下载约 70GB 流量建议连 WiFiDocker 里出现三个 Running 服务即成功⚠️ 拉镜像卡在registry-1.docker.io超时是最高频的失败给 Docker 配国内镜像源后重试在/etc/docker/daemon.json里加registry-mirrors字段并重启 Docker镜像源列表见 README_zh 的 Ubuntu 安装一节。Ubuntu 路径apt安装 docker.io 与 docker-compose装 NVIDIA 驱动nvidia-smi能显示显卡即成功再装 NVIDIA Container Toolkit执行sudo nvidia-ctk runtime configure --runtimedocker后重启 Dockerdocker-compose -f docker-compose-linux.yml up -d两个变体50 系列显卡5090 实测通过30/40 系列 CUDA 12.8 也可用改用 deploy/docker-compose-5090.yml只要视频合成、不做声音克隆用 deploy/docker-compose-lite.yml只起一个服务。启动后先翻一遍各容器日志确认没有反复重启从一段视频到数字人的客户端最短路径下载官方构建的安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 双击 AppImage 运行root 用户桌面双击无反应时命令行加--no-sandbox参数启动在创建模特入口上传一段 10 秒左右的视频。⚠️ 视频里必须有人清晰说话的声音——程序要用这段音频做声音克隆无声音或纯 BGM 的素材会直接报错这是新增模特失败最常见的原因转换完成后模特即可用素材视频会被转成 H.264 并与音频分离存档创作页输入文案选语言或上传自己的音频点击生成任务进入队列客户端每 2 秒轮询一次服务端进度直到产出成片客户端内部的完整链路可以对照 src/main/service/model.jsffmpeg 转码、抽音轨、把音频发给 TTS 服务做预处理、拿到参考音频与参考文本后写入本地 SQLite之后所有生成动作都基于这条记录。开放 API绕过界面直接调三个服务Docker 起好后所有能力都在127.0.0.1上暴露开发者可以完全绕过客户端做批量生产声音模型训练POSThttp://127.0.0.1:18180/v1/preprocess_and_tran传入从素材视频分离出的音频需放在 compose 约定的D:\duix_avatar_data\voice\data下返回asr_format_audio_url与reference_audio_text两个字段音频合成POSThttp://127.0.0.1:18180/v1/invoketext之外还要带上一步返回的reference_audio和reference_text视频合成POSThttp://127.0.0.1:8383/easy/submit提交任务再用GET http://127.0.0.1:8383/easy/query?code{code}轮询进度status为 2 时任务完成视频合成请求体最小示例{ audio_url: D:/duix_avatar_data/face2face/temp/xxxx.wav, video_url: D:/duix_avatar_data/face2face/temp/xxxx.mp4, code: 8f0c2d1e, chaofen: 0, watermark_switch: 0, pn: 1 }音频合成接口的固定参数取值直接参考 src/main/service/voice.js 里的makeAudio提交与轮询逻辑在 src/main/service/video.jssrc/main/api/f2f.js 是最简调用示例。最常见的三个故障点服务起不来。先确认三个容器是否都 Running再确认 NVIDIA 显卡和驱动是否就绪——没有 GPU 时三个服务都不会启动这是设计使然不是 bug。新增模特报错。检查素材视频必须包含人声且在说话。声音克隆环节依赖这段人声静音视频或音乐视频都会失败。定制模特报 Connection refused。ASR 服务启动较慢服务端刚起完时克隆操作会连不上等几分钟再试小内存机器如 16G上服务本身也可能拉不起来。完整现象与日志见 doc/常见问题.md。提问时把日志带上。客户端日志的获取位置服务端则点开对应容器的日志复制关键段落。发问题前顺手确认客户端和服务端都是最新版——这个项目更新频繁不少报错在新版本里已经修掉了。继续深入去哪里读部署配置deploy/docker-compose.yml端口映射与数据目录约定都在这里主进程逻辑src/main/service/ 下model.js建模特、video.js任务队列与轮询、voice.js音频合成与试听排障文档doc/常见问题.md技术交流与商务走邮箱 jamesduix.com部署这条链路到此为止。三个服务 Running 之后剩下要做的就是传素材、等进度出问题时按上面的故障点顺序查。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考