ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

10秒视频克隆你的专属数字人:Duix.Avatar本地部署实战

2026/9/11 4:06:28 拓冰建站 浏览量
10秒视频克隆你的专属数字人:Duix.Avatar本地部署实战 10秒视频克隆你的专属数字人Duix.Avatar本地部署实战【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar下周一要交10条口播视频你还在排档期、订棚拍吗开源AI数字人项目 Duix.Avatar 可以把这件事搬回你自己电脑上传一段10秒左右的正脸视频本地完成数字人克隆之后输入文案就能自动生成口型匹配的播报视频。适合自媒体创作者、教师和企业培训负责人——素材全程不出本机不依赖外网服务属于真正的数字人视频生成本地部署方案。部署前的硬件体检先确认这台电脑跑得动数字人克隆的算力全部在本地显卡是第一道门槛必须有 NVIDIA 显卡并装好驱动nvidia-smi能显示显卡信息才算通过核显和 AMD 显卡暂不支持驱动版本建议不低于 535CUDA 不低于 12.150 系显卡请走专门的docker-compose-5090.yml方案内存 32G 起步官方推荐配置约为 i5-13400F RTX 4070 这一档Windows 需 10/11 较新版本且启用 WSL2硬盘方面存 Docker 镜像的分区通常是 C 盘要留足 100G 以上存数字人素材和作品的分区留 30G 以上C 盘不够用不用换电脑——在 Docker Desktop 的 设置 → Resources 里可以把磁盘镜像位置迁移到别的盘❌ 别在机械硬盘上跑镜像下载和模型加载都会被拖慢 ❌ 别跳过驱动检查没有可用 GPU 时三个容器都起不来 ✅ 首次拉取镜像会消耗约 70G 流量连 WiFi 比用热点稳 ✅ 镜像下载慢时给 Docker 配置国内镜像源daemon.json 的 registry-mirrors5分钟拉起三个容器服务端一键启动服务端就是三个 Docker 镜像分工很清晰fun-asr负责语音识别fish-speech-ziming负责语音克隆合成duix.avatar负责视频合成。项目里的 deploy/ 目录已经配好了编排文件clone 下来照着执行即可git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar docker pull guiji2025/fun-asr docker pull guiji2025/fish-speech-ziming docker pull guiji2025/duix.avatar cd deploy docker-compose up -d首次启动要耐心等待镜像下载约半小时看到 Docker 里三个服务都是 Running 就算成功。显存或配置吃紧的机器可以改用 lite 版docker-compose -f docker-compose-lite.yml up -d只起一个服务Ubuntu 22.04 则用docker-compose-linux.yml。❌ 首次启动别中途打断模型初始化需要时间 ❌ 服务异常时反复up只会越堆越多先docker-compose down清理 ✅ 用docker ps确认三个容器状态卡住的用docker logs看具体报错 ✅ 端口别动TTS 在 18180视频合成在 8383客户端默认连http://localhost:18180客户端装好连上本地服务服务端跑起来后装客户端桌面端从项目 release 页下载对应系统安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 下双击.AppImage直接启动root 用户需加--no-sandbox参数打开客户端默认就会连接本机 18180 端口看到首页的 Create Avatar / Create Video 入口即代表连通❌ 路径带空格或特殊字符时安装容易出怪问题装到干净的英文路径最稳 ❌ 连不上服务端时先查 Windows 防火墙放行 18180 和 8383 ✅ 同时只开一个客户端实例 ✅ 版本更新频繁遇到问题先升级到最新版很多坑官方已经修了10秒素材训练克隆你的第一个数字人素材质量决定克隆上限。录制一段 10~30 秒的视频然后在客户端点 Create Avatar 上传训练完成后会出现在 My Avatars 列表里。典型场景下 RTX 4070 训练一个模型约 15 分钟。❌ 视频里戴眼镜、帽子或让头发遮挡五官特征提取会翻车 ❌ 多人入镜、频繁转头、光线忽明忽暗的素材不要用 ✅ 正对镜头、背景简单、光线均匀分辨率不低于 720P ✅ 推荐 MP4 格式训练失败时点右上角 Open Log 看客户端日志定位原因生成第一条数字人视频训练完成后切到 Create Video选择数字人模型 → 输入文案或上传自己的音频→ 生成。口型由服务端自动对齐产物会出现在 My Works 作品列表里可在线播放或查看文件位置。❌ 单次文案控制在 500 字以内超长文本容易把合成任务拖垮 ❌ 合成进行中别关客户端任务状态跟着会话走 ✅ 走音频驱动模式时音频采样率保持 44.1kHz 效果最稳 ✅ 合成失败优先查显存视频合成就发生在 8383 端口的duix.avatar服务里原理速览10秒是怎么克隆出你的知道它在做什么出问题时你就知道该查哪里三维面部重建基于 3DMM把人脸参数化成一套可计算的三维模型分析你的视频提取面部关键点与表情动态这样数字人不是贴图换脸而是能跟着语气做微表情两阶段语音克隆先用 FunASR 把参考音频转成文本并做声纹预处理再交给 Fish-Speech 学习你的音色之后输入任意文案都能用你的声音读出来文本到口型同步生成的音频逐帧驱动嘴部动作画面与声音在合成服务里对齐输出所以你听到什么它说什么容器化编排ASR、TTS、视频合成三个模型各自独立成容器互不干扰。哪个环节报错日志也只会出现在对应容器里排查路径很直白三种玩法教育、培训与自媒体怎么用批量课程制作教育场景录一次教师形象之后不同课程共用同一个数字人。脚本支持八种语言多语种课件可以复用同一套口型管线。进阶用法是直接调用本地 API 打通你的课程系统比如让 LMS 自动把讲义丢给服务端出片import requests resp requests.post( http://127.0.0.1:18180/v1/invoke, json{ speaker: teacher-001, text: 今天我们学习微积分的基本定理……, format: wav, topP: 0.7, reference_audio: preprocess_and_tran 接口返回值, reference_text: preprocess_and_tran 接口返回值, }, )口播稿批量喂进去出片时间就从一天录几条变成一天能过完几十条脚本具体吞吐取决于显卡和文案长度。客服/培训分身企业场景录一段客服标准形象做训练素材把常见问题做成固定视频预生成高频问题直接调缓存长尾问题才走实时合成配自动字幕后一套分身可以多语言分发。自媒体口播个人场景文案 API 产稿 → 数字人配音 → 自动合成一个人就能跑完过去需要摄制小组的流水线。典型体验是产能提升数倍、单条制作时间缩到原来的几分之一具体幅度随硬件与内容复杂度浮动。进阶与求助调优、二开入口和社区资源性能显存紧张就降到 720P 出片速度能明显提升低配机器直接用 lite 版编排定期清理无用镜像释放磁盘二次开发客户端是 Electron Vue 3 写的服务调用逻辑在 src/main/api各业务的接口封装在 src/main/service界面组件在src/renderer/src/views下想加个按钮或换个交互入口都很直白排查顺序先确认三个容器 Running → 再确认nvidia-smi正常 → 客户端/服务端都升到最新 → 翻日志。完整问答见 doc/常见问题.mdDuix.Avatar 把数字人克隆的完整链路开源并放到本地运行意味着隐私敏感的团队和个人创作者都能零门槛起步有 NVIDIA 显卡、愿意折腾 Docker 的话今晚就能克隆出你的第一个数字分身只想要结果、不想维护服务的也可以关注其官方 API 服务作为备选路径。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考