ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Duix.Avatar完整指南:免费全离线的开源数字人克隆方案(8G显存可跑)

2026/9/11 5:48:55 拓冰建站 浏览量
Duix.Avatar完整指南:免费全离线的开源数字人克隆方案(8G显存可跑) Duix.Avatar完整指南免费全离线的开源数字人克隆方案8G显存可跑【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar课程稿写好了可租演播室一次就要几千元文案改一版就得重拍一次。Duix.Avatar 是一款免费、全离线的开源数字人克隆工具上传一段约10秒的视频即可完成形象与声音克隆再用文本或音频驱动数字人本地生成口播视频。本文给出 3 种部署方案对比、3 类实战场景、6 个高频问题排查外加显存优化与批量生成技巧照做即可跑起来。项目速览Duix.Avatar 是什么先给结论Duix.Avatar 适合有 NVIDIA 显卡、又不想把素材上传云端的个人创作者和小团队。它是什么基于 Docker 的本地数字人视频生成工具配套 Electron 客户端Windows / Ubuntu 22.04核心链路是 ASR 语音识别基于 FunASR、TTS 语音合成基于 Fish-Speech和口型合成三个本地服务。解决什么问题传统数字人方案要么走 3D 建模成本动辄数十万元要么依赖云端 SaaS素材要出网、按次计费。本项目用真人视频直接训练模型全流程离线素材不出本机。适合谁会 Docker 基础操作的开发者、播客/课程 UP 主、需要批量出宣传片的企业新媒体岗。商用免费用户量超 10 万或年营收超 1000 万美元的企业需签署商业许可协议来源官方 README 授权说明。和常见云端方案的维度对比维度Duix.Avatar本地开源商业云端数字人平台硬件门槛NVIDIA 显卡社区实测 8G 显存可用官方建议 32G 内存无云端算力授权成本免费商用超大规模企业需签协议订阅制 按次/按分钟计费部署难度Docker 一条命令首启约 30 分钟注册账号即用数据隐私全离线素材不出本机素材需上传云端定制化源码开放可改模型与流程仅开放 API 接口快速上手三种 Docker 部署方案对比 结论先行绝大多数人选「完整版」只对口型合成、已有自己录音的选「轻量版」RTX 50 系列用户选「5090 版」。方案配置文件包含服务启动时间*资源占用适用人群完整版Windowsdocker-compose.ymlASR TTS 视频合成3 个容器约 30 分钟README 原文取决于网络C 盘镜像 100G D 盘数据 30G内存 32G文本转语音 克隆全流程Ubuntu 版docker-compose-linux.yml同上3 个容器与完整版相当*用户目录空闲 100G内存 32GUbuntu 22.04 桌面用户轻量版docker-compose-lite.yml仅视频合成1 个容器更快仅拉 1 个镜像*占用明显更小已有音频只做口型驱动50 系列版docker-compose-5090.ymlTTS 视频合成2 个容器CUDA 12.8约 20 分钟*同上RTX 5090 等新卡用户*标注 README 原文之外的为估算值首次拉取镜像约消耗 70GB 流量README 原文建议用 WiFi。最短路劲如下Windows 完整版git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d # 等 3 个容器都变 Up 即成功其他系统/档位Ubuntu 22.04 需先装好 Docker 和 nvidia-container-toolkitREADME_zh.md 有完整步骤cd Duix-Avatar/deploy docker-compose -f docker-compose-linux.yml up -d # Ubuntu 22.04 docker-compose -f docker-compose-lite.yml up -d # 轻量版单容器 docker-compose -f docker-compose-5090.yml up -d # RTX 50 系列客户端直接从 Releases 下载对应安装包安装Windows 双击 exeLinux 运行 AppImage 即可。C 盘紧张的话在 Docker Desktop 里把镜像存储位置挪到别的盘核心能力拆解为什么离线、低显存也能跑全离线架构素材不出本机对用户的意义涉密培训、内部产品资料可以放心喂给数字人断网环境也能用。技术上服务启动后暴露三个本地端口ASRFunASR10095、TTSFish-Speech18180、视频合成8383客户端通过http://127.0.0.1调用全程无外网交互。数据流如下文本/语音双驱动八种语言直接口播对用户的意义写稿的人不用开口口播的人不用写稿。输入一段文字支持英、日、韩、中、法、德、阿拉伯、西八种语言自动合成语音并驱动口型也可直接上传自己录的音频数字人按节奏和语调做表情。多模型管理支持导入多个形象按场景切换。低显存适配8G 显存的机器能开工对用户的意义不需要为数字人单独买一台高配工作站。官方推荐配置是 i5-13400F / 32G 内存 / RTX 4070但社区教程里有 8G 显存跑通完整流程的实测案例。显存压力主要来自视频合成容器官方 compose 文件里已经内置了PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:512来减少显存碎片如果你的需求只是口型合成用轻量版再省掉 ASR/TTS 两个容器。场景实战三类数字人视频的落地做法说明以下数字是按工作流做的场景估算非统计口径用来帮你估算自己的投入产出。1. 知识付费课程口播困境每节课录制半天改稿就要重录场地费按次收。 方案先克隆一次形象一段约 10 秒、带人声的视频即可之后纯文本驱动生成。 结果单节课制作从半天录制 半天剪辑压缩到分钟级生成估算改稿后重出一版口播不再产生任何额外拍摄成本支持多语言版本一次生成。2. 企业宣传产品系列短视频困境新品节奏快外包一条视频报价不低内部拍又没专业场地。 方案把产品介绍稿按卖点拆条用批量生成接口见下文进阶技巧夜间跑完。 结果一个晚上批量产出 30 条左右同形象产品短片估算形象、口型、节奏统一只留人工审核环节。3. 自媒体一鱼多吃困境单条长视频流量见顶衍生内容产能跟不上。 方案长视频口播段落提取音频驱动数字人生成竖版口播切片配不同文案出多版本。 结果一条素材衍生 3~5 条口播切片估算发布时间拉长主视频不用重拍。进阶技巧显存优化与批量生成 ⚙️技巧一控制显存和磁盘显存吃紧优先轻量版只跑视频合成容器确认 compose 中max_split_size_mb:512生效避免显存碎片导致 OOM。磁盘吃紧按上文把 Docker 镜像目录换到大空间磁盘数据目录Windows 默认D:\duix_avatar_dataLinux 默认~/duix_avatar_data可在 compose 的 volumes 里改。技巧二API 批量生成官方开放了合成接口见 src/main/service/video.js提交后用任务码轮询进度适合脚本化批量出片import requests for job in jobs: # job: {code, audio, video} r requests.post(http://127.0.0.1:8383/easy/submit, json{audio_url: job[audio], video_url: job[video], code: job[code], chaofen: 0, watermark_switch: 0, pn: 1}) code r.json()[code] # 随后 GET http://127.0.0.1:8383/easy/query?codecode 轮询进度音频合成文本转语音接口是POST http://127.0.0.1:18180/v1/invoke参数样例见 src/main/service/voice.js其中reference_audio用克隆模特时返回的参考音频即可复现该模特的音色。问题排查6 个高频部署问题速查 ️Q1docker-compose up -d报 request canceled / context canceledDocker Hub 官方源连不上。给 Docker 配置国内镜像源registry-mirrors示例配置见官方 FAQQ2定制模特报Connection refusedASR 容器启动慢。服务刚起来先等几分钟再克隆形象如果机器内存只有 16G可能根本拉不起服务官方 FAQ 结论。Q3新增模特时报错素材是静音的克隆视频必须带人声——程序要用这段声音做声音克隆无声素材必然失败官方 FAQ。Q4三个容器起不来、状态不是 Running先跑nvidia-smi。本项目所有算力都在本地没有 NVIDIA 显卡或驱动没装好服务一定起不来官方自查清单。Q5客户端报服务未响应确认服务端和客户端都更新到最新版服务端在deploy目录重跑docker-compose up -d客户端拉新代码重新构建再docker ps核对容器状态。Q6口型看起来不够自然社区经验光线充足、正面拍摄、背景简单的约 10 秒标准素材克隆出来的口型质量明显更好。出问题时看日志的姿势——Docker 里点开对应容器的 Logs 页签直接复制更多问题按 doc/常见问题.md 的自查清单走一遍提问前务必先贴日志。社区与资源共创计划、学习路径与路线图开源共创计划把你的部署教程、优化指南、实战案例发到 B站、小红书、知乎等平台按点赞量可获大师奖之神奖等称号月度 MVP 解锁开源名人堂数字勋章。优秀作品展见 README_zh.md 的共创专栏。学习路径建议部署读 README_zh.md 的部署流程含 Windows / Ubuntu 两种模式排错doc/常见问题.md 的自查步骤 提问模板二次开发三个开放接口的调用实现都在 src/main/service/看model.js、video.js、voice.js即可理解训练/合成/合成的完整参数。发布节奏与路线图前两项为官方已发布内容最后一项为社区展望非官方承诺2025 Q2已发布Ubuntu 22.04 桌面版适配、客户端英文国际化、若干已知问题修复2025 Q3已发布NVIDIA 50 系列5090 实测GPU 版本2026 H1社区展望实时互动能力下沉本地、显存门槛进一步下探。实时互动目前可先到官方渠道体验非离线方案。仓库地址clone 用git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar觉得有用就收藏 关注部署中踩的坑欢迎在评论区交流。 下期预告《Duix.Avatar 批量生成脚本实战一个 cron 任务跑通 30 条数字人口播视频》。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考