ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

10秒视频做出数字分身:用 Duix.Avatar 本地部署 AI 数字人的完整上手指南

2026/9/11 4:10:29 拓冰建站 浏览量
10秒视频做出数字分身:用 Duix.Avatar 本地部署 AI 数字人的完整上手指南 10秒视频做出数字分身用 Duix.Avatar 本地部署 AI 数字人的完整上手指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款免费开源的AI 数字人工具支持本地部署上传一段 10 秒左右的真人视频它就能同时克隆你的形象和声音之后输入一段文字或上传一段音频即可自动生成口型匹配的播报视频。全程在自家电脑离线跑完适合想做口播内容的创作者也适合想在自己机器上玩数字人克隆、又不想把素材交给云端的人。它能帮你做成什么事能力清单 路线对比先说清楚它到底能干哪些活再决定值不值得折腾一段视频出两个分身上传 10 秒说话视频系统自动分离画面和声音形象克隆、声音克隆一次完成不用分别训练文字直接变视频写好文案点生成系统自动配音并把口型对齐产出成品口播视频音频直接驱动不用写文案上传自己录好的音频甚至配音员的干声数字人照着说一个模特反复用形象建好后存在本地可以反复生成多个作品也支持同时维护多个模特多语言文案脚本支持中、英、日、韩、法、德、阿拉伯语、西语 8 种语言全离线运行所有算力都在本地脚本、人脸、声音都不出你的机器开放 API模特训练、音频合成、视频合成的接口都对127.0.0.1开放可以直接接进你自己的系统调用示例见 src/main/service/那该走哪条路线看你的身份你的情况建议路线有英伟达显卡、爱折腾、要改代码深度定制本地部署 Duix.Avatar 开源版本文路线不想买 GPU、专注业务集成、要稳定商用保障官方数字人/克隆音 API 接口服务本文只讲本地部署这条线。硬件门槛先亮出来必须有英伟达显卡和驱动推荐 i5-13400F 32G 内存 RTX 4070内存低于 32G 大概率起不来。裸机走通从装环境到第一条数字人视频这条链路走下来大约一两个小时大部分时间在等镜像下载你真正动手的只有十几次点击和几条命令。先过硬件自检。装好显卡驱动后在终端执行nvidia-smi能显示出显卡信息才算数——本项目所有算力都在本地没有英伟达显卡后面三个服务都起不来。磁盘方面Windows 机器要求有 D 盘且空闲 30G 以上存数字人和作品C 盘空闲 100G 以上存镜像。C 盘不够的话装好 Docker 后在设置里把镜像目录挪到大磁盘装 WSL 和 Docker Desktop。终端里wsl --install网络原因可能失败多试几次中途设置的用户名密码要记住再wsl --update更新一下然后从 Docker 官网下载安装包按提示接受协议、跳过登录即可。拉起来三个 AI 服务。把仓库 clone 下来需要时执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar进入deploy目录执行docker-compose up -d。接下来约半小时、70G 左右的镜像下载记得连 WiFi。判定成功的标准很直白Docker 里出现 tts、asr、gen-video 三个服务且都是 Running 状态。装客户端做第一条视频。Windows 从官方 Releases 下载Duix.Avatar-x.x.x-setup.exe双击安装Ubuntu 用 AppImage 直接运行。打开客户端点创建数字人上传一段 10 秒左右、有清晰人声的视频起个名字等形象训练完成再点创建视频输入一段文案提交生成。作品列表里能看到进度条跑完后直接预览、导出。核心流程拆解10 秒视频是怎么变成数字人的上传的视频为什么必须有人声。很多人栽在这里上传的是一段无声 B-roll结果建模特直接报错。原因很简单——声音克隆就靠这段视频里的声音程序会用 ffmpeg 把音频从视频里抠出来送去做语音训练没有声音就没有参考音频。所以录的时候记得对着镜头正常说话10 秒左右即可。文字和音频两条路进同一条流水线。你输入的文字会先发给本地 TTS 服务端口 18180用你克隆的声音合成语音你上传的音频则直接使用。接着音视频一起送给视频合成服务端口 8383做口型对齐。任务不会同时开工而是进队列逐个处理界面上能看到第 x / 共 y 个的排队位置和实时进度所以一次提交一整天文案也完全没问题。模特与作品是两套独立的管理。模特形象支持分页、搜索、删除删模特会连同它的视频和参考音频一起清掉作品成品视频同样可以预览、改名、导出到指定路径、删除。想深挖接口细节模特训练在 src/main/service/model.js视频合成与队列轮询在 src/main/service/video.js。三个实战场景装好之后你能做什么个人 IP 口播账号。形象建一次长期复用。以后每天的内容就变成写文案 → 点生成不用出镜、不用补录一天更新几条也不累人。课程、培训视频的批量制作。把长文案直接丢进去队列系统会按顺序一条条渲染。晚上提交一批次日的课程视频早上起来全部导出发走是最典型的用法。不爱露脸的商业口播。产品介绍、本地商家宣传可以请一位配音员录干声走音频驱动路线数字人照着念既统一形象又保留人声的细腻度。按机器调优进阶配置与跨平台差异配置比较弱的机器。用 lite 版 compose 文件在deploy目录执行docker-compose -f docker-compose-lite.yml up -d只启动视频合成一个服务省显存。50 系新显卡含 5090。官方已适配同样在deploy目录执行docker-compose -f docker-compose-5090.yml up -d30、40 系用 CUDA 12.8 的也可以走这套。Ubuntu 22.04 用户。装好 docker.io、docker-compose 和 NVIDIA Container Toolkit 后执行docker-compose -f docker-compose-linux.yml up -d即可客户端用 AppImageroot 用户下运行记得加--no-sandbox参数。镜像拉取慢。在 Docker 设置的 Docker Engine 里加国内镜像源registry-mirrors改完 Apply restart数据存放位置。Windows 下数字人与作品数据默认落在D:\duix_avatar_data语音参考文件目录可在 deploy/docker-compose.yml 里按需修改。另外社区里有 8G 显存可用的单镜像整合玩法见 README 共创作品展硬件吃紧可以先去翻翻。排障手册最容易翻车的四个问题与解法docker-compose up -d报连接失败 / request canceled。Docker Hub 官方源不稳定两个办法开全局代理或者按上一节配国内镜像源。新增模特报错提示 file 不存在之类。九成是上传视频里没有人声回去换一段人在说话的视频重建。定制模特报 Connection refusedfunasr 连接异常。ASR 服务冷启动很慢服务刚起来就操作会被拒连——等服务全部 Running 后再等几分钟再克隆。另外 16G 内存的机器可能根本起不动这是 32G 起步的硬原因。三个服务状态不对 / 怀疑显卡。按顺序查nvidia-smi是否显示显卡 → 驱动是否最新 → 到deploy目录重新执行docker-compose up -d拉最新版 → 再看 常见问题文档 里有没有同款问题。卡住时先学会抓两边的日志。客户端右上角设置菜单点打开日志日志文件在AppData\Roaming\heygem.ai\logs下的main.log服务端在 Docker Desktop 点开对应容器的 Logs 页签直接点复制图标把日志拷出来配合报错时间戳去找问题开始前的边界提醒克隆自己的形象和声音、用于个人创作与研究是它的主场未经本人同意不要克隆他人的脸和声音不要用数字人产出误导性的商业内容。商用前请读一遍 LICENSE 与仓库内的模型社区许可协议——用户量超 10 万或年营收超千万美元的企业需要签署商业许可。也因为全离线运行你的脚本和素材天然不落外网隐私上是加分项。今晚就开始做出第一条数字人视频一句话收束一段 10 秒视频、一下午的部署时间换来一个 7×24 小时在线的数字分身文案进、视频出从此不靠出镜。现在就剪一段自己说话的 10 秒视频存好按上面的链路把环境搭起来今晚就能看它开口说话。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考