30 分钟本地跑通开源数字人口播:Duix-Avatar 部署避坑清单
30 分钟本地跑通开源数字人口播Duix-Avatar 部署避坑清单【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar每次做数字人口播素材都得先传云端数据合规那边一卡就是两周。Duix.Avatar 是一个完全开源的离线数字人工具包丢给它一段 10 秒左右的说话视频本地克隆你的形象和声音之后输入文案或音频自动产出口型同步的口播视频。全程不联网素材和数据都留在自己机器上。一句话说清它能干嘛输入是一段 10 秒左右的说话视频用于 10 秒视频克隆 文案或音频输出是一个可循环使用的数字人模型和一条 mp4 口播视频。中间环节——语音合成、口型驱动——全部由本地 NVIDIA 显卡完成属于典型的离线数字人生成链路。项目说明输入10 秒左右说话视频文案文本或音频文件输出口型同步的口播视频mp4支持平台Windows 10 19042.1526 / Ubuntu 22.04硬件门槛英伟达显卡 32G 内存推荐 RTX 4070许可证免费商用用户量超 10 万或年营收超 1000 万美元的企业需另签协议图 1主界面左侧 Create Video 生成口播视频右侧 Create Avatar 上传 10 秒视频克隆数字人跑起来从零到出片先确认机器过不过关系统Windows 10 19042.1526 以上C 盘 100G 放镜像、D 盘 30G 放数据或 Ubuntu 22.04100G 可用空间硬件英伟达显卡且驱动装好内存 32G 起低于这个数 ASR 服务可能起不来终端跑nvidia-smi能看到显卡信息再往下走Windows 上如果 C 盘不够 100G别急着重装系统在 Docker Desktop 的 Resources → Advanced 里把 Disk image location 指到别的盘即可。图 2C 盘空间不足时把 Docker 镜像存储位置改到其他磁盘用 Docker 拉齐三个数字人服务克隆仓库并在 deploy 目录起服务这一步会拉约 70GB 镜像首次大概半小时注意连 WiFigit clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d # 只要视频合成单服务就改用 -f docker-compose-lite.yml这条命令会拉三个容器TTS 语音合成端口 18180、ASR 语音识别10095、视频合成8383全部挂 nvidia runtime 跑在本地显卡上。Ubuntu 上把命令换成docker-compose -f docker-compose-linux.yml up -d。看到三个容器都是 Running服务端就算就绪了。装客户端生成第一条视频Windows 直接双击 Release 里的Duix.Avatar-x.x.x-setup.exe安装Ubuntu 下载 AppImageroot 用户桌面运行时要在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox。启动后走一遍完整链路上传一段 10 秒的说话视频创建数字人程序会用 ffmpeg 分离出 H.264 视频和 WAV 音频音频送去做声音克隆然后选这个模型输入文案提交合成。作品列表里状态从 waiting 变成 success、能直接播放和导出说明整条链路跑通了。玩出花样3 个可以直接抄的场景1. 存量口播视频批量换讲述人手里已有一批讲品视频的 mp4不想重拍8383 的/easy/submit接口本身就支持新音频 旧视频组合audio_url和video_url分别指向文件路径code填个唯一 uuid 就能提交随后用GET /easy/query?codexxx轮询进度。一段 10 秒的素材视频可以反复复用换文案、换声音就是新视频零重拍成本。2. 线下展厅无人讲解屏一次性生成 3 分钟左右的讲解视频在展厅屏幕循环播放讲解员可以撤。客户端内置任务队列每 2 秒轮询一次进度长文案直接一条生成也可以 API 批量提交排队。同一份素材可以产出中、英、日、韩等 8 种语言版本多语言展会各放一版。图 3中文界面下从右上角设置可切换语言、查看用户协议和客户端日志3. 播客音频动态化成视频做播客或电台的团队把单集音频直接上传编辑页的 EditUpload 支持音频上传驱动数字人口型按音频节奏自动对。一集音频同时产出声音和画面两条内容竖屏平台直接发不用进棚重录。深入一层架构与接口架构就三层每层一句话客户端层Electron Vue 3 桌面应用src/main负责模型管理、文案录入、任务轮询本地 SQLite 存元数据推理层3 个 Docker 容器TTS 基于 fish-speech18180、ASR 基于 FunASR10095、视频合成即 face2face 口型驱动8383数据层模型、音频、产物统一落在D:\duix_avatar_dataLinux 为~/duix_avatar_data与容器通过 volume 共享想绕过 GUI 直接集成两个关键端点# 声音预处理返回 reference 音频和参考文本TTS 合成要用 curl -X POST http://127.0.0.1:18180/v1/preprocess_and_tran -H Content-Type: application/json \ -d {format:.wav,reference_audio:origin_audio/a.wav,lang:zh} # 视频合成提交任务拿到 code 后轮询进度 curl -X POST http://127.0.0.1:8383/easy/submit \ -d {audio_url:/path/a.wav,video_url:/path/b.mp4,code:uuid,pn:1}要改行为认准三个入口src/main/config/config.js里是服务地址和数据目录deploy/docker-compose.yml控制端口映射和卷挂载src/main/service/下的model.js、video.js、voice.js是完整业务逻辑参考。踩坑清单90% 的人卡在这几步1. 拉镜像超时现象docker-compose up -d报request canceled/context canceled。原因Docker Hub 官方源不稳定。解决Docker Desktop 进 Docker Engine 配置加registry-mirrors镜像源列表后重启重新拉取。图 4在 Docker Engine JSON 配置里添加 registry-mirrors 解决拉取超时2. 新增模特报错视频必须有声音现象创建模型直接失败。原因上传的 10 秒视频里没有人说话声音克隆没素材。解决重新录一段人声清晰、持续说话的视频别用风景空镜。3. 克隆时 Connection refused现象日志里 funasrConnection refused。原因ASR 容器启动慢服务刚拉起来就去操作了16G 内存的机器可能根本起不来。解决服务端启动后等 3–5 分钟再创建模特内存低于 32G 先升级。4. 容器日志报 file not exists现象TTS 容器反复刷File not exists。原因volume 挂载路径对不上Windows 默认约定挂 D 盘的duix_avatar_data目录不存在或写错了位置。解决先建好对应目录再核对docker-compose.yml里的 volumes 映射。图 5duix-avatar-tts 容器日志红框处为音频文件路径不存在的报错5. 三个服务没全 Running现象容器反复重启或直接起不来。原因没有英伟达显卡或驱动没加载进容器。解决先跑nvidia-smi确认宿主机正常再docker-compose ps看状态客户端侧的问题就从右上角设置里打开日志看main.log。图 6从客户端设置菜单可直达日志目录main.log 是排障第一现场接下来 社区入口项目近期动作Ubuntu 22.04 版本已正式发布NVIDIA 50 系列显卡5090 实测通过有专门的部署方案docker-compose-5090.yml社区 issue 基本每天都在关单。参与流程Fork 仓库 → 拉功能分支 → 提 PR走标准审查合并。值得盯的扩展方向8 种训练语言继续扩以及客户端基于 Electron 的跨端形态——移动端适配是大概率路径。结尾它最适合素材不能出内网、又要批量产数字人口播的团队和开发者。下一步把 lite 版先跑起来一条 10 秒视频半小时内出片。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考