Duix.Avatar 本地部署指南:从一段10秒视频到第一条数字人视频
Duix.Avatar 本地部署指南从一段10秒视频到第一条数字人视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个开源数字人工具包主打本地部署、全程离线上传一段10秒左右的人声说话视频即可克隆你的形象和声音之后输入文案就能产出数字人口播视频。本文按“环境检查 → 启动服务 → 验证 → 客户端连接”的顺序带你把服务端跑起来并生成第一条视频。它能做什么本地克隆数字人并生成视频输入一段约10秒的说话视频必须包含清晰人声之后每次生成只需文案文本或音频文件输出口型同步、带本人形象和声音的口播视频形象模型与视频作品分别入库可反复复用三个计算服务都跑在本地 GPU 上必须 NVIDIA 显卡AMD 核显或 Mac 不满足条件定位是“文字驱动的视频生成”不做实时对话式数字人交互文案支持 8 种语言中、英、日、韩、法、德、阿拉伯、西语原理速览一段视频如何变成数字人整条流水线由三个本地服务协作完成各司其职声音克隆fish-speech 语音合成服务从约10秒音频里学习音色之后任意文本都能读成“你的声音”语音识别fun-asr 服务把原始视频里的音频转成文字为声音克隆提供参考内容面部驱动视频合成服务face2face按音频节奏逐帧驱动原视频的口型与表情产出新视频三个服务分别监听 8383合成、18180语音、10095识别端口客户端只是调用这些本地接口的图形界面接口调用参数可参考 src/main/service/video.js。本地跑起来环境检查到服务启动共四步1. 检查硬件是否达标推荐配置为 13 代 i5、32GB 内存、RTX 4070 及以上系统要求 Windows 10 19042.1526 以上。硬性条件是必须有 NVIDIA 显卡并装好驱动否则三个服务一个都起不来。nvidia-smi free -h磁盘空间容易被忽略C 盘需要约 100GB 存放 Docker 镜像D 盘预留 30GB 存放数字人数据。C 盘不够时可在 Docker 设置里把镜像存储目录改到空间更大的盘。避坑Ubuntu 22.04 用户需额外安装 NVIDIA Container Toolkitnvidia-smi能正常输出显卡信息再继续。2. 安装 Docker 并更新 WSLwsl --list --verbose wsl --update再从 Docker 官网安装 Docker Desktop首次启动接受协议并跳过登录。3. 一条命令启动三个服务git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d首次拉取镜像约 70GB耗时半小时左右。配置紧张或只想体验合成流程可用轻量版只启动合成服务docker-compose -f docker-compose-lite.yml up -d4. 验证服务并连接客户端docker-compose psduix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video 三个服务均为 Running 状态即部署成功轻量版只有一个 gen-video 服务。随后安装客户端Windows 装 .exeUbuntu 双击 .AppImage首次启动会自动连接本地服务。数据统一存在D:\duix_avatar_data目录Linux 在用户主目录不要删。第一次使用从上传素材到生成第一条数字人视频四步走通最小闭环创建模特在客户端首页点击形象创建入口 “Create Avatar”上传一段正面、光线充足、自己说话的10秒视频并命名提交后后台会把视频拆成静音视频加音频分别训练形象和声音检查模特训练完成后“My Avatars” 里出现新模型口型或音色不满意时换一段环境更安静的视频重训输入文案点击 “Create Video”选择刚创建的模型输入口播文本也可直接上传音频文件驱动生成保存等待合成完成后播放视频作品自动存入 “My Works”模型可反复用于生成新视频能拿它做什么三个真实场景批量口播内容把图文脚本批量转成口播视频。可以绕过客户端直接调用本地接口http://127.0.0.1:8383/easy/submit提交任务、用easy/query查进度适合脚本化批量生产多语言内容复用同一个模型支持 8 种语言文案。已有中文版课程的话把文案换成英文再生成一版不用重拍低配机器轻量体验磁盘或显存吃紧时先用docker-compose-lite.yml轻量版启动只部署合成服务省掉两个服务的镜像占用报错速查本地部署最高频的 4 个错误错误信息原因解法Get https://registry-1.docker.io/... request canceled连接 Docker Hub 不稳定在 Docker Engine 配置里加国内镜像源registry-mirrors后应用创建模特时file not exists上传的视频没有人声或音频未同步到服务目录换一段人声清晰的视频重新提交ASR 连接Connection refusedASR 服务启动慢或 16GB 内存装不下服务启动后等几分钟再克隆形象内存不足则升级服务起不来 / 客户端连不上没有 NVIDIA 显卡或驱动未装好执行nvidia-smi确认显卡可识别第一个错误的镜像源可在 Docker Desktop 的 Settings - Docker Engine 页面配置第二个错误常见于 tts 容器的运行日志里客户端侧的日志在设置菜单里选择 “Open Log” 查看服务端侧在 Docker Desktop 里点进对应服务的 Logs 页复制最近一段报错仍无法定位时可对照仓库自带的排查清单 doc/常见问题.md。服务跑通后下一步建议先拍一段光线充足、背景干净的10秒说话视频把创建模特流程完整走一遍确认形象和声音克隆效果符合预期。第一条视频产出后再考虑批量生成和接口对接。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考