Duix.Avatar本地部署AI数字人视频工作室一段10秒视频能走多远【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar你要批量产出口播视频外包按分钟计费把素材传到云端服务又有点不放心。Duix.Avatar 解决的就是这个问题一款开源、全离线的 AI 数字人工具包上传一段 10 秒左右的视频它就能克隆你的形象和声音之后用文字或音频驱动这个数字分身产出口型匹配的口播视频。素材和模型都留在你自己的机器里。 部署前硬件自检清单Duix.Avatar 没有 CPU 兜底方案全部算力压在 NVIDIA 显卡上所以动手前先对照检查项目要求说明显卡NVIDIA 且装好驱动推荐 RTX 4070没显卡或没驱动三个服务根本起不来内存32GB 及以上16G 可能带不动 ASR 服务硬盘C 盘空余 100GD 盘 30GC 盘存 Docker 镜像D 盘的 duix_avatar_data 存素材和作品系统Win10 19042.1526 或 Ubuntu 22.04Ubuntu 需额外装 NVIDIA Container Toolkit网络建议连 WiFi首次拉镜像约 70G 流量部署有两条路线手上已有音频、只想先跑口型合成的选lite 版单服务要走「上传视频 → 克隆 → 文字出片」完整流程的选完整版三个服务。⚡ 本地部署最小路径先拿源码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar把仓库放到本地deploy 目录里放着各场景的 compose 文件。启动服务端cd deploy docker-compose up -d这一条命令会拉取 fun-asr、fish-speech-ziming、duix.avatar 三个镜像并启动容器同时把 D 盘 duix_avatar_data 挂成数据盘。下载耗时约半小时取决于网速。验证锚点Docker 容器列表里duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务全部显示 Running服务端就算就绪lite 版则是Duix.Avatar-gen-video一个服务 Running。Ubuntu 22.04 把文件换成 Linux 专用版即可docker-compose -f docker-compose-linux.yml up -d客户端是桌面程序从官方 release 下载 setup.exe 安装Windows或运行 AppImageLinux。Ubuntu 下 root 用户进桌面的要在终端加--no-sandbox参数启动。制作你的第一段数字人视频打开客户端首页两个入口Create Avatar创建形象和Create Video生成视频。先克隆形象上传一段你对着镜头说话的 10 秒视频。这一步系统会把视频拆成静音视频 音频对画面做面部识别再用 fun-asr 转写、fish-speech 对声音建模得到一个以你命名的数字模型。这里有个硬性要求素材视频必须带人声。没有声音就没有克隆对象上传那一步就会直接报错。再生成作品选中模型输入文案支持中、英、日、韩、法、德、阿、西八种语言。内部链路是文字 → TTS 合成语音 → 驱动模型生成口型同步的视频也可以直接上传现成音频数字人会按这段音频的节奏和语调表演。成片完成后自动归档到 My Works在线播放和导出都在这一步完成。 进阶与投产部署方式对照场景命令说明完整版默认docker-compose up -d三服务克隆 文字转语音一条龙快速体验docker-compose -f docker-compose-lite.yml up -d只起视频合成服务适合拿现成音频跑NVIDIA 50 系显卡docker-compose -f docker-compose-5090.yml up -d基于 PyTorch 预览版5090 实测通过30/40 系配 CUDA 12.8 也能用值得动的三个参数参数默认值建议值不改会怎样镜像下载源Docker Hub 官方源配置国内 registry-mirrors拉取卡住、超时Docker 数据位置WinC 盘 AppData空余不足 100G 就 Browse 到别的盘镜像写满磁盘直接失败shm_size视频合成服务8g保持 8g长视频合成时共享内存不足会崩Windows 下改数据位置的入口在 Docker 设置 → Resources → Disk image location如果你想把这套服务接进自己的系统Docker 起来后会开放三个本地端口18180 语音合成、10095 语音识别、8383 视频合成/easy/submit提交、/easy/query查进度。参考实现可以看 src/main/service/ 下的 model.js、video.js、voice.js。启动报错排查排障前先过两关三个服务是否都 Runningnvidia-smi能否显示显卡。任一不过后面这些错你大概率一个都撞不上。拉镜像报 request canceled / context canceledDocker Hub 连接不稳。在 Docker Engine 配置里加 registry-mirrors 国内镜像源并 Apply restart或开全局网络。下面两条是客户端侧的高发问题克隆形象报 Connection refusedASR 服务启动慢或内存不够16G 可能起不来。服务端起来后等几分钟再克隆内存只有 16G 的建议先升到 32G。克隆报错但没更多提示素材视频里没有说话声换一段你说话的素材即可。再定位不了翻客户端日志服务端则点对应 Docker 容器「复制」日志对照仓库里的 常见问题 逐条匹配。下一步用nvidia-smi确认显卡可用C 盘腾出 100G。在 deploy 下执行docker-compose up -d等三个服务全部 Running。上传一段带人声的 10 秒视频克隆你的第一个数字分身跑通一条 1 分钟文案。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考