Duix.Avatar 开源数字人工具实测10秒视频克隆形象离线生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar录一门课请老师出镜要订演播室、反复补录成本压不下来。Duix.Avatar 是一个可以本地部署的开源数字人工具上传一段约10秒的带声视频就能克隆出形象和声音输入文案即可生成口型对得上的口播视频全程不联网。本文带你看清它是什么、怎么最快部署、3个核心功能怎么上手以及5个真实高频坑。项目速览Duix.Avatar 能干什么Duix.Avatar 的官方定位是全离线的 AI 数字人工具箱。你只需要一段约10秒的视频它完成三件事克隆外貌构建数字人模特、克隆声音语音合成、口型同步合成把文案或音频驱动成口播视频。整个链路跑在你自己的显卡上ASR 基于 FunASRTTS 基于 fish-speech代码结构可以在 src/main/service/ 里直接看到。官方 README 提到这套方案把数字人制作成本从数十万美元级别降到约 1000 美元而本地开源部署对普通用户是免费商用的注意上限见下文。对比维度传统 3D 数字人云端数字人服务Duix.Avatar 本地部署制作成本数十万美元级官方口径按量/订阅付费免费仅硬件成本数据隐私依赖厂商流程素材上传云端全离线数据不出本机硬件要求依赖厂商管线无需要 NVIDIA 显卡 32G 内存语言支持视供应商视供应商脚本支持 8 种语言中/英/日/韩/法/德/阿/西二次开发不可仅 API代码完全开放可改可扩数据流向大致如下最快跑起来一条 Docker 命令部署本地服务端结论先说最省事的路径是 Windows Docker 完整镜像一条docker-compose up -d拉起 3 个容器。硬件底线是 NVIDIA 显卡驱动装好 32G 内存官方推荐配置为 i5-13400F RTX 4070 32G 内存C 盘留 100G 以上、D 盘留 30G 以上。git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d预期结果首次拉镜像约半小时、消耗约 70G 流量务必连 WiFi之后 Docker 里出现duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video三个 Running 状态的容器服务端就绪。最后从 Releases 下载客户端安装包Windows 为 setup.exeUbuntu 为 AppImage双击打开即可。deploy/ 下还有 4 套 compose 文件按需选方案文件包含服务适用场景完整版docker-compose.ymlasr tts gen-video 三容器文案转语音 声音克隆全流程轻量版docker-compose-lite.yml仅 gen-video 一容器只合成视频音频自己准备50系显卡版docker-compose-5090.yml三容器torch 预览版RTX 5090 / CUDA 12.8 用户Ubuntu 版docker-compose-linux.yml三容器数据落 ~/duix_avatar_dataUbuntu 22.04 桌面已验证⚠️ 注意Ubuntu 只验证过 22.04 桌面版内核 6.8.0-52其他 Linux 发行版官方未做兼容测试macOS 没有提供方案。核心功能上手克隆模特、文字转口播、API 接入10秒视频克隆一个数字人模特怎么操作客户端首页点 Create Avatar上传一段约10秒、有声音且是人在说话的视频填个名字提交。程序会把视频拆成静音视频 音频前者建外貌模型后者放进 TTS 服务做声纹克隆。效果如何提交后在 My Avatars 里出现你的数字人模特之后可以被任意文案复用。注意事项克隆视频必须有真实人声无声视频或纯 BGM 视频会直接报错官方 FAQ 明确光线充足、正面拍摄的素材效果更好。文字驱动生成口播视频怎么操作点 Create Video左侧选模特右侧切文本页签输入文案提交生成。TTS 先把文字合成语音gen-video 再按语音节奏做口型合成最后导出 MP4。也可以切音频页签直接上传现成音频跳过 TTS。效果如何输出是音视频已对齐的口播视频8 种语言的文案都支持。注意事项首次使用如果报 Connection refused多半是 ASR 容器还没起完等几分钟再试详见踩坑指南。用 API 把数字人接进自己的系统怎么操作服务起来后本地就暴露了 18180TTS/ASR 预处理和 8383视频合成两个端口完整调用示例见 src/main/service/video.js 和 src/main/service/voice.js。视频合成最简调用curl -X POST http://127.0.0.1:8383/easy/submit \ -H Content-Type: application/json \ -d {audio_url:/path/a.wav,video_url:/path/face.mp4, code:task-001,chaofen:0,watermark_switch:0,pn:1}能力接口说明音频预处理/声纹注册POST http://127.0.0.1:18180/v1/preprocess_and_tran返回的 reference_audio/reference_text 要记下来文本合成语音POST http://127.0.0.1:18180/v1/invoke用上一步返回值speaker 用唯一 UUID提交视频合成POST http://127.0.0.1:8383/easy/submitcode 作为任务唯一 key查询合成进度GET http://127.0.0.1:8383/easy/query?codexxx轮询到完成注意事项音频文件要放在 compose 里挂载的目录内Windows 默认 D:\duix_avatar_dataLinux 是 ~/duix_avatar_data接口里传的路径以容器挂载关系为准。Duix.Avatar 适合谁不适合谁优势很明确全离线保护隐私、免费商用、代码可改、8G 显存级别显卡可跑。但边界也要说清楚。适合不适合有 NVIDIA 显卡 32G 内存的机器无 NVIDIA 显卡算力全在本地三个服务根本起不来对数据不出本机有硬要求内部培训、合规场景需要实时对话交互本项目定位是非实时视频合成实时交互是官网另一套服务个人/小团队商用零授权费用户量超 10 万或年营收超 1000 万美元的企业需签商业许可协议想改模型/管线、做二次开发的开发者16G 内存机器ASR 服务可能起不来Windows 10 19042 或 Ubuntu 22.04 桌面其他 Linux 发行版、macOS官方未验证/未提供另外官方 README 也坦率地说开源版维护成本高、更新依赖社区口型效果属于可用级别追求更高画质和 SLA 的商用场景官方推荐的是付费 API 服务。选型前想清楚自己要的是能用的开源还是省心的商用。部署与使用踩坑指南5个高频问题坑1docker-compose up -d 报 request canceled / context canceled现象三个容器全部拉取失败日志出现Get https://registry-1.docker.io/v2/: net/http: request canceled。 原因Docker Hub 官方源连接不稳定。 解决在 Docker Desktop 的 Settings → Docker Engine 里配置国内镜像源以下地址来自官方 FAQ时效性自行确认保存后 Apply restart{ registry-mirrors: [ https://docker.m.daocloud.io, https://docker.1ms.run ] }坑2定制模特报 Connection refused现象客户端点克隆形象日志里建立funasr连接异常[Errno 111] Connection refused。 原因duix-avatar-asr容器启动很慢服务端刚起就调用了 ASR。 解决服务端起来后等几分钟再操作如果机器内存只有 16GASR 可能直接起不来这个坑升级内存才能解。坑3新增模特时提示报错现象上传视频提交克隆弹窗报错。 原因用于创建模特的视频必须有声音且是人在说话程序要靠这段声音做声纹克隆。 解决换一段真人出镜说话的视频重新提交细节见 doc/常见问题.md。坑4C 盘空闲不足 100G现象Docker 装完跑不动或镜像没地方落。 原因Windows 版镜像文件默认走 C 盘官方要求大于 100G。 解决安装完 Docker 后在 Docker Desktop 的 Resources 设置里把数据目录改到另一个剩余空间大于 100G 的磁盘坑5出问题了去哪找日志排查前先自查三个容器是否都 Running、nvidia-smi能否正常输出、服务端客户端是否最新版。查日志的入口客户端点右上角 Setting 菜单 → Open Log服务端日志直接点开对应 Docker 容器在 Logs 页复制关键报错段落总结与资源Duix.Avatar 的价值点很集中10秒视频克隆形象、全离线生成口播视频、免费商用、8G 显存可跑且代码和 API 都开放二次开发门槛不高。短板同样明显必须有 N 卡、32G 内存是硬门槛、只适合非实时场景、超大体量商用要另签协议。如果你有一台闲置的 N 卡机器又想批量产出口播视频它目前是值得认真试的开源方案。资源位置完整部署文档README_zh.md常见问题与自查步骤doc/常见问题.md部署配置文件deploy/API 调用示例代码src/main/service/客户端授权协议Duix.Avatar model community Licensing Agreement_zh.pdf项目更新较频繁官方 FAQ 也建议装之前确认用的是最新版本的镜像和客户端有没解决的报错先去 doc/常见问题.md 的自查步骤过一遍再对照服务端日志定位比盲目重装有效得多。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考