资讯动态

metahuman-stream 完全指南:4 步搭建实时交互流式数字人

发布时间:2026/9/18 13:34:01 来源:尧图企业网站定制
metahuman-stream 完全指南4 步搭建实时交互流式数字人【免费下载链接】metahuman-streamReal time interactive streaming digital human项目地址: https://gitcode.com/GitHub_Trending/me/metahuman-stream想让数字人真正开口对话而不是只会播一段录好的口播视频绕不开几个硬问题口型跟语音是否同步、能不能被打断、多个人同时接入怎么办、画面怎么推出去。metahuman-streamLiveTalking开源项目就是冲着这套问题来的它是一款实时交互流式数字人引擎文本或语音驱动虚拟形象实时说话、口型同步再通过 WebRTC、RTMP 或虚拟摄像头把画面推出去。metahuman-stream 能帮你做什么抛开实现细节这个项目给你的价值大致是三件事多套数字人模型可选内置 wav2lip、musetalk、ultralight 等模型从轻量到高质量各有取舍按你的显卡和场景挑核心代码分别在avatars/wav2lip/、avatars/musetalk/、avatars/ultralight/目录下模块化封装换模型只改一个启动参数。全链路 AI 能力开箱即用语音识别基于 Whisper见avatars/musetalk/whisper/、LLM 对话llm.py、多引擎 TTStts/下支持 EdgeTTS、GPT-SoVITS、腾讯云等串成一条流水线你不用自己拼装 ASR→LLM→TTS→口型推理。输出与并发是生产级的WebRTC / RTMP / 虚拟摄像头三种推流方式支持说话被打断、多会话并发config.yaml里max_session控制前端还有现成的 Web 控制台和 HTTP API。系统内部的数据流向如下图所示文本/音频请求进来经过 LLM、TTS、音频特征提取、数字人模型渲染最终从选定的推流通道出去把环境备好系统要求与一键安装先说环境底线装不上多半卡在这几项上Ubuntu 22.04官方已验证Python 3.12建议 3.10PyTorch 2.9.1 CUDA 12.8用nvidia-smi确认自己的 CUDA 版本按 PyTorch 官网装对应版本装依赖只需两步先克隆仓库再装包git clone https://gitcode.com/GitHub_Trending/me/metahuman-stream cd metahuman-stream pip install -r requirements.txt如果 pip 装 torch 版本不对参考assets/faq.md里的常见问题比如 protobuf 版本冲突、pytorch3d 编译失败都有现成解法。装完依赖还差一块模型权重。把wav2lip256.pth拷贝到项目的models/目录并重命名为wav2lip.pth再解压wav2lip256_avatar1.tar.gz到data/avatars/目录作为你的第一个数字人形象仓库models/目录里留了put models here.txt提示文件。让数字人真正跑起来从启动到第一路流场景一浏览器实时对话一条命令启动服务python app.py --transport webrtc --model wav2lip --avatar_id wav2lip256_avatar1注意服务端要开放 TCP 8010 和 UDP 1–65536 端口WebRTC 需要。启动后浏览器打开http://服务器IP:8010/index.html页面上点开始连接数字人视频立刻出现在右侧文本框输入一句话提交数字人马上用 TTS 合成的声音开口回应点打断还能让它闭嘴——这就是实时交互的完整体验不想用页面也可以用 APIPOST /human发文本驱动说话POST /humanaudio直接播音频文件接口细节看 docs/api.md。场景二虚拟摄像头接入线上会议换个启动参数数字人就能进腾讯会议、Zoom、钉钉python app.py --transport virtualcam --model wav2lip --avatar_id wav2lip256_avatar1然后在会议软件的摄像头列表里选OBS Virtual Camera需先装并启动 OBS浏览器打开http://localhost:8010/virtualcam.html输入文本数字人就对着镜头说话CtrlEnter发送、Escape打断。完整步骤含 OBS 配置见 docs/virtualcam_guide.md快速自检清单日志里inferfps和finalfps都 ≥25 才算真正实时达不到先降分辨率或换更轻的模型不说话时并发吃 CPU说话时并发吃 GPUwav2lip 推荐 RTX 3060 及以上musetalk 推荐 RTX 3080Ti 及以上每路视频压缩走 CPU分辨率越高越吃 CPU别一上来就拉满想玩得更深换声音、换大脑、插自己的插件换 TTS 和 LLM全部配置集中在 config.yaml命令行参数可以覆盖它。换音色改tts字段edgetts/gpt-sovits/tencent/doubao等配合REF_FILEREF_TEXT做声音克隆换对话大脑改llm_provider和llm_model默认走 dashscope 的 Qwen 系列也兼容 OpenAI 风格网关。自定义数字人与插件扩展上传一段人物视频就能在线生成新的数字人形象页面入口/avatar.html接口见 docs/avatar_api.md监控会话、改全局配置走/admin.html和 docs/admin_api.md。想加自己的 TTS 或推流模块仓库用的是装饰器注册机制registry.py实现一个基类再register(tts, 你的名字)即可被调度tts/、streamout/目录下的现有模块都是现成范例。不说话时播放自定义视频动作编排、全身视频拼接、录音/record等能力也都有对应 API动手前翻一遍 docs/api.md 能省不少事。装环境、放权重、起服务、开页面——四步走完一个能听、能答、能被随时打断的实时交互数字人就在线了。剩下的调优空间都在配置和插件层里。【免费下载链接】metahuman-streamReal time interactive streaming digital human项目地址: https://gitcode.com/GitHub_Trending/me/metahuman-stream创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价