恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
metahuman-stream实时数字人推流引擎全解析:文本和语音驱动数字人在浏览器开口
首页
资讯中心
/
metahuman-stream实时数字人推流引擎全解析:文本和语音驱动数字人在浏览器开口
metahuman-stream实时数字人推流引擎全解析:文本和语音驱动数字人在浏览器开口
发布时间:2026/9/18 10:56:36
metahuman-stream实时数字人推流引擎全解析文本和语音驱动数字人在浏览器开口【免费下载链接】metahuman-streamReal time interactive streaming digital human项目地址: https://gitcode.com/GitHub_Trending/me/metahuman-streammetahuman-stream即 LiveTalking是一款开源的实时交互流式数字人引擎。输入一句文本或一段语音数字人立刻带着同步的口型和声音回应画面直接在浏览器里播放也可以推流到直播平台或输出一台虚拟摄像头。本文讲清楚它能做什么、一句话变成视频要经过哪几步、显卡需要多强以及三步把服务跑起来。一句话文本能做什么核心能力速览拉起来一个服务能拿到的东西比想象中多实时口型文字或语音驱动数字人以 25fps 逐帧说话口型与音频同步。支持打断数字人说话期间有新输入可以立刻打断切换话题对话感的关键就在这里。声音克隆给一段参考音频和对应文本数字人换用这个音色说话。三款形象模型wav2lip、musetalk、ultralight按画质需求和显卡档次选。四种输出WebRTC 浏览器低延迟、RTMP 直播平台、RTCPush 推流、虚拟摄像头。动作编排不说话的空档播放自定义视频数字人不会一直木讷地站着。多会话并发每个连接分配独立 sessionid并发数可在配置里设置。代码组织上TTS、数字人模型、输出方式全部走插件注册机制统一挂在 registry.py 里。想换语音合成方案或输出通道改一个启动参数即可不必动主流程。一句话如何变成视频四级流水线 服务端收到一次请求后实际走四步理解文本发给/human接口。chat 模式下先经过 LLM 生成回复且是流式输出、按句子切分逐句送入下一级数字人逐句开口不用等整段回复。合成tts/ 下的 TTS 引擎把文本转成 16kHz 音频同时提取声学特征供口型推理用。内置 edgetts、GPT-SoVITS、Azure、腾讯、豆包、Qwen 等多种方案。渲染avatars/ 下的形象模型只对嘴部区域做深度学习推理再把结果平滑贴回原始高清视频头部、身体、背景都保留原视频画质。推流streamout 模块按--transport参数打包音视频帧。webrtc 走浏览器rtmp 推直播平台virtualcam 输出为系统摄像头设备。除文本入口外还有/humanaudio音频入口直接提交音频文件播放跳过文本和 LLM 两个环节。三步让数字人开口说话 第 1 步代码与依赖。PyTorch 需按本机 CUDA 版本单独安装官方测试环境为 Python 3.12 PyTorch 2.9.1 CUDA 12.8git clone https://gitcode.com/GitHub_Trending/me/metahuman-stream cd metahuman-stream pip install -r requirements.txt第 2 步模型文件。下载wav2lip256.pth重命名为wav2lip.pth放入models/目录形象包如wav2lip256_avatar1解压后整个文件夹放进data/avatars/。第 3 步启动并打开页面python app.py --transport webrtc --model wav2lip --avatar_id wav2lip256_avatar1浏览器访问http://serverip:8010/index.html点击开始连接播放数字人在文本框输入内容提交数字人就开始说话。注意服务端要放行 TCP:8010 和 UDP 端口段否则 WebRTC 握手不通。启动后怎么操作三个页面加一套接口服务端自带现成页面不用先写前端/index.html主页文本或语音驱动数字人支持录制它的讲话/avatar.html上传一段视频生成新的数字人形象/admin.html管理后台监控各会话状态和全局配置。要集成进自己的产品看 docs/api.md/offer与/whep建立 WebRTC 连接/human驱动文本对话/humanaudio播放音频/record/{sessionid}下载该会话的录屏。语音输入方向也有现成方案web/asr/里的页面负责在浏览器端录音并流式上传 PCMserver/asr_server.py用本地 SenseVoice 模型做识别转写结果直接驱动数字人整条链路不出内网。硬件要求哪块显卡能跑出实时瓶颈在两处每路视频的压缩消耗 CPU每路的口型推理消耗 GPU。数字人不说话时并发上限看 CPU说话时看 GPU。官方实测参考模型显卡帧率wav2lip256RTX 306060 fpswav2lip256RTX 3080Ti120 fpsmusetalkRTX 3080Ti42 fpsmusetalkRTX 409072 fps日志里的inferfpsGPU 推理帧率和finalfps最终推流帧率都稳在 25 以上才算实时。虚拟摄像头模式下用--transport virtualcam启动数字人画面直接成为一台系统摄像头会议软件和直播推流软件里能直接选到它这个项目适合谁想做 24 小时虚拟主播、数字人客服、大屏讲解或批量产出数字人出镜短视频的可以直接拿它当现成引擎。新手建议从 wav2lip edgetts WebRTC 组合起步硬件门槛最低对画质要求高再换 musetalk显卡准备 3080Ti 起步。【免费下载链接】metahuman-streamReal time interactive streaming digital human项目地址: https://gitcode.com/GitHub_Trending/me/metahuman-stream创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考