恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Duix.Avatar 开源AI数字人本地部署:克隆形象与声音,生成口播视频
首页
资讯中心
/
Duix.Avatar 开源AI数字人本地部署:克隆形象与声音,生成口播视频
Duix.Avatar 开源AI数字人本地部署:克隆形象与声音,生成口播视频
发布时间:2026/9/11 10:32:46
Duix.Avatar 开源AI数字人本地部署克隆形象与声音生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个开源的 AI 数字人视频生成项目全程在本地离线运行。提交一段 10 秒左右的真人视频即可克隆出该人物的面部形象与声音之后输入文案或上传音频就能自动生成口型匹配的播报视频。本文覆盖硬件前提、Docker 部署验证、首个数字人模型的创建流程以及生成失败时的排查入口适合需要本地化口播视频、或想通过接口集成数字人能力的用户。先看是否适合你的场景适合批量制作口播视频的内容创作者、需要标准化培训/宣导视频的团队以及希望直接调用形象克隆与视频合成接口的开发者。硬性前提一台装有 NVIDIA 显卡驱动正常且内存不小于 32GB 的机器系统为 Windows 1019042.1526 及以上或 Ubuntu 22.04。不适合没有 NVIDIA 独立显卡或内存不足 32GB 的电脑。本项目所有算力都在本地完成缺 GPU 时服务端容器无法启动软件配置无法弥补。部署前需要准备什么项目要求操作系统Windows 1019042.1526 及以上或 Ubuntu 22.04 Desktop显卡NVIDIA 显卡并装好驱动nvidia-smi能正常输出信息官方推荐 RTX 4070 级别内存32GB 及以上16GB 有启动失败风险磁盘WindowsC 盘预留 100G 存镜像、D 盘预留 30G 存数据Ubuntu空闲 100G 以上网络首次拉取镜像约 70G 流量建议带宽较好的环境依赖DockerWindows 需先安装并更新 WSLWindows 上如果 C 盘空间不足 100G可以在 Docker Desktop 的 Resources 设置中把镜像存储路径改到空闲空间更大的磁盘。从安装到验证服务拉取项目代码。仓库中的deploy/目录存放启动服务所需的编排文件。git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar安装 Docker。Windows 依次执行wsl --install、wsl --update再安装 Docker DesktopUbuntu 用包管理器安装sudo apt update sudo apt install docker.io sudo apt install docker-composeUbuntu 还需安装 NVIDIA 显卡驱动和 NVIDIA Container Toolkit否则 Docker 无法调用 GPU。启动服务端。在项目deploy/目录下执行首次拉取约需半小时# Windows cd deploy docker-compose up -d# Ubuntu cd deploy docker-compose -f docker-compose-linux.yml up -d使用 50 系列显卡时改用docker-compose -f docker-compose-5090.yml up -d资源紧张时可用 lite 版只启动视频生成服务docker-compose -f docker-compose-lite.yml up -d。验证状态。打开 Docker 容器列表确认duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video三个容器均为 Runninglite 版只有duix-avatar-gen-video一个。对应对外端口为 18180语音合成、10095语音识别、8383视频合成。首次创建数字人并生成视频安装客户端。从项目官方 Release 页面下载对应系统的安装包Windows 双击 exe 安装Ubuntu 直接运行 AppImageroot 用户下需在终端追加--no-sandbox参数启动。上传素材。在主界面点击 Create Avatar上传一段 10 秒左右的视频人物需清晰可见且视频中必须有人在说话——这段声音会被用作声音克隆的样本。等待训练完成模型出现在 My Avatars 列表中。首次创建若报 Connection refused通常是识别服务尚未就绪等几分钟再试。输入内容生成。为数字人输入要说的文案或直接上传音频文件发起生成。检查产出。在 My Works 中回放成片重点确认口型与语音是否同步、音色是否接近原视频素材。一条素材是如何变成视频的素材分离上传的视频被拆分为静音视频轨和音频轨。声音克隆识别服务fun-asr转写语音内容合成服务fish-speech以该样本训练专属音色模型。文本转语音输入的文案按克隆出的音色转为数字人语音。视频合成视频服务8383 端口将语音与面部画面结合输出最终口型同步的视频。中间产物与成片统一保存在本机的duix_avatar_data目录Windows 位于 D 盘Linux 位于用户主目录。生成失败时的排查路径症状可能原因检查动作docker-compose up -d拉镜像连接失败Docker Hub 网络不稳定在 Docker 配置中添加registry-mirrors换用国内镜像步骤见 常见问题文档创建模特报 Connection refused识别服务启动慢或内存不足确认内存 ≥32GB服务刚启动时等几分钟再操作创建模特失败素材无声或无人说话重新录制保证清晰人声三个服务起不来缺 NVIDIA 显卡或驱动执行nvidia-smi验证安装或升级驱动不确定错误发生在哪端客户端与服务端日志分开客户端在右上角设置菜单选 Open Log服务端查看对应容器的 Logs进阶绕过客户端直接调用接口服务端启动后会在本机暴露 HTTP 接口可跳过图形界面直接接入自己的流水线声音训练http://127.0.0.1:18180/v1/preprocess_and_tran音频合成http://127.0.0.1:18180/v1/invoke视频合成与进度查询http://127.0.0.1:8383/easy/submit、http://127.0.0.1:8383/easy/query完整请求参数可参考 model.js、video.js、voice.js。文案输入支持 8 种语言中文、英语、日语、韩语、法语、德语、阿拉伯语、西班牙语如需从源码构建客户端环境要求 Node.js 18。资源与下一步doc/常见问题.md镜像源配置、服务状态自查、日志获取方式的完整说明deploy/标准版、lite 版、Linux 版、50 系显卡版四份编排文件src/main/客户端与接口调用代码服务端地址配置见 src/main/config/config.js准备部署时先跑一遍nvidia-smi和 Docker 容器状态确认 GPU 可用、三个服务 Running 之后再进入模特创建流程能避开多数新手问题。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考