恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
MiniMax-H3-Comfy-NPU 完全入门指南:如何在昇腾 NPU 上跑通视频音频联合生成
首页
资讯中心
/
MiniMax-H3-Comfy-NPU 完全入门指南:如何在昇腾 NPU 上跑通视频音频联合生成
MiniMax-H3-Comfy-NPU 完全入门指南:如何在昇腾 NPU 上跑通视频音频联合生成
发布时间:2026/9/26 12:07:24
MiniMax-H3-Comfy-NPU 完全入门指南如何在昇腾 NPU 上跑通视频音频联合生成【免费下载链接】MiniMax-H3-Comfy-NPU项目地址: https://ai.gitcode.com/Ascend-SACT/MiniMax-H3-Comfy-NPUMiniMax-H3-Comfy-NPU 是 MiniMax-H3 模型在 ComfyUI 上的昇腾 NPU 多卡适配方案让你不用 NVIDIA GPU也能用 4 张国产 NPU 跑通视频 同步音频联合生成并且支持 8 步 Turbo 加速768P 15 秒视频仅需约 500 秒。本指南面向新手带你从零完成环境搭建到第一次生成。项目能做什么一图看懂能力边界MiniMax-H3 原生支持视频与音频联合生成本项目通过补丁让它跑在 ComfyUI 昇腾 NPU 上核心能力如下权重任务输入FL2VAT2VA0 图纯文本生成音视频FL2VAFL2VA1 图首帧或 2 图首帧尾帧生成音视频Ref2VARef2VA单图/多图、图片加音频、单视频/多视频参考生成相比原始基线8 卡 2400 秒生成 768P 15 秒视频本适配方案在效果基本相同的前提下资源减半4 卡、耗时降至约 500 秒并支持Euler 50 步、res_multistep 21 步、Turbo LoRA 4~8 步降噪INT8、pruned 格式量化权重降低显存压力1 / 2 / 4 卡灵活调度MultiNPUParallelConfig统一管理 DiT、文本编码器、视频/音频 VAE环境要求清单先核对硬件与软件版本开始前请确认你的环境与下表一致版本不匹配是最常见的失败原因组件已验证版本硬件Ascend A34 × NPU单卡 64 GB HBMPython3.12.13CANN9.0.1PyTorch / torch-npu2.10.0cpu / 2.10.0.post2comfy-kitchen / comfy-aimdo0.2.30 / 0.4.13ComfyUI frontend1.48.7 推荐直接使用已验证容器镜像quay.io/ascend/vllm-omni:v0.26.0-a3PyTorch、torch-npu、CANN 和驱动必须由它统一提供不要随意替换版本。完整说明见项目文档 README.md。一键部署步骤从克隆仓库到应用补丁第 1 步克隆适配仓库并创建 NPU 容器克隆本项目把前 4 张 NPU 卡、权重目录挂入容器git clone https://gitcode.com/Ascend-SACT/MiniMax-H3-Comfy-NPUdocker run -itd -u root \ --name comfyui-npu \ --network host --ipc host \ --device /dev/davinci0 --device /dev/davinci1 \ --device /dev/davinci2 --device /dev/davinci3 \ --device /dev/davinci_manager --device /dev/devmm_svm \ --device /dev/hisi_hdc \ -v /usr/local/dcmi:/usr/local/dcmi \ -v /usr/local/Ascend/driver:/usr/local/Ascend/driver:ro \ -v {宿主机路径}:/workspace \ -v {宿主机权重路径}:/weight \ quay.io/ascend/vllm-omni:v0.26.0-a3 /bin/bash第 2 步拉取 ComfyUI 并安装依赖进入容器后拉取 ComfyUI 并固定到已验证的 commit安装公共依赖export COMFY_HOME/workspace/ComfyUI export PATCH_SOURCE/workspace/patch git clone https://github.com/Comfy-Org/ComfyUI.git ${COMFY_HOME} # 按 README 指引获取固定版本源码 git -C ${COMFY_HOME} checkout --detach bd34f338ac505ea79e43968753968a464060e609 python3 -m pip install -r ${COMFY_HOME}/requirements.txt第 3 步执行 MiniMax-H3 安装脚本 应用 NPU 补丁一条命令完成自定义节点与工作流导入脚本会自动校验 torch/torch-npu/comfy-kitchen 版本COMFY_HOME${COMFY_HOME} bash ${PATCH_SOURCE}/install_deps_minimax_h3.shinstall_deps_minimax_h3.sh 会把 Turbo 节点 ComfyUI-MiniMax-H3-Turbo 复制到custom_nodes/6 个官方工作流复制到user/default/workflows/minimax-h3/并安装启停脚本 additional_files/runtime/。最后应用昇腾多卡补丁cd ${COMFY_HOME} git apply --check ${PATCH_SOURCE}/comfy-ui-changes.patch git apply ${PATCH_SOURCE}/comfy-ui-changes.patch⚠️--check必须通过不要忽略.rej文件强行跳过。补丁内容见 comfy-ui-changes.patch。权重下载清单与目录放置方法分类BF16 / 4 卡INT8 / 低卡FL2VA DiTminimax_h3_fl2va_bf16.safetensorsminimax_h3_fl2va_int8_convrot.safetensorsRef2VA DiTminimax_h3_ref2va_bf16.safetensorsminimax_h3_ref2va_pruned_int8_convrot.safetensorsText Encoderqwen3vl_32b_minimax_h3_bf16.safetensorsqwen3vl_32b_minimax_h3_int8_convrot.safetensorsVideo VAEminimax_h3_video_vae_fp16.safetensors-Audio VAEminimax_h3_audio_vae_fp32.safetensors-Turbo LoRAminimax_h3_turbo_v4_step600_ema.safetensors推荐-放置方式二选一默认路径放到${COMFY_HOME}/models/下的diffusion_models/、text_encoders/、vae/、loras/对应目录外部共享存储合并参考配置 additional_files/extra_model_paths.yaml 到${COMFY_HOME}/extra_model_paths.yaml修改后重启服务从启动日志确认Adding extra search path。服务启动4 卡 ComfyUI 一条命令拉起推荐配置 4 卡。设置环境变量后执行重启脚本会自动停旧服务、等端口释放、等健康检查通过export COMFY_HOME/workspace/ComfyUI export COMFYUI_RUNTIME_ROOT/workspace/runtime export PYTHON_BIN/usr/local/python3.12.13/bin/python3.12 export NPU_DEVICES0,1,2,3 export COMFYUI_PORT8189 bash ${COMFYUI_RUNTIME_ROOT}/restart-v1.sh浏览器访问http://服务器IP:8189/即可。核心脚本逻辑启动脚本 additional_files/runtime/start_comfyui-4npu.sh配置 HCCL 通信后端、指定可见 NPU、记录 PID 与日志停止脚本 additional_files/runtime/stop_comfyui-4npu.sh 与重启脚本 additional_files/runtime/restart-v1.sh 配合使用 如果只暴露 1 或 2 张卡打开工作流后必须把Multi-NPU Parallel Config节点的npu_count改为相同数量可用值仅1、2、4否则运行前校验会失败。第一次生成8 步 Turbo 工作流操作顺序项目自带 6 个现成工作流位于 additional_files/workflows/minimax-h3/模型场景推荐工作流权重MiniMax-H3FL2VAfl2va_8steps_loraBF16 FL2VA BF16 TE EMA LoRAMiniMax-H3Ref2VA 4 卡ref2va_8steps_loraBF16 场景BF16 Ref2VA BF16 TE EMA LoRAMiniMax-H3Ref2VA 低显存ref2va_8steps_lorapruned INT8 Ref2VA INT8 TE EMA LoRAMiniMax-H3质量对照ref2va_21steps/ref2va_50stepsBF16 全精度Turbo 工作流内置了 ComfyUI-MiniMax-H3-Turbo 提供的两个节点MiniMax-H3 Turbo LoRA挂接 LoRA把采样步数从约 20 步降到 4~8 步MiniMax-H3 Turbo Sampler自动适配新旧 ComfyUI保证音频流在不同调度下都不失真页面操作 5 步走从Workflows菜单打开对应 JSON如 fl2va_8steps_lora.json在模型加载节点确认下拉权重名称与下载清单一致4 卡服务保持Multi-NPU Parallel Config默认4在LoadImage节点上传图片工作流不打包输入图需重选素材填写 prompt、时长和分辨率点击Queue产物在 Queue/History 页面查看重启后记录仍保留 参数提示宽高为 32 的倍数短边通常 768帧数按 24 fps 对齐 17·k5 网格124 帧 ≈ 5 秒LoRA 步数保持4~8 步、strength 1.0、调度器 simple超过 8 步不再提升质量。性能数据与常见问题速查4 NPU、768P、24 fps 固定 seed 下的端到端实测场景权重输出端到端FL2VA Turbo 8 步INT8768P / 5 秒113.51sRef2VA Turbo 8 步pruned INT8768P / 15 秒454.77sFL2VA Turbo 8 步INT8768P / 15 秒389.37sRef2VA res_multistep 21 步BF16768P / 15 秒944.96sRef2VA Euler 50 步BF16768P / 15 秒2263.03s新手最关心的 4 个问题问题解答权重加载为何慢首次任务需读取约 66.3 GB DiT 51.5 GB 文本编码器并构建各 rank 模型拓扑属正常现象4 卡显存为何仍高DiT 是序列并行而非参数分片每卡持有完整权重地址空间加速的是 token/attention 计算任务失败后怎么办先读runtime/*.log第一条异常OOM 后不要重复提交同一任务确认队列空后用restart-v1.sh清理 allocator 状态启动警告要紧吗xFormers not available、skimage缺失均为预期提示不影响 NPU 推理以MultiNPUParallelConfig与 MiniMax Turbo 是否成功导入为准 安全提示ComfyUI 默认无认证--listen 0.0.0.0仅限可信内网使用对外暴露需自行在网关层加认证与 TLS。至此你已在昇腾 NPU 上完整跑通了 MiniMax-H3 的视频音频联合生成。建议先用 5 秒 768P 的 Turbo 8 步工作流验证链路再逐步挑战 15 秒长片段追求极限质量时再换 21/50 步工作流对照。【免费下载链接】MiniMax-H3-Comfy-NPU项目地址: https://ai.gitcode.com/Ascend-SACT/MiniMax-H3-Comfy-NPU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考