恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
【SenseNova U1.5 Lite实战】8GB显卡上的 ComfyUI 部署与 ConvRot 加速实践(含一键部署包)
首页
资讯中心
/
【SenseNova U1.5 Lite实战】8GB显卡上的 ComfyUI 部署与 ConvRot 加速实践(含一键部署包)
【SenseNova U1.5 Lite实战】8GB显卡上的 ComfyUI 部署与 ConvRot 加速实践(含一键部署包)
发布时间:2026/8/30 15:56:51
本文记录 SenseNova U1.5 Lite 在 Windows 和 8GB NVIDIA 显卡上的 ComfyUI 部署、工作流整理与底层加速实践。前一版主要解决了 Q8 GGUF 在本地运行的问题。这次继续向下做了一层把生成分支接入 ConvRot W8A8、硬件 fused dequant INT8 GEMM、合并 QKV/gate-up 和 cuDNN GQA并保留 TeaCache 作为可选项。重点不是换一个启动参数而是减少量化、反量化和权重搬运过程中的重复开销。在同一台 RTX 4070 Laptop 8GB 上2048×2048、8 步、low pageable 配置的已有记录如下Q8 GGUF 基线117.03 秒ConvRot W8A8 cu130 fused dequant INT8 GEMM 合并投影 cuDNN GQA41.82 秒约 2.80 倍加速在上面的组合上开启 TeaCache36.85 秒约 3.18 倍加速时间均为模型加载完成后的生图阶段。本文同时说明如何直接使用一键安装包以及这套优化在实际工作流中解决了什么问题。一、项目内容项目由两部分组成ComfyUI-SenseNova-U1.5-Lite-Q8Q8 GGUF、本地 ComfyUI 节点、工作流和 Windows 便携部署。ComfyUI-SenseNova-U1.5-Lite-Acceleration面向生成分支的 ConvRot W8A8 和硬件 kernel 加速层。两部分可以单独使用。只想先体验模型可以使用 Preview 或 Lite 一键包希望测试底层加速再使用U1.5lite int8加速目录中的版本。图 1 项目结构模型、ComfyUI、工作流和加速层分开管理二、实机环境本次记录使用的机器和软件版本如下GPU NVIDIA GeForce RTX 4070 Laptop GPU 显存 8 GiB约 8188 MiB 计算能力 SM89 CPU Intel Core i7-14650HX16 核 24 线程 内存 31.8 GiB 系统 Windows 11 Python 3.12.x PyTorch 2.9.1cu130 CUDA 13.0 comfy-kitchen 0.2.27 显存模式 low 主机内存 pageable Attention cuDNN GQAQ8 主模型文件为SenseNova-U1.5-8B-MoT-Q8_0.gguf文生图工作流使用官方 8-step LoRA。局部编辑、SAM 选区、图文交错和整图重绘使用正式基础模型。这样分开配置文生图适合快速试图编辑流程则保留更多输入图像信息。三、三个一键包怎么用同一个百度网盘地址下现在有三个目录U1.5 previewU1.5 liteU1.5lite int8加速三个目录都是一键安装和一键启动版本压缩包密码统一为123网盘提取码为yuwn。1. 下载和解压下载后选择需要的目录解压到非系统盘。建议放在E:\SenseNova或其他空间充足的目录不要放在带有同步软件的临时目录中。百度网盘下载https://pan.baidu.com/s/14IDSNH2aBfqOcfGqq-D4gA?pwdyuwn解压密码123网盘提取码yuwn2. 安装运行环境进入所选目录后第一次使用双击对应的安装脚本U1.5 preview 安装_SenseNova_便携版.bat U1.5 lite 安装_SenseNova_便携版.bat U1.5lite int8加速 install_int8.bat安装包已经包含便携 Python、PyTorch、ComfyUI、自定义节点、工作流和运行依赖。安装脚本主要负责检查路径、目录和依赖不需要用户重新搭建 Python 环境。3. 启动 ComfyUI安装完成后根据需要双击工作流入口01_文生图.bat 02_局部替换.bat 03_SAM自动选区替换.bat 04_图文交错生成.bat 05_图片文字整图重绘.bat浏览器打开http://127.0.0.1:8188启动脚本会检查端口、模型和工作流路径。首次加载模型需要等待之后可以在 ComfyUI 中直接打开已经接好的 JSON 工作流。4. 停止服务使用完毕后双击U1.5 preview / U1.5 lite 停止_SenseNova.bat U1.5lite int8加速 stop_int8.bat脚本只清理本目录启动的 ComfyUI 和 Python 进程不影响其他程序。四、工作流入口当前包内已经准备好几类常用流程用户不需要从空白画布开始接线。1. 8 步 LoRA 文生图适合快速测试提示词、生成参考图和批量预览。本文的房间金属球参考图就是通过这条流程生成的。2. 提示词 图像编辑把已有图片和一段自然语言一起送入编辑节点适合替换物体、改变材质、调整颜色和修改局部内容。3. 手工蒙版局部编辑先在 ComfyUI 中载入蒙版再进入局部编辑。适合明确知道修改区域的情况padding、feather和edge cleanup可以按目标边界调整。4. SAM 3.1 自动选区用目标描述得到选区再交给局部编辑节点完成替换减少手工涂蒙版的步骤。5. 图文交错和整图重绘用于更复杂的文字和图像输入。对应工作流已经保留用户可以按自己的素材继续测试。图 2 从参考图、选区到替换结果的连续工作流记录五、实际案例把金属球替换成篮球1. 生成参考图先用 8 步 LoRA 生成一个自然采光的房间桌面放置一个抛光金属球。实验记录为 2048×2048约 92.13 秒。图 3 文生图得到的房间与金属球参考图2. 使用提示词 图像完成替换将参考图作为输入再使用下面的提示词Replace the single polished metal sphere on the table with one regulation orange leather basketball with black channels. Keep the same room, table, camera angle, perspective, lighting, shadows, cup, book and background. Photorealistic, no extra objects, no text, no watermark.这段提示词分为三部分先说明动作是Replace再指定篮球的材质和外观最后列出需要保留的房间、桌面、相机角度、光照和背景元素。提示词图像编辑这次记录约 142.62 秒。图 4 提示词 图像编辑后的篮球结果3. 使用蒙版进行局部编辑同一张参考图也可以进入蒙版流程。先确认蒙版选区和 alpha 方向再设置 padding、羽化和边缘清理参数。修正后的记录中金属球已经被篮球完整替换背景和桌面保持在原有位置。图 5 局部编辑前的蒙版和节点配置记录蒙版流程适合需要明确控制修改区域的场景提示词图像流程则更适合快速试效果。两条路径都保留在工作流包中可以根据素材选择。六、底层加速做了什么这次加速主要处理生成分支中的矩阵计算、量化和权重搬运。1. 硬件 fused dequant INT8 GEMM传统路径可能先将 INT8 权重恢复成浮点再进行矩阵乘。这样会产生额外的中间张量和显存读写。本项目使用 comfy-kitchen 提供的 CUDA kernel把反量化和 GEMM 尽量合并到同一条硬件路径中直接利用 Tensor Core 计算能力。2. ConvRot W8A8权重按输出通道做 INT8 重排和缩放激活在运行时按行量化。转换结果保存为独立分片和 manifest不修改原始 GGUF。当前覆盖 42 层、294 个生成分支投影模块。3. 合并 QKV 和 gate/upQ、K、V 使用同一组输入MLP 的 gate 和 up 也使用同一组输入。合并处理可以减少重复量化和重复搬运尤其适合显存只有 8GB 的场景。4. cuDNN GQA注意力路径使用 cuDNN GQA并在实验日志中记录实际 backend、调用次数和 token 数量便于确认运行时确实走到目标路径。5. TeaCacheTeaCache 保持为可选项。当前 8 步实验中阈值为0.35最少计算 2 步最多跳过 1 步实际跳过了一次完整的 42 层 decoder pass。它让记录从 41.82 秒降到 36.85 秒但主要收益仍来自 fused kernel 和 ConvRot W8A8。图 6 Q8 基线、ConvRot W8A8 与 TeaCache 的同配置对照七、实验记录本次对照使用相同的提示词、seed、分辨率和 8 步设置比较模型加载后的生图阶段分辨率 2048×2048 采样步数 8 显存模式 low 主机内存 pageable Attention cuDNN GQA Q8 GGUF 基线 117.03 s ConvRot W8A8 41.82 s 加 TeaCache 36.85 s另有一组 1 步短测Q8 GGUF 基线 58.52 s ConvRot W8A8 17.79 s1 步短测用于确认 kernel 路径正式展示以 8 步对照为主。实验日志、图片哈希、manifest 和运行报告都保存在项目的experiments目录中。图 7 多工作流运行记录和时间对照八、源码、权重和一键包源码仓库Q8 工作流与节点https://github.com/superalp1985/ComfyUI-SenseNova-U1.5-Lite-Q8加速层https://github.com/superalp1985/ComfyUI-SenseNova-U1.5-Lite-Acceleration百度网盘一键包https://pan.baidu.com/s/14IDSNH2aBfqOcfGqq-D4gA?pwdyuwn网盘目录中包含U1.5 previewPreview 便携运行环境和工作流。U1.5 liteLite 便携运行环境和工作流。U1.5lite int8加速加入 ConvRot W8A8 和硬件 fused dequant INT8 GEMM 的加速版本。三个目录都是一键安装、一键启动压缩包密码统一为123网盘提取码为yuwn。仓库主要放代码、工作流、文档和示例图模型权重通过网盘提供避免 GitHub 仓库被大文件占满。九、适合的使用场景产品和广告草图先生成场景再替换产品、材质或颜色。游戏美术预研快速测试道具、环境和风格变化。室内与展陈方案保持机位和空间结构替换家具与摆件。活动内容制作在本地完成图片初稿减少素材来回上传。ComfyUI 教学与二次开发直接打开工作流查看节点、参数和输出。这套方案的重点是把模型能力落到普通设备上下载后解压运行安装脚本双击工作流入口即可开始使用需要进一步研究时再从源码仓库和实验记录入手。十、总结这次工作在原有 Q8 本地部署基础上补上了生成分支的底层加速路径。通过 cu130、comfy-kitchen、硬件 fused dequant INT8 GEMM、ConvRot W8A8、合并投影和 cuDNN GQA2048×2048、8 步生图的已有记录从 117.03 秒降到 41.82 秒开启 TeaCache 后为 36.85 秒。同时Preview、Lite 和 Lite INT8 加速三个一键包已经按目录整理运行环境、依赖、ComfyUI、节点和工作流一并提供。用户可以直接下载体验也可以从 GitHub 代码和实验记录继续改造。官方项目https://github.com/OpenSenseNova/SenseNova-U1需要提前说清楚的边界第一本文的时间是单机实验记录不是跨硬件、跨驱动的正式 benchmark。温度、后台负载、缓存状态、输入分辨率和模型驻留方式都会改变实际耗时。第二提示词图像编辑表现较好说明这条路径在本次案例中是可用的但不等于所有图片都能得到相同结果。提示词最好把动作、目标、位置关系和保留项写清楚。第三蒙版替换必须承认调参局限。选区偏移、alpha 方向、羽化、padding、腐蚀/膨胀和边缘清理都会影响最终结果同一个参数不可能适合所有主体。文章展示的是一组修正后的实验结果不是对所有素材的普遍承诺。第四当前加速层是 Q8 GGUF 之上的生成分支 overlay不是完整纯 INT8 权重。理解分支和其他未覆盖部分仍由 GGUF 提供这样做是为了在收益、质量和工程可回滚性之间取得平衡。第五fast 显存模式在当前 8GB 硬件上仍需谨慎稳定推荐是 low pageable。别为了让启动日志看起来更激进就把系统内存和显存一起逼到墙角。SenseNova U1.5 Lite 这次实践最有价值的地方不是把 8GB 显卡包装成了 80GB也不是宣布所有工作流从此都能秒出。它做的是一件更踏实的事把模型、节点、工作流、显存策略、硬件 kernel 和分发方式串成一条可以走通的路。在这条路上2048×2048 文生图约 92.13 秒提示词图像篮球替换约 142.62 秒加速实验中Q8 基线约 117.03 秒ConvRot W8A8 约 41.82 秒叠加 TeaCache 后约 36.85 秒。它们都不是实验室里脱离现实的数字而是这台 8GB 移动显卡在具体配置下留下的脚印。所以我的判断很简单8GB 显卡当然不是什么奢侈配置但也没有必要因为它不奢侈就放弃本地创作。只要工作流设计得当、参数边界写清楚、实验记录不藏着掖着本地模型一样可以完成一些实际工作。至于要不要把它再推向更快、更省显存、更大分辨率那就是下一轮实验的事情了。