恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

第033章:ComfyUI视频制作LTX-2.3模型(图像音频转视频)

  • 首页
  • 资讯中心
  • /
  • 第033章:ComfyUI视频制作LTX-2.3模型(图像音频转视频)

相关资讯

基于YOLOv10的虾病害检测系统开发与实践 2026/8/2 18:44:34
Java AI 微服务冷启动优化:GraalVM 原生镜像让我的 Spring Boot 3 应用快了 50 倍 2026/8/2 18:44:35
电商返利平台结算对账系统的设计:日清分账与异步消息队列应用 2026/8/2 18:44:35

最新资讯

基于多智能体与结构化检索的自动化文献综述系统设计与实现
Java面试核心:JVM、并发与分布式系统实战解析
STM32 IIC实战:从硬件配置到软件模拟的避坑指南
Python招聘数据可视化平台开发实战
看到调仓提醒先核对什么:版本、时间、持仓和退出原因
2026 多模态:AI 长出眼睛和耳朵,MonkeyCode 免费把玩

今日推荐

OpenModScan:免费跨平台 Modbus 主站调试工具,让现场通讯验证一键搞定
WechatHook 终极指南:5大核心能力详解,3分钟看懂微信自动化
如何在ThinkPad X390上安装macOS:OpenCore EFI完整指南

本周热门

Nextcloud 桌面客户端:把同步交给它,你只管改文件
如何将 HTML 转成 Word 文档且格式不丢失?html-to-docx 使用教程
Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

第033章:ComfyUI视频制作LTX-2.3模型(图像音频转视频)

发布时间:2026/8/24 19:07:09
第033章:ComfyUI视频制作LTX-2.3模型(图像音频转视频) 特别说明本篇文章是建立在前期文章的基础上的有些前期文章已经讲过的细节问题本章内容可能不会重复若有看不懂的地方请先看前期文章。上一章我们实现了LTX-2.3模型首尾帧视频工作流的搭建。这一章我们将去实现LTX-2.3模型图像音频转视频工作流的搭建。图像音频转视频就是给一个人物的照片再给一段录音让图片中的人物把这段录音说出来。有的同学可能会说了LTX不是本身就能生成音频吗为啥还要单独去弄个录音因为如果我们要创建一个数字人模特除了外形好看他的声音也得有自己的特色就像我们人一样每个人都有自己的音色那么我们的数字人也是需要自己固定的音色的。你不能今天说话是这个声音明天又变成了另外一个声音。和前面一样我们先去看官方的图像音频转视频工作流是怎么搭建的。一、官方高度集成版工作流第一步进入模板第二步搜索“LTX-2.3”,选择“图像音频转视频”工作流先看看他所用到的模型这些模型文件我们前面已经下载好了这里重新选择一下改成自己的路径就ok了我们先用这个工作流试试效果这里有个小技巧大家看下图我给的这个音频是7s的时长我给的视频长度要求是8s。因为如果视频也要求7s的时长的话那么视频最后的一个字一般都不完整。二、图像音频转视频工作流详解这个工作流是做数字人很实用的工作流我们就参考官方工作流来一步一步的来自己搭建一个属于自己的工作流。1加载模型文件这里面用到的文件我们前面都已经下载过了直接用就行。lora是ltx官方替工的一个加速lora。2加载两个clip文版框用来输入提示词。3添加视频分辨率高、宽、帧率、时长这里需要注意LTX2.3要求视频分辨率的高、宽必须能比32整除因此其720P视频的分辨率为 横板1280 × 704 竖版704 × 1280、1080P视频的分辨率为横板1920 × 1056 竖版896 × 1536。4加载图片并对图像进行处理详细介绍请看前期文章5构建生成尺寸二分之一的图像潜空间缩小采样提升速度详细介绍请看前期文章6音频材料加载7音频裁剪由于有时候音频时长会比较长比如1分钟我们没法一次性生成一个1分钟的视频需要分段去生成因此需要对音频进行裁剪。设置一个起始时间裁剪一段和视频时长相同的音频。8构建音频的潜空间这里面我们需要主义的是这个“纯快遮罩”他的作用是生成一张纯色、无渐变、矩形整体遮罩图。明度 0.0全黑遮罩采样器看到这个 mask音频 latent 整片区域禁止添加噪声这样音频编码出来的特征全程被保护采样过程不会破坏音频信息保障音画联动、口型稳定不会出现音频条件失效。明度 1.0全白遮罩采样器允许对 audio_latent 正常加噪声。这样模型会改动音频潜空间容易破坏原始音频特征大概率导致音画脱节、口型乱掉。9汇总提示词条件和帧率10将视频和音频汇总到一个潜空间11实现初次采样详细介绍请看前期文章12对初次采样的结果进行二次放大因为我们在初次采样时是在原本设置的分辨率上缩小1/2进行采样的所以需要加一个二次放大再使图像恢复到原本的分辨率。我的电脑配置如果不加二次放大直接一次采样出结果720P的视频会比先一次缩小采样 加 二次放大采样多出来近1倍的时间。13对放大后的图像进行二次采样 并 输出视频。---------结束线---------到这里我们图像音频转视频的工作流就全部搭建好了。本篇文章发布后我会在我们的交流群把今天我们搭建好的工作流文件分享到群共享文件。有兴趣的朋友可以加一下交流群平时学习中有什么困惑也可以和群里的朋友们互相交流。如果大家在阅读文章的时候有什么困惑可以在文章的底部留言我看到的第一时间就会进行回复。再一个也可以在赞赏文章后针对所赞赏文章的内容有不明白的地方可以和我约个时间进行一对一的实时交流赞赏金额不限制多少都可以

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号