恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
50秒出5秒成片:本地跑通 CogVideo 文生视频,直接拿到可播放 mp4
首页
资讯中心
/
50秒出5秒成片:本地跑通 CogVideo 文生视频,直接拿到可播放 mp4
50秒出5秒成片:本地跑通 CogVideo 文生视频,直接拿到可播放 mp4
发布时间:2026/9/13 11:26:48
50秒出5秒成片本地跑通 CogVideo 文生视频直接拿到可播放 mp4【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo把A girl riding a bike.敲进命令行约 50 秒后你在./output.mp4拿到一段 5 秒、可直接播放的 mp4单张 4090 就能跑。CogVideo 仓库内置了 CogVideoX-2B/5B 与 CogVideoX1.5 系列的完整推理与微调代码文生视频t2v、图生视频i2v、视频续写v2v三种任务各有一条现成链路装好依赖一条命令即可出片。先看效果官方 Web 演示页面的输出画面提示词A little girl is riding a bicycle at high speed去噪、解码完成后的成片对应链路最后一步输出成片。整条链路一句话一句提示词 → 文本编码器转成语义向量 → DiT扩散 Transformer在潜空间把纯噪声迭代成视频压缩表示 → 3D 因果 VAE 解码成帧按 16fps 写成 mp4。下面按顺序走通。跑通路径文生视频本地推理三步走拉代码装依赖。Python 版本须在 3.10–3.12 之间这是 README 的硬性要求git clone https://gitcode.com/GitHub_Trending/co/CogVideo cd CogVideo pip install -r requirements.txt选模型开跑。显卡是 4090 或 1080Ti 就从 2B 档位开始官方明确 2B 可在 GTX 1080Ti 上运行5B 需要 RTX 3060 往上python inference/cli_demo.py --prompt A girl riding a bike. --model_path THUDM/CogVideoX-2b --generate_type t2v验收。默认参数下生成 81 帧、fps默认 16打开./output.mp481 ÷ 16 ≈ 5 秒帧数÷fps 与视频实际时长对得上说明链路没断。提示词只有一句话时先用 inference/convert_demo.py提示词扩写工具扩成长提示再喂给模型画面质量会更稳。它是怎么工作的提示词过文本编码器听话程度由引导强度控制你的提示词被文本编码器转成语义向量guidance_scale分类器自由引导强度默认 6.0决定画面跟文字的贴合度。为什么强调它模型训练时用的都是长描述提示词太短、约束太弱扩散环节就会自由发挥这是画面跑偏的头号根因。潜空间扩散去噪50 步把噪声炼成视频文字向量就位后DiT 主干在潜空间视频压缩后的低维表示比直接算像素帧省一个数量级的显存里迭代num_inference_steps默认 50 步。官方推理用 DPM 调度器pipe.scheduler CogVideoXDPMScheduler.from_config( pipe.scheduler.config, timestep_spacingtrailing )这两行告诉框架去噪时间步用trailing方式排布是作者对 5B 系列的推荐配置cli_demo.py的注释里也注明2B 建议换用 DDIM 调度器。3D 因果 VAE 解码成帧按 16fps 导出最后的潜变量由 3D 因果 VAE 解码成真实视频帧再经export_to_video写成output.mp4默认 16fps81 帧正好约 5 秒。脚本默认开着enable_sequential_cpu_offload()模块逐个进出显存省显存但更慢显存足够整卡装下模型时可换成enable_model_cpu_offload()提速两种写法在 inference/cli_demo.py官方推理入口顶部注释里都有对照。参数怎么调CogVideoX 视频生成参数推荐范围参数控制什么推荐范围调大了会怎样调小了会怎样num_frames帧数即视频时长49 / 81 / 161视频更长显存占用与耗时上升视频更短出片更快num_inference_steps去噪步数30–50细节更干净单次生成更慢更快但出现噪点与抖动guidance_scale提示词贴合强度4.0–6.5内容更贴文字过高画面过饱和发挥空间变大容易跑偏fps导出播放帧率8–16同样帧数播放更短、更利索播放更长但更拖沓seed随机种子默认 42任意整数换值即出新视频固定值可复现同一条视频width/height输出分辨率t2v 自动取模型默认值2B/5B480x720超出推荐值会被强制改回默认自定义值不生效注意帧率档位配套1.0 档是 49 帧 8fps1.5 档是 81 或 161 帧 16fps改参数时按时长帧数÷fps 核算。图生视频i2v模式下宽高跟随输入图官方推荐 2B/5B 用 480x720、1.5-5B 用 768x1360SAT 版本则单独用 sat/configs/inference.yamlSAT 推理配置管理帧数与 fps。官方图生视频演示的示例输入图i2v 模式下输出视频分辨率就跟随这张图的尺寸对应上表width/height一行的说明。翻车点与对策症状显存爆掉或慢到怀疑人生。根因5B 权重加 VAE 同时驻留显存。对策保留cli_demo.py里的enable_sequential_cpu_offload()默认第 150 行别删仍 OOM 就把--model_path换成THUDM/CogVideoX-2b。症状画面内容和提示词对不上。根因一句话提示词文本约束太弱。对策先跑python inference/convert_demo.py --prompt ... --type t2v扩写成长提示再把--guidance_scale调到 6–7 重跑对比。症状播放掉帧时长和帧数对不上。根因fps与帧数没按模型档位配套。对策保持默认组合1.0 档 49 帧 8fps1.5 档 81 或 161 帧 16fps必须改时用--fps按时长 帧数 ÷ fps重新核算。那条骑自行车的命令跑通后链路就算活了。下一步动作同一命令加--seed 7再跑一次把两版output.mp4并排对比你能直接看出种子对画面的实际影响全部参数的默认值与逐项说明都能查到 inference/cli_demo.py官方推理入口的函数注释里。【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考