恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

LivePortrait 2024-08-02 版本更新详解:Animals 动物模式、X-Pose 关键点检测与人类模式 Driving 新选项

  • 首页
  • 资讯中心
  • /
  • LivePortrait 2024-08-02 版本更新详解:Animals 动物模式、X-Pose 关键点检测与人类模式 Driving 新选项

相关资讯

lit-virtualizer 开发指南:从源码构建、测试到基准与发布的完整贡献流程 2026/9/13 15:07:07
即梦AI替代方案实测:四款高可用AIGC工具工作流对比 2026/9/13 15:07:07
零基础学PLC:从接线实操到独立调试的工程能力养成路径 2026/9/13 15:02:07

最新资讯

AWS CLI accessanalyzer get-analyzed-resource 命令详解:查询被分析资源的访问详情
ICBDR2026大数据会议:金融科技与数据要素前沿
三维刚体变换参数解算:SVD闭式求解R与t
NGS技术全流程解析:从测序到数据分析
Windows 11 WSL2部署vLLM运行Qwen3 8B AWQ指南
AgenticSeek 加载路由模型失败 Failed to load the routing model 怎么解决?

今日推荐

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化
Flutter应用改名全指南:从Android到iOS的配置与工具实践

本周热门

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化
Flutter应用改名全指南:从Android到iOS的配置与工具实践

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

LivePortrait 2024-08-02 版本更新详解:Animals 动物模式、X-Pose 关键点检测与人类模式 Driving 新选项

发布时间:2026/9/13 15:07:07
LivePortrait 2024-08-02 版本更新详解:Animals 动物模式、X-Pose 关键点检测与人类模式 Driving 新选项 LivePortrait 2024-08-02 版本更新详解Animals 动物模式、X-Pose 关键点检测与人类模式 Driving 新选项【免费下载链接】LivePortraitBring portraits to life!项目地址: https://gitcode.com/GitHub_Trending/li/LivePortrait本文基于 LivePortrait 仓库的 2024-08-02 版本更新记录系统讲解本次更新带来的两大核心能力面向猫狗等动物的Animals 模式含 X-Pose 关键点检测器安装、CLI 与 Gradio 两种运行方式以及人类模式新增的expression-friendly 驱动选项、driving_multiplier 强度调节与视频嘴型重定向lip retargeting。读完本文你将掌握动物肖像动画的完整部署与运行流程并能用--driving_option、--driving_multiplier精确控制人类肖像动画的头部晃动与动作幅度还会了解配套的 Windows 一键安装包与第三方生态进展。一、版本更新概览2024-08-02 是 LivePortrait 发布历史上一个重要节点团队正式推出Animals 模式——在约23 万帧各种动物主要是猫和狗数据上微调训练的动物驱动模型同时为人类模式引入了更精细的驱动控制选项。更新记录中特别感谢了 LivePortrait 团队的贡献并为 Windows 用户提供了一键安装包详见 2024-08-05 的更新说明。本次更新的内容分为三块Animals 模式新增动物关键点检测器 X-Pose、动物权重liveportrait_animals、CLI 脚本 inference_animals.py 与 Gradio 界面 app_animals.py人类模式改进新增expression-friendly/pose-friendly驱动选项、--driving_multiplier驱动强度参数、Gradio 中的视频嘴型重定向功能生态与周边Poe 平台上线 LivePortrait、ComfyUI 社区出现两个第三方集成节点、Windows 一键安装器发布。二、Animals 模式让猫猫狗狗活起来2.1 模式背景与权重下载Animals 模式在约 23 万帧动物图像以猫狗为主上微调训练而成。从 inference_config.py 的源码可以看出动物模型权重存放在pretrained_weights/liveportrait_animals/目录并已演进到_v1.1版本version_animals _v1.1 # new (v1.1) version checkpoint_F_animal: str make_abs_path(f../../pretrained_weights/liveportrait_animals/base_models{version_animals}/appearance_feature_extractor.pth) checkpoint_M_animal: str make_abs_path(f../../pretrained_weights/liveportrait_animals/base_models{version_animals}/motion_extractor.pth) checkpoint_G_animal: str make_abs_path(f../../pretrained_weights/liveportrait_animals/base_models{version_animals}/spade_generator.pth) checkpoint_W_animal: str make_abs_path(f../../pretrained_weights/liveportrait_animals/base_models{version_animals}/warping_module.pth)运行前必须先下载动物权重到pretrained_weights/liveportrait_animals/目录下。重要限制务必阅读由于若干技术问题本次发布没有为动物模型训练 stitching拼接与 retargeting重定向模块未来版本可能修复。因此官方建议运行时关闭 stitching即设置--no_flag_stitching不建议启用 paste-back贴回原图空间。从 argument_config.py 可以看到对应的默认参数flag_stitching: bool TrueCLI 中通过--no_flag_stitching置为 False、flag_pasteback: bool True。而在 app_animals.py 的 Gradio 界面中stitching 与 paste-back 两个选项默认即被勾选为False并明确标注 not recommendedflag_stitching gr.Checkbox(valueFalse, labelstitching (not recommended)) flag_remap_input gr.Checkbox(valueFalse, labelpaste-back (not recommended))另外从源码看动物模型的 stitching 权重暂用人类模型的stitching_retargeting_module.pth临时替代见 inference_config.py 中checkpoint_S_animal的注释 use human temporarily这也是官方建议关闭 stitching 的底层原因之一。2.2 安装 X-Pose 关键点检测器Animals 模式选用X-Pose作为动物关键点检测器。X-Pose 依赖transformers4.22.0与pillow10.2.0并需要编译一个名为MultiScaleDeformableAttention的自定义算子。需要说明的是当前仓库的 requirements.txt 中 transformers 版本已更新为4.38.0而 requirements_base.txt 中pillow10.2.0已满足要求。若你的环境仍使用较旧依赖请以实际安装情况为准并确保版本兼容。编译算子前请先确认已按 PyTorch 安装指南 为 Linux 或 Windows 配置好 PyTorch 环境。随后执行cd src/utils/dependencies/XPose/models/UniPose/ops python setup.py build install cd - # 返回上一级目录该命令会在 src/utils/dependencies/XPose/models/UniPose/ops 目录下编译包含 CUDA 算子的MultiScaleDeformableAttention其源码实现分布在src/cuda/、src/cpu/等子目录中如 ms_deform_attn_cuda.cu。2.3 通过 CLI 运行动物动画准备好权重与 X-Pose 后使用 inference_animals.py 脚本运行。更新记录给出的标准命令python inference_animals.py -s assets/examples/source/s39.jpg -d assets/examples/driving/wink.pkl --no_flag_stitching --driving_multiplier 1.75命令参数解析参数含义本次示例值-s/--source源动物图像或视频动物模式仅支持图像assets/examples/source/s39.jpg-d/--driving驱动视频或.pkl运动模板assets/examples/driving/wink.pkl眨眼模板--no_flag_stitching关闭 stitching动物模式官方推荐无值开关--driving_multiplier驱动强度系数1.75从 inference_animals.py 的入口实现看脚本会先校验 FFmpeg 环境与输入文件存在性再通过partial_fields将命令行参数映射到InferenceConfig与CropConfig最终交由 src/live_portrait_pipeline_animal.py 中的LivePortraitPipelineAnimal执行完整流程。动画流程的底层逻辑见 src/live_portrait_pipeline_animal.py大致如下加载源图读取s39.jpg并限制到source_max_dim默认 1280处理驱动信息若-d为.pkl模板则直接加载预提取的运动scale、旋转矩阵R、表情exp、位移t速度更快且无音频若为视频则逐帧提取运动并缓存为同名.pkl模板动物脸裁剪通过 src/utils/cropper.py 中的Cropperimage_typeanimal_face裁剪出 256×256 动物脸区域逐帧动画利用运动提取器、3D 关键点变换、warping 与生成器合成动画帧driving_multiplier控制驱动强度x_d_i x_s (x_d_i - x_s) * inf_cfg.driving_multiplier输出生成动画 mp4、拼接对比视频驱动帧 | 源图 | 生成结果与 GIF。在命令行驱动动物动画时输入源示例存放在 assets/examples/source/如s25.jpg、s39.jpg、s40.jpg、s41.jpg等驱动模板与视频存放在 assets/examples/driving/如wink.pkl、shy.pkl、talking.pkl、laugh.pkl等。2.4 通过 Gradio 图形界面运行对于更友好的交互体验可启动 Animals 模式的 Gradio 界面python app_animals.py # --server_port 8889 --server_name 0.0.0.0 --share可选参数含义--server_port 8889指定端口、--server_name 0.0.0.0允许局域网访问、--share生成公网分享链接。从 app_animals.py 的界面源码看操作流程非常直观上传源动物图像任意宽高比内置s25.jpg、s30.jpg~s33.jpg、s39.jpg、s40.jpg、s41.jpg等示例可一键选择并附有裁剪选项do crop、source crop scale默认 2.3、source crop x/y默认 0 / -0.125选择驱动输入可在 Driving Pickle 标签页上传.pkl运动模板内置wink.pkl、shy.pkl、aggrieved.pkl、open_lip.pkl、laugh.pkl、talking.pkl、shake_face.pkl或在 Driving Video 标签页上传驱动视频内置d19.mp4、d14.mp4、d6.mp4、d3.mp4同样提供驱动视频裁剪选项调节动画选项stitching与paste-back默认关闭不推荐启用driving multiplier滑块范围 0.02.0、默认 1.0点击Animate按钮输出裁剪空间内的动画视频、GIF 以及含拼接对比的最终视频。界面下方的操作提示见 gradio_description_upload_animal.md建议驱动视频中头部保持居中、减少肩膀晃动、首帧保持中性表情以获得更稳定的驱动效果。2.5 X-Pose 的许可提醒[!WARNING] X-Pose仅限非商业科研用途。若用于商业场景必须移除并替换为其他关键点检测器。这一点对任何计划将动物模式投入生产环境的开发者都至关重要合规是部署前的第一道门槛。三、人类模式更新更精细的驱动控制本次更新在人类模式Humans mode上同样带来三项重要改进全部体现在 argument_config.py 与 gradio_pipeline.py 中。3.1 新增 expression-friendly 驱动选项减少头部晃动此前版本的驱动方式被命名为pose-friendly姿态友好现在新增expression-friendly表情友好选项并设为默认值用于减少头部晃动head wobbling。两者对比选项特点适用场景expression-friendly默认用全局乘子自适应驱动运动减少头部晃动源图为人类图像、头部姿态变化不大时更稳定pose-friendly与旧版本行为一致大幅头部姿态运动时效果更好通过--driving_option参数或 Gradio 界面下拉框即可切换。从 argument_config.py 的声明可以确认driving_option: Literal[expression-friendly, pose-friendly] expression-friendly # expression-friendly 会用全局乘子自适应驱动运动官方同时提示expression-friendly 在大角度头部姿态下效果可能较弱此时请切换到 pose-friendly。3.2 新增 driving_multiplier 驱动强度参数--driving_multiplier用于调节驱动强度默认值为 1可在命令行或 Gradio 界面设置。其语义是控制驱动动作打多大折扣或放大多大值大于 1 增强动作幅度小于 1 削弱动作幅度。该参数通常与expression-friendly配合使用见 argument_config.py 中 be used only when driving_option is expression-friendly 的注释取值范围建议在 02 之间。在上文动物模式的 CLI 示例中--driving_multiplier 1.75即用于放大眨眼/表情的驱动幅度。3.3 Gradio 视频重定向精确控制嘴型本次为 Gradio 新增了**视频重定向Video Retargeting**功能可以为源视频指定一个target lip-open ratio目标嘴部张开比例从而整体调整源视频中的嘴部运动幅度。一个典型应用是将目标比例设为 0即可让源视频中的人物全程闭嘴。从 gradio_pipeline.py 的实现看该功能由execute_video_retargeting驱动核心流程是对源视频逐帧提取关键点与嘴部比例通过calc_lip_close_ratio见 src/utils/retargeting_utils.py计算当前嘴型闭合程度将用户指定的input_lip_ratio作为目标调用retarget_lip计算嘴部关键点增量lip_delta_retargeting用driving_smooth_observation_variance对增量序列做平滑避免帧间跳变再逐帧叠加回源帧关键点完成重定向输出。这为口播视频、配音素材的嘴型规范化提供了非常实用的工具例如将说话幅度过大的口播统一收敛或完全静音嘴部动作。四、其他更新与生态进展更新记录还附带了几项值得关注的信息Windows 一键安装包为 Windows 用户提供了集成环境的一键安装器详见 2024-08-05 更新说明——下载解压后双击run_windows_human.bat进入人类模式或run_windows_animal.bat进入 Animals 模式Poe 平台支持 LivePortraitPoe 上线了 LivePortrait 在线体验入口ComfyUI-LivePortraitKJ第三方 ComfyUI 节点已引入 MediaPipe 作为 InsightFace 的替代关键点检测方案使整体许可保持在 MIT 与 Apache 2.0 范围内方便商业使用ComfyUI-AdvancedLivePortrait另一款第三方节点支持实时肖像姿态/表情编辑与动画并已注册到 ComfyUI-Manager可直接在 ComfyUI 中检索安装。以上生态信息均为社区第三方项目具体功能与许可请以各项目实际发布为准。五、常见问题与使用建议动物模式动画结果变形或漂移请确认已加--no_flag_stitching关闭 stitching且不要启用 paste-back由于动物模型未训练拼接模块这两个选项是官方明确不推荐的。头部晃动明显人类模式默认已启用expression-friendly若源视频/图像头部姿态较大改用--driving_option pose-friendly通常更稳。动作幅度不符合预期用--driving_multiplier在 02 之间调节驱动强度动作为 0 时即完全静止驱动。想让源视频闭嘴在 Gradio 的视频重定向功能中把 target lip-open ratio 设为 0。动物模式检测不到脸确认已安装 X-Pose 并成功编译MultiScaleDeformableAttention算子同时源图中动物面部应清晰、可被检测。Windows 用户优先使用官方一键安装包见 2024-08-05 更新说明避免手动配置 PyTorch 与编译算子的环境问题。商业合规X-Pose 仅限非商业科研用途商用前必须替换检测器。六、相关资源索引版本更新记录assets/docs/changelog/2024-08-02.md、assets/docs/changelog/2024-08-05.md动物模式 CLI 入口inference_animals.pyGradio 入口app_animals.py动物模式推理流水线src/live_portrait_pipeline_animal.py命令行参数定义src/config/argument_config.py推理配置含动物权重路径src/config/inference_config.pyX-Pose 算子源码src/utils/dependencies/XPose/models/UniPose/ops依赖声明requirements.txt、requirements_base.txt动物源图与驱动示例assets/examples/source/、assets/examples/driving/Gradio 动物模式操作说明assets/gradio/gradio_description_upload_animal.md【免费下载链接】LivePortraitBring portraits to life!项目地址: https://gitcode.com/GitHub_Trending/li/LivePortrait创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号