恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

InternVideo三阶段训练流程揭秘:从自监督预训练到8B视频对话模型

  • 首页
  • 资讯中心
  • /
  • InternVideo三阶段训练流程揭秘:从自监督预训练到8B视频对话模型

相关资讯

OpenShell:让终端听懂人话的开源AI助手 2026/10/4 10:54:03
OpenShell使用指南:让Windows 11恢复经典开始菜单 2026/10/4 10:54:03
Vue3电子签名组件实战:从Canvas原理到前后端对接 2026/10/4 10:54:03

最新资讯

从插件报错到机制拆解:plugins的发现、加载与激活排查实战
MRAM搭配Kinetis K51的工业掉电存储方案设计与实践
Cursor插件机制深度解析:AI行为策略与中文支持实现原理
Cursor插件系统深度解析:AI原生开发的Agent运行时核心
计算机毕业设计|基于springboot + vue汉服商城系统(源码+数据库+文档)
RimSort 开发环境搭建与构建指南:从源码运行到跨平台二进制打包

今日推荐

MR25H40CDF + PIC18F65K40:工业记录仪高可靠存储实战
基于STM32的数控恒压恒流电源设计:从硬件到PID调参全解析
LT9211 MIPI重定时器原理与双路扇出实战指南

本周热门

MR25H40CDF + PIC18F65K40:工业记录仪高可靠存储实战
基于STM32的数控恒压恒流电源设计:从硬件到PID调参全解析
LT9211 MIPI重定时器原理与双路扇出实战指南

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

InternVideo三阶段训练流程揭秘:从自监督预训练到8B视频对话模型

发布时间:2026/10/4 10:54:03
InternVideo三阶段训练流程揭秘:从自监督预训练到8B视频对话模型 InternVideo三阶段训练流程揭秘从自监督预训练到8B视频对话模型【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideoInternVideo 是上海AI实验室开源的视频基础模型系列它的核心是一套三阶段训练流程先用无需人工标注的自监督预训练看懂视频再通过图文多模态对齐学会图文匹配最后与 7B 语言模型拼成InternVideo2-8B 视频对话模型。本文带你完整拆解这条从数据到模型的成长路径新手也能轻松看懂每一步在做什么。整体思路为什么要分三个阶段视频理解是比图像理解更难的任务视频既有时序动态又要和文本、音频对齐。InternVideo 的解法是把能力分层学习阶段目标输入数据监督信号阶段一视觉自监督预训练纯视频无标签掩码重建 教师蒸馏阶段二视频-文本多模态对齐图文/视频文本对对比学习 蒸馏 交叉对齐阶段三视频对话视频 文本指令对话数据微调三个阶段分别对应仓库里的三个模块阶段一代码InternVideo2/single_modality/run_pretraining.py阶段二代码InternVideo2/multi_modality/阶段三InternVideo3InternVideo3/阶段一自监督预训练让模型看懂视频 阶段一的核心思想是不需要任何人工标注让视频编码器从海量视频中自学视觉表征主要依赖两种学习信号生成式学习掩码重建随机遮盖视频中的大量时空 tokenmask_typetube管状掩码、mask_ratio0.75让模型根据可见部分还原被遮盖的内容。相关参数定义见 run_pretraining.py。判别式学习教师蒸馏用两个强大的教师模型带学生——视觉教师InternVL图像-视频 CLIP 模型和多模态教师VideoMAEv2让 1B 参数的学生模型对齐教师的特征。注册逻辑见 run_pretraining.py。训练脚本非常直观运行一条命令即可启动 1B 模型预训练bash ./scripts/pretraining/1B_pt.sh对应文件位于 InternVideo2/single_modality/scripts/pretraining/。预训练完成后你会得到一个与文本无关的通用视频编码器InternVideo2-Stage1-1B/6B它能提取出高质量的纯视觉特征是后续一切能力的地基。阶段二视频-文本对齐从看懂到对得准 阶段二把纯视觉编码器升级为多模态模型在视觉编码器上接一个文本编码器BERT 或 LLM并引入一组互补的损失函数让视频特征和文本特征在同一个空间里对得准。核心损失配置见 scripts/pretraining/stage2/1B/config.py损失项作用VTC视频-文本对比学习拉近匹配对、推远不匹配对MLM掩码语言建模增强文本编码能力VTM视频-文本匹配含难负样本挖掘用于检索场景阶段一预训练的视觉编码器直接作为初始化pretrained1B_stage1.pth同时保留 CLIP 教师蒸馏clip_teacher相关参数见 config.py。训练命令同样是单行启动bash scripts/pretraining/stage2/1B/run.sh该阶段还衍生出一个CLIP 后预训练分支scripts/pretraining/clip/用 LLM 做文本编码器支持中英文检索。阶段二的产出是InternVideo2-Stage2模型在 60 多个视频/音频任务动作识别、时间定位、图文检索等上达到当时 SOTA其中 Kinetics-400 动作识别准确率达92.1%。阶段三8B视频对话模型会看视频还会聊天 阶段三把前两阶段的成果合体将阶段二训练好的1B 视觉编码器与一个7B 语言模型如 InternLM 系列通过适配器拼接得到InternVideo2-Stage3-8B视频对话模型。8B即 1B 视觉 7B 语言它能直接接收视频帧和文字指令进行视频问答、详细描述与推理。最新的InternVideo3-8B-Instruct沿用了同样的视觉编码器 LLM范式并在此基础上强化了长视频与智能体式推理能力其整体架构如下InternVideo3 的训练配方同样遵循分阶段思想继续预训练CPT→ 短到长监督微调SFT→ 基于规则强化学习 → 在线蒸馏详见 InternVideo3/README.md 中的 Training Recipe 章节。在公开权重的模型中它在 Video-MME、MLVU、EgoSchema 等长视频基准上取得了领先成绩小结三阶段流程一张图看懂 阶段模型规模关键能力入口代码① 自监督预训练1B / 6B通用视频视觉表征single_modality② 多模态对齐1B / 6B视频-文本检索与理解multi_modality③ 视频对话8B视频问答与推理InternVideo3这套自监督 → 多模态对齐 → 对话微调的三阶段训练流程是 InternVideo 系列能同时拿下识别、检索、定位、对话等几十项任务的关键。如果你想复现或魔改可以从 InternVideo2/single_modality/MODEL_ZOO.md 的模型列表入手逐阶段跑通整条流水线。【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号