恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

InternVideo零样本视频检索实战:ViCLIP手把手教程,K400 Top-1高达64.8%

  • 首页
  • 资讯中心
  • /
  • InternVideo零样本视频检索实战:ViCLIP手把手教程,K400 Top-1高达64.8%

相关资讯

Java环境变量配置详解:从JDK安装到Eclipse运行全攻略 2026/10/4 17:34:33
国内高校毕业生最适用的AI写作辅助平台有哪些? 2026/10/4 17:34:33
新手也能上手!2026年必备AI论文写作工具榜单,免费款也能高效产初稿 2026/10/4 17:34:33

最新资讯

插件系统加载失败排查:从web boot到“did not activate”的完整思路
注意!小企业做GEO,是烧钱还是捡钱?
POJ 1613/ZOJ 1791 Cave Raider 的 bellman-ford 建模:把边权改到 TaoToken 做多源松弛验证
豆包编程模型 Doubao-Seed-Code 接入 TaoToken:统一 Key 打通 AI 编程工作流
CI-03模组烧录失败?通用脱机烧录器的协议门槛与免唤醒坑
2026年AI大模型推理平台七家对比:模型覆盖、定价、速度与合规四维测评

今日推荐

MR25H40CDF + PIC18F65K40:工业记录仪高可靠存储实战
基于STM32的数控恒压恒流电源设计:从硬件到PID调参全解析
LT9211 MIPI重定时器原理与双路扇出实战指南

本周热门

MR25H40CDF + PIC18F65K40:工业记录仪高可靠存储实战
基于STM32的数控恒压恒流电源设计:从硬件到PID调参全解析
LT9211 MIPI重定时器原理与双路扇出实战指南

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

InternVideo零样本视频检索实战:ViCLIP手把手教程,K400 Top-1高达64.8%

发布时间:2026/10/4 17:39:33
InternVideo零样本视频检索实战:ViCLIP手把手教程,K400 Top-1高达64.8% InternVideo零样本视频检索实战ViCLIP手把手教程K400 Top-1高达64.8%【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideoInternVideo 是 OpenGVLab 开源的视频基础模型全家桶而其中的ViCLIP模块是零样本视频检索的明星实现——无需针对具体任务训练仅凭一句文字描述就能从视频中检索/匹配对应内容。在 Kinetics-400 零样本动作识别基准上基于 InternVid-10M-FLT 数据训练的 ViCLIP-L 模型Top-1 准确率达到 64.8%超过了 CLIP 官方模型的 58.42%是当前开源视频-文本表征的第一梯队方案。本文将带你从零开始完成 ViCLIP 零样本视频检索环境搭建、视频-文本推理 Demo 运行并复现 K400 零样本评测的完整流程全程不碰复杂代码新手也能顺利跑通 一、ViCLIP 是什么为什么零样本检索效果这么强ViCLIP 可以理解为视频版的 CLIP组成作用说明视频编码器ViT-L/14把视频帧序列编码为特征向量初始化为 CLIP 视觉编码器并升级为时空注意力理解帧间动态文本编码器把文字描述编码为特征向量检索时通常冻结只用视频侧对齐对比学习损失InfoNCE拉近视频-文本正样本对的向量距离预训练时配合 90% 的视频掩码提升训练效率核心性能一览零样本动作识别Top-1 / AVG模型训练数据K400K600K700CLIPCLIP400M58.42 / 70.1455.11 / 67.1646.12 / 58.38ViCLIP-L WebVid10M59.88 / 71.0358.66 / 69.8450.23 / 61.86ViCLIP-L InternVid-10M-FLT64.80 / 75.7062.20 / 73.5354.30 / 66.38可以看到数据质量 数据数量。仅 10M 精心筛选的 InternVid 数据就让 K400 Top-1 从 59.88 直接跃升到 64.80。完整的性能对比表可在 InternVideo1/Pretrain/ViCLIP/README.md 中查到。二、快速上手环境搭建与模型权重获取5分钟2.1 克隆仓库并创建环境git clone https://gitcode.com/OpenGVLab/InternVideo cd InternVideo/InternVideo1/Pretrain/ViCLIP # 一键创建 conda 环境 conda env create -f viclip.yaml conda activate viclip环境定义文件为 viclip.yaml包含 PyTorch、flash-attention 等全部依赖。2.2 下载 ViCLIP 预训练权重做零样本检索最推荐ViCLIP-L-14InternVid-10M-FLT 训练版即 K400 64.8% 的满分选手。仓库提供了多个规格的权重ViCLIP-L-14 / ViCLIP-B-16不同训练数据版本下载地址汇总在 README 的Pretrained Data Model表格中。 小贴士推理 Demo 使用ViCLIP-L_InternVid-FLT-10M.pth若显存紧张16G可先用 ViCLIP-B-16 小模型跑通流程。三、零样本视频检索 Demo给视频选文案仓库内置了一个即开即用的推理 NotebookData/InternVid/demo.ipynb它演示了最典型的零样本检索场景——给定一段视频 一组候选描述模型自动给出匹配概率排序。以 Demo 中的雪景视频为例模型对 10 句候选描述的输出Top-5A playful dog and its owner wrestle in the snowy yard... ~ prob: 0.8192 A man in a gray sweater plays fetch with his dog... ~ prob: 0.1084 A pet dog excitedly runs through the snowy yard... ~ prob: 0.0676正确描述以 0.82 的概率遥遥领先——这就是零样本检索的全部魔法不训练、不微调直接听懂视频内容。Demo 背后只有 3 个核心函数实现在 Data/InternVid/viclip/init.py函数作用get_viclip(size, pretrain)加载指定规格l/b的 ViCLIP 模型_frame_from_video(video)逐帧读取视频retrieve_text(frames, texts, topk)内部自动采样8 帧、缩放到 224×224、计算视频/文本特征并返回 Top-K 匹配也就是说你只需要把视频路径和候选文本准备好其余帧采样、归一化、特征计算全部封装好了非常适合新手集成到自己的视频应用中。四、复现 K400 零样本评测64.8% 是怎么跑出来的如果你想验证基准分数而不是只做检索 Demo仓库为每个零样本任务都准备了独立的配置目录K400 对应 exp/exp_pretrain_ViCLIP/zs_k400/。运行方式以 2 卡为例bash run_our_230522_resized_10m_cc15m_freeze_unmask_wiseft05.sh评测配置要点见 zs_k400/config.py输入测试时取视频中间 8 帧、224×224 分辨率模型ViT-L/14 视频编码器 冻结文本编码器freeze_textTrue评测k_test128帧级集成eval_frame_ensembleconcateval_offloadTrue自动把大张量卸载到 CPU 省显存数据集Kinetics-400 验证集需在 configs/data.py 中设置kinetics400_validate.json路径。⚠️ 运行前务必设置环境变量VL_DATA_DIR指向你的数据根目录含anno_downstream/kinetics400_validate.json和视频文件通过命令行参数pretrained_path指向 ViCLIP-L 权重路径多卡时设置--rdzv_endpointMASTER_NODE:PORT脚本内有自动生成 MASTER_PORT 的示例。五、新手常见问题 FAQ问题解决方案报please set environment VL_DATA_DIR运行评测任务前先export VL_DATA_DIR/你的数据根目录显存不足 OOM调小batch_size_test并确认eval_offloadTrue已开启想换 MSRVTT/MSVD 视频检索基准直接复用同目录zs_msrvtt_1k/、zs_msvd/下的脚本只改数据路径即可Demo 中文本召回率一般候选描述尽量贴近视频动作细节换 ViCLIP-L 大模型通常比 B 版更准六、小结一条清晰的进阶路线跑通 Demodemo.ipynb→ 感受零样本视频检索效果10 分钟复现基准zs_k400/脚本 → 验证 K400 Top-1 64.8% 的评测流程迁移业务把retrieve_text封装进自己的视频搜索/内容审核/短视频推荐管线。ViCLIP 证明了简单架构 优质数据在视频理解上的巨大潜力。InternVideo 仓库中还有 UniFormerV2、VideoMAE、InternVideo2 等更多预训练模型与下游任务代码欢迎继续探索 InternVideo1/Pretrain/ 目录构建属于你自己的多模态视频应用【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号