恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

video-analyzer:AI视频分析,把视频转成可编辑的文字说明

  • 首页
  • 资讯中心
  • /
  • video-analyzer:AI视频分析,把视频转成可编辑的文字说明

相关资讯

LLaMA-Factory 提速117%:一行配置省一半显存 2026/8/23 0:09:21
一条命令把qmc0变mp3:qmcdump快速解密完整指南 2026/8/23 0:09:21
GetQzonehistory:QQ空间数据备份完整指南 2026/8/23 0:04:20

最新资讯

旧电脑焕新指南:Linux与统信UOS系统安装实战
Linux VNC远程桌面部署实战:从原理到SSH隧道安全配置
打造便携式AI工作环境:Ventoy、WTG与绿色打包方案全解析
QQ空间历史说说导出:一条命令完成完整备份
RTMP协议实战:推流卡顿、花屏、服务器崩掉的根因与解法
如何把小图放大 4 倍还不爆显存:Ultimate SD Upscale 实操

今日推荐

Nextcloud 桌面客户端:把同步交给它,你只管改文件
如何将 HTML 转成 Word 文档且格式不丢失?html-to-docx 使用教程
Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

本周热门

Nextcloud 桌面客户端:把同步交给它,你只管改文件
如何将 HTML 转成 Word 文档且格式不丢失?html-to-docx 使用教程
Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

video-analyzer:AI视频分析,把视频转成可编辑的文字说明

发布时间:2026/8/23 0:09:21
video-analyzer:AI视频分析,把视频转成可编辑的文字说明 video-analyzerAI视频分析把视频转成可编辑的文字说明【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzervideo-analyzer 是一款 AI 视频分析工具你输入视频它用视觉模型理解画面、用 Whisper 转写音频最后输出一份按时间顺序组织的文字描述。结果保存在 JSON 文件里可直接复制、改写或存档。支持完全本地运行也可接入云端模型。先跑什么任务会议记录输入会议录像输出会议内容概述适合需要整理纪要的团队。课程教程整理输入讲课视频输出按时间推进的画面与讲解描述适合学生和内容编辑。素材摘要输入大量剪辑素材输出每段视频里发生了什么适合快速筛片的人。从 0 到第一次出结果依赖两项Python 3.11 和 FFmpeg用于提取音频。sudo apt install ffmpeg # macOS 用 brew install ffmpeg git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate pip install .本地跑需要 Ollama安装后执行ollama pull llama3.2-vision拉取视觉模型走云端则不需要 Ollama命令行多传一个模型名即可。最小运行命令video-analyzer demo.mp4默认走 Ollama 本地模型结果写入output/目录。你会拿到什么结果运行完成后output/目录下output/ ├── analysis.json # 主报告元数据、转录、逐帧描述、整体摘要 ├── audio.wav # 从视频提取的音轨中间产物 └── frames/ # 关键帧默认运行后清理analysis.json是核心产出包含四个部分本次分析用的模型和帧数metadata、带时间戳的音频转录transcript、每个关键帧的文字描述frame_analyses、把全部内容串成时间线的视频总述video_description。逐帧描述还带时间戳方便你定位到具体画面。想看完整结构可对照示例报告。按视频长度调整帧参数帧即从视频中挑出的代表画面。帧多细节全但慢帧少出结果快但容易漏掉关键动作。命令行上主要用--max-frames总帧数上限按整段视频均匀抽样和--duration只处理前 N 秒更细的帧密度frames.per_minute在config/config.json里调。任务场景建议优先调的参数关注结果常见代价几分钟的短视频--max-frames调大动作细节是否完整本地模型上更慢几十分钟的会议--max-frames限总量--duration只处理重点时段完整跑完、转录连贯未处理时段无描述长讲座、长片降低每分钟帧数配合--max-frames整体脉络是否对画面细节会丢本地与云端的取舍本地默认客户端就是 Ollama无需 API 密钥数据不出机器适合涉及保密材料的场景。代价是机器要求较高README 建议至少 16GB 内存本地跑视觉模型建议 12GB 显存的 GPU 或 32GB 内存的 Apple M 系列。云端通过--client openai_api接入任意 OpenAI 兼容接口通常精度和速度更好适合对外交付或批量处理video-analyzer demo.mp4 \ --client openai_api \ --api-key $API_KEY \ --api-url https://openrouter.ai/api/v1 \ --model gpt-4o其中$API_KEY只是占位符换成你从服务商拿到的真实密钥。结果不满意时先查这里视频和音频质量画面模糊、音轨太弱或有明显噪音都会影响结果转录不可靠时工具会跳过音频只做画面分析日志里有提示。帧密度关键动作被漏掉时加大--max-frames或调高frames.per_minute。模型选择本地模型描述含糊时换能力更强的云端视觉模型对比一次。提示词侧重用--prompt说明关注点例如重点描述人物之间的互动语言不明确时可用--language固定转录语言。继续深入全部命令行参数和配置项docs/USAGES.md三阶段设计的详细说明docs/DESIGN.md一份真实的输出报告docs/sample_analysis.json默认配置video_analyzer/config/default_config.json核心源码video_analyzer/提示词自动调优子项目video-analyzer-tune/建议先用一段 3 分钟左右的视频按默认设置跑一遍确认输出结构符合预期后再回头调--max-frames和提示词。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号