公司动态
video-analyzer 使用指南:本地 AI 视频分析,把视频内容变成文本描述
video-analyzer 使用指南本地 AI 视频分析把视频内容变成文本描述【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzervideo-analyzer 是一个可完全本地运行的 AI 视频分析工具它从视频中自动抽取关键帧并对音频轨做语音转录把画面逐帧交给视觉大模型描述最后把两者融合成一段连贯的 JSON 视频描述。本文以「把一段 45 分钟的会议录像变成可搜索的纪要」为主线带你走完安装、参数调优和本地/云端模型切换的完整路径。先搞清楚三阶段处理链路跑第一条命令之前先理解结果从哪来后面调参才不会绕弯。video-analyzer 的分析分三个阶段阶段一提取OpenCV 从视频里挑出最具代表性的关键帧不是逐帧全取避免对几乎相同的画面重复分析音轨交给 Whisper 做语音转录音频质量不可靠时会自动跳过转录、只分析画面阶段二单帧分析视觉模型按时间顺序逐帧描述每帧的分析结果会作为上下文传给下一帧保证时间线不跳跃阶段三重建把全部帧描述与完整转录合并成最终的视频描述。跑完一轮核心产物是output/analysis.json包含四块metadata模型、帧数等元信息、transcript转录文本及分段起止时间、frame_analyses逐帧描述、video_description整体描述。做会议纪要时主要看后两块。默认情况下中间产物 frames/ 与 audio.wav 会在处理结束后清理命令上加--keep-frames可保留它们以便核对。 最小安装路径依赖、模型与第一条命令系统要求Python 3.11 和 FFmpeg本地跑视觉模型通常建议 16GB 以上内存官方文档给出的参考值是 16GB 起步、32GB 推荐走云端模式则没有这个硬件门槛。git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate pip install .依赖包含 OpenCV、PyTorch、faster-whisper 等首次安装会花几分钟。装好后拉取视觉模型并跑第一次分析ollama pull llama3.2-vision video-analyzer meeting.mp4meeting.mp4换成你的视频文件路径即可。前提是装好 Ollama 且服务在运行安装器一般会配成后台服务否则手动执行ollama serve。整个过程就三步装依赖、拉模型、跑一条命令全程不需要 API key。️ 最常用的三个参数--model用来切换视觉模型默认是 Ollama 上的llama3.2-vision接云端时可改成gpt-4o之类。--prompt给分析追加一个自定义问题比如--prompt 列出达成的决策和各项行动的负责人让输出贴近纪要格式。帧密度没有独立的命令行参数由config/config.json里的frames.per_minute控制默认每分钟 60 帧部分教程里提到的--frames-per-minute指的就是这一项长视频建议直接用--max-frames限制总帧数更可控。参数位置用途--model命令行指定视觉模型默认llama3.2-vision--prompt命令行追加自定义问题控制分析侧重frames.per_minuteconfig/config.json每分钟提取的帧数越大越细--max-frames命令行限制总帧数在全片均匀采样--whisper-model命令行语音识别模型大小默认medium--duration命令行只处理视频前 N 秒☁️ 本地还是云端两种模式默认情况下video-analyzer 把关键帧发给本机的 Ollama 服务视频文件与分析结果全程不出机器。对内部会议这类敏感内容这是选择它的最主要原因你不需要担心录像被上传到任何外部服务。如果想省时间或提高描述质量一条命令就能切换到任意 OpenAI 兼容的云端服务video-analyzer meeting.mp4 --client openai_api \ --api-key sk-xxx --api-url https://openrouter.ai/api/v1 \ --model gpt-4o配置优先级是 命令行 config/config.json 内置默认值你可以把云端配置写进配置文件长期生效也可以每条命令临时传入。进阶长视频拆分与批量处理45 分钟的录像在本地模型上通常能一次跑完但遇到内存或时长限制时有两个现成的开关--duration 1800只处理前 30 分钟--max-frames 60把送入模型的帧数压下来。另一个高频用法是中断或调参后重跑——加上--start-stage 2会跳过提取阶段直接基于已提取的帧继续省掉重新转录音频和抽帧的开销video-analyzer meeting.mp4 --duration 1800 --max-frames 60 video-analyzer meeting.mp4 --start-stage 2 --keep-frames批量处理多个视频用一行 shell 循环即可for v in *.mp4; do video-analyzer $v --output results/${v%.*}; done不需要额外脚本。从你自己的视频文件开始推荐路径先跑video-analyzer 你的视频.mp4在本地把整条链路走通再根据输出结果调--max-frames和--prompt本地效果或速度不满足时再切云端模型对比。下一步动作很简单把你手上任意一段视频的路径填进上面第二条命令回车然后打开output/analysis.json看第一版结果。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考