公司动态
视频分析新解法:video-analyzer 让 AI 替你“看完“每一段视频
视频分析新解法video-analyzer 让 AI 替你看完每一段视频【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer你有没有过这样的时刻一个小时的会议录像摆在面前只为找三句关键结论就得反复拖进度条或者拍了一大堆素材想定位某个关键画面翻到眼冒金星。别急着崩溃今天介绍的 video-analyzer 就是为视频分析而生的开源工具——它把计算机视觉、语音识别和大模型打包成一条命令让 AI 替你看完每一帧、听完全程最后交给你一份结构化的视频内容分析报告。一句话概括它的价值输入一个视频文件输出一份包含画面描述、语音转写和整体解读的 JSON 报告。全程可以完全跑在本地不依赖任何云服务也可以接 OpenAI 兼容接口用更强大的云端模型加速。你不需要懂模型、不需要写代码一条命令就能开工。三步跑通第一个视频分析任务第一步把项目装到本地git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate pip install .装完之后顺手确认一下 FFmpeg 是否可用音频处理依赖它以及本机 Python 版本在 3.11 以上。第二步准备好一个大脑如果走纯本地路线只需要装好 Ollama 并拉取默认视觉模型ollama pull llama3.2-vision ollama serve如果机器配置一般、或者想追求更快的速度也可以跳过 Ollama直接申请一个 OpenRouter / OpenAI 之类的 API Key走云端路线。第三步跑起来video-analyzer demo.mp4就这么简单。工具会自动完成关键帧提取、音频转录和 AI 分析几分钟后你就能在output/analysis.json里看到完整结果。想用云端模型同样是一条命令的事video-analyzer demo.mp4 --client openai_api --api-key 你的密钥 --api-url https://openrouter.ai/api/v1从安装到出报告整个过程用不了一顿饭的功夫立刻就能体验。能力清单为什么说它看得懂视频拆开来看这个视频分析工具的底子相当扎实智能关键帧提取基于 OpenCV 计算相邻帧的画面差异自动挑出变化最剧烈的瞬间而不是机械地按固定间隔截屏既省算力又不漏重点。Whisper 专业级转写用 OpenAI Whisper 把语音转成带时间戳的文字还内置了音频质量置信度检查——遇到嘈杂、低质量的录音会主动降级处理而不是硬给一个错误结果。️视觉模型逐帧解读每一帧画面都会交给 Llama3.2 Vision 这类多模态模型输出场景、人物、动作的结构化描述并且会参考前几帧的结论保证叙事连贯。整体内容重构把逐帧描述和完整转录整合起来用第一帧定场生成一段通顺的、像人写出来的视频概述。⚙️灵活的运行方式本地 Ollama 免费离线云端 API 高速可扩展两条路随你切换。结构化 JSON 输出元数据、转录文本、逐帧分析、最终描述分层存放方便二次加工和程序化处理。每个环节都有对应的模块负责职责清晰出了问题也容易排查。一张图看懂分析流程这张官方架构图把整套处理链路画得很直观视频进来后兵分两路——一路转录成文字一路抽帧帧描述与转录结果最终汇合到 LLM 服务器生成完整的视频描述全部落盘到analysis.json。值得留意的是中间那个循环每一帧的描述都会带上之前帧的上下文所以 AI 不是在看一张张孤立的截图而是在追剧——它知道故事讲到哪了前后的内容才能对得上。完整的设计思路可以翻看 docs/DESIGN.md分析结果的样例在 docs/sample_analysis.json。这些场景里它特别能打会议与培训场景录播的周会、培训课扔进去就能得到一份会议纪要 知识点时间轴写总结、做复盘都省下大量回看时间。内容创作与素材管理剪辑师面对几十条原始素材先让 AI 批量生成描述再按关键词检索找镜头从碰运气变成查字典。教学与知识整理网课、技术分享视频转成带时间戳的文字稿配合画面描述可以快速标注知识点密度、生成章节索引甚至喂给知识库做二次检索。如果你还想要一个图形界面来浏览这些结果可以顺带看看同仓库的video-analyzer-ui子项目两者配合体验更顺滑。进阶玩法效率翻倍的几个小技巧跑通基础流程只是开始这几个参数能让你的体验直接上一个台阶控制分析规模--max-frames 50会按时间均匀采样而不是只取前 N 帧长视频也能保证覆盖全程机器配置一般时调低frames.per_minute和frames.max_count能明显降低内存压力。只分析感兴趣的部分--duration 60只处理前 60 秒快速试跑、验证效果非常方便。断点续跑处理中途被打断--start-stage 2可以从帧分析阶段继续不用重头再来配合--keep-frames还能把抽出的帧保留下来人工复核。直接向视频提问加上--prompt 视频里主要发生了什么提示词会注入到每一帧分析和最终总结中让 AI 带着你的问题去看片。音频质量兜底背景噪音大、口齿不清的视频试试--whisper-model large提升转写精度--device cuda可让 GPU 加速转录。让提示词自动进化如果觉得输出风格不合口味可以试试配套的video-analyzer-tune工具——先跑几个视频把analysis.json手动改成你理想的样子它会用 DSPy 自动优化出更合适的提示词改完指向新文件即可主程序完全不受影响。详细的参数表和配置项比如各客户端设置、帧采样阈值、响应长度等都写在 docs/USAGES.md默认值可以在video_analyzer/config/default_config.json里查看。写在最后让 AI 成为你的视频阅读助手视频是信息密度极高的载体但看完的成本一直很高。video-analyzer 的价值恰恰在于把这份成本压缩到一条命令里关键帧有人帮你挑语音有人帮你听内容有人帮你总结。无论是做会议纪要、整理素材还是搭建自己的视频知识库它都能成为你的得力助手。想立刻体验的话只需照着上面三步操作克隆仓库、装好依赖、跑一条命令。建议先从 3-5 分钟的短视频开始感受一下输出效果再逐步调整参数找到最适合自己的配置。马上动手试试让 AI 替你把每一段视频都读得明明白白。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考