公司动态

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Lang...

📅 2026/7/27 23:27:01
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Lang...
CrossVid论文核心总结与翻译一、主要内容研究背景:现有视频理解基准多聚焦于单视频分析,无法评估多模态大语言模型(MLLMs)的跨视频推理(CVR)能力——即同时理解多个视频、聚合对比跨视频信息的能力。部分多视角基准仅局限于同一场景的不同视角,难以覆盖真实世界中多样复杂的CVR场景。CrossVid基准构建:数据集规模:包含5331个视频和9015个高质量问答对,涵盖单选、多选、开放式三种题型,平均每个查询需模型理解约770秒的视频内容。任务体系:采用分层设计,包含4个高级维度(比较分析、时间理解、多视角推理、自由形式问答)和10个具体任务,覆盖32种视频类型,来源包括Animal Kingdom、YouCook2等6个公开数据集。标注流程:通过半自动化 pipeline 构建,结合Qwen2.5-VL-72B生成帧描述、DeepSeek-R1生成问答对,经10名专家标注者的过滤、优化和质量控制,确保数据可靠性。实验与发现:评估了22个开源和闭源MLLMs(参数规模7B-78B),Gemini-2.5-Pro表现最佳,平均准确率仅50.4%,远低于人类的89.2%。关键结论:闭源模型显著优于开源模型;具备“思考”机制的模型推理性能更优;输入帧数、思维链(CoT)提示对性能有正向影响,但过量无关帧会引入噪声;现有模型的核心缺