公司动态

构建结构化记忆图谱:实现多模态智能体的超长视频深度理解

📅 2026/8/22 10:16:28
构建结构化记忆图谱:实现多模态智能体的超长视频深度理解
1. 项目概述当智能体需要“看懂”超长视频最近在跟进多模态智能体Agentic AI的前沿进展时一个核心挑战反复被提及如何让AI系统真正理解并推理长达数小时、包含海量视觉与听觉信息的视频内容这不仅仅是简单的物体识别或动作分类而是要求智能体能够像人类一样记住关键情节、理解事件间的因果与时空关系并基于此进行复杂的决策和规划。我们团队近期深度参与的一个研究方向正是为了解决这个“超长视频推理”的难题其核心被概括为“Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning”。简单来说就是构建一个结构化的记忆系统来桥接视频中不同的模态信息图像、声音、文本字幕等并跨越漫长的时间线支撑智能体完成高级推理任务。你可以把它想象成给AI装上一个拥有“导演思维”的笔记本。观看一部两小时的电影人类不会记住每一帧画面但会记住主角的目标、关键冲突、人物关系的变化以及重要的伏笔。我们的目标就是让AI具备类似的能力。传统的视频理解模型往往受限于固定的上下文窗口比如只能看几秒或几分钟的片段对于超长视频它们要么“看了后面忘了前面”要么只能进行非常浅层的、片段化的分析。而具备“智能体”Agentic特性的系统意味着它不仅要理解还要能主动规划、调用工具、与环境交互以完成特定目标例如根据长达数小时的监控视频总结异常事件链条或者观看完整的手术教学视频后回答复杂的步骤与原理问题。这个方向与当前热门的“Agentic RAG”检索增强生成智能体和“记忆增强”研究紧密相连。但它的特殊性在于其处理的对象是连续、高维、多模态的视频流而非离散的文本段落。因此如何从视频中提取、组织并存储信息形成可供高效检索和推理的“记忆图谱”Memory Graph成为了技术突破的关键。接下来我将拆解我们在这个领域探索的核心思路、关键技术选型以及实战中积累的经验与教训。2. 核心架构设计从时序流到记忆图谱面对超长视频最直接的暴力解法是将视频均匀切片分别输入视觉大模型如CLIP、ViT和音频模型提取特征然后一股脑儿塞给一个大语言模型LLM。这种方法在短视频上或许可行但对于超长视频会立即遭遇三大瓶颈1)计算成本爆炸帧数太多特征提取和LLM处理的开销无法承受2)信息过载与丢失LLM的上下文窗口有限大量冗余信息如静态背景会挤占关键事件的记忆空间3)缺乏时序结构简单的帧序列无法体现事件之间的因果、并列或递进关系。因此我们的设计核心转向了“结构化记忆”。其目标不是存储所有原始数据而是构建一个动态的、可演化的知识图谱我们称之为“多模态记忆图谱”Multimodal Memory Graph。这个图谱的构建与演化贯穿智能体处理视频的整个过程。2.1 记忆图谱的节点与边定义信息的“原子”与“关系”记忆图谱由节点Nodes和边Edges构成这是结构化的基础。节点并非原始的像素或声波而是经过抽象和总结的“记忆单元”。每个记忆单元包含以下核心属性内容摘要一段文本描述概括该单元的核心信息。例如“外科医生在视频第15分钟开始进行腹腔镜胆囊切除的套管针穿刺”。模态特征锚点指向原始视频中关键片段的指针包括起始时间戳、结束时间戳以及从该片段中提取的浓缩视觉特征向量和音频特征向量。这保证了记忆可追溯、可验证。语义类型标识该单元属于哪种语义类别如“实体”人物、物体、“动作”、“事件”、“状态”、“目标”、“约束条件”等。这为后续的关系定义和推理提供了基础。重要性分数一个动态计算的标量反映该记忆单元在当前智能体任务上下文中的相关性和关键程度。静态场景的分数会随时间衰减而关键转折点的分数则会维持或升高。边定义了记忆单元之间的关系是体现“结构”的关键。我们主要设计了以下几种关系类型时序关系before,after,simultaneous同时发生。这是最基础的关系构建了时间线骨架。因果/条件关系causes,enables,prevents。例如“护士递送手术刀A”enables“医生进行切开操作B”。组成关系part_of,has_part。用于描述复杂事件由子事件构成或物体由部件构成。引用关系refers_to。当一个记忆单元如一段对话中提到另一个实体或事件时建立此关系。相似性关系similar_to。连接在视觉或语义上相似的记忆单元有助于发现模式或重复桥段。设计心得关系类型的定义并非一成不变。在项目初期我们设计了过于复杂的关系体系如十几种导致图谱构建和维护极其困难。后来我们精简为核心的五类并允许LLM在生成记忆单元时自由采用自然语言描述其他复杂关系如“对比”、“妥协”这些描述会被嵌入到节点的属性中。这种“核心结构化自由文本补充”的混合策略在实践中取得了更好的灵活性与可管理性。2.2 双通道处理流程在线摘要与离线深度挖掘为了平衡实时性与推理深度我们采用了双通道处理流程通道一在线流式摘要与图谱更新当视频流实时输入或按固定大块如每5分钟输入时启动轻量级处理流水线关键帧/片段检测使用轻量模型或基于运动、音频能量的启发式方法快速检测出场景变换、人物开口说话、出现新物体等关键点避免对每一帧进行处理。多模态特征快速提取对关键片段并行提取视觉特征使用轻量级ViT和音频特征如VGGish并利用自动语音识别ASR生成临时文本。轻量级记忆单元生成将上述多模态信息视觉特征、音频特征、ASR文本连同之前几分钟的短期记忆图谱上下文一起输入一个中等规模的LLM如7B-13B参数指令其生成新的记忆单元文本摘要并初步判断其与现有图谱节点的关系。图谱实时更新将新生成的记忆单元作为节点插入图谱并根据LLM的判断初步创建边。这个过程是增量的、在线的为智能体提供实时的、虽不完美但可用的记忆支持。通道二离线异步深度分析与图谱优化在视频播放完毕或智能体进入“反思”阶段时启动高资源消耗的深度处理全局上下文重估利用完整的视频信息所有在线生成的记忆单元和原始关键片段索引让一个更强大的LLM如70B参数级别进行全局审视。它的任务是修正错误摘要、合并冗余节点如多次出现的同一人物、识别并建立更高阶的因果与逻辑关系。重要性分数重校准基于全局任务目标例如“找出所有违规操作”重新计算每个记忆单元的重要性分数。在线阶段可能认为某个镜头重要但从全局看可能是无关紧要的。图谱剪枝与索引构建对重要性极低的节点进行归档或删除以保持图谱的简洁和高效。同时为图谱节点构建向量索引基于节点摘要的文本嵌入支持后续基于语义的快速检索。实操要点双通道设计的关键在于“松耦合”。在线通道必须快且稳即使摘要粗糙些也没关系但不能阻塞。离线通道可以慢工出细活。两个通道通过共享的图谱数据存储进行交互离线通道的优化结果会异步更新在线通道使用的图谱视图。这类似于人类“先快速浏览建立印象再精读深入理解”的过程。3. 关键技术实现桥接模态与跨越时间有了架构设计我们需要具体的技术选型来实现“桥接模态”和“跨越时间”这两个核心目标。3.1 模态桥接器从异构数据到统一语义空间视频包含视觉、音频、文本字幕、屏幕文字等多种异构数据。直接拼接它们的特征向量效果很差因为不同模态的特征空间不一致。我们的解决方案是引入一个“多模态对齐模块”其目标是将所有模态的信息投射到一个统一的语义表示空间。我们并没有从头训练一个多模态大模型而是采用了更实用、更灵活的“基于LLM的语义融合”策略各模态独立编码视觉使用预训练的视觉编码器如DINOv2或CLIP的视觉编码器提取关键帧或片段的特征。我们不仅取最后的CLS token也会保留部分空间特征以保留一定的空间布局信息。音频使用预训练的音频编码器如HuBERT或Wav2Vec2提取音频片段的特征。文本ASR生成的文本或原始字幕直接用LLM的文本分词器处理。描述性生成我们将各模态的“特征”转化为“描述”。这是一个关键步骤。例如将视觉特征输入一个轻量的“视觉描述生成”模型可以是小型的图像字幕模型也可以是提示大视觉模型生成简短描述得到如“一个穿蓝色手术服的医生手持腹腔镜器械”的文本。同样音频特征可以转化为“背景有持续的心电监护仪滴滴声期间有两次短暂的警报声”。这一步将难以直接对齐的高维特征转换成了LLM天然理解的文本语义。LLM进行语义对齐与融合将来自不同模态的文本描述连同时间戳信息一起输入LLM。我们设计特定的提示词Prompt要求LLM综合这些描述生成一个连贯、简洁、包含跨模态信息的综合摘要。例如“在[T1-T2]时段视觉显示医生在操作腹腔镜视觉同时音频中有清晰的器械操作声和稳定的监护音音频ASR转录到医生说‘确认胆囊管’文本。综合判断此阶段为关键解剖结构确认环节。” 这个生成的综合摘要就是我们的“记忆单元”的文本内容核心。它本身就完成了模态的桥接。避坑指南最初我们尝试直接使用多模态大模型如GPT-4V来处理每一段视频片段让它直接输出摘要。这虽然简单但成本极高且难以控制输出的格式和一致性不利于后续图谱构建。而“特征-描述-LLM融合”的管道化方案虽然步骤多但每个环节可控、可调试且能利用更便宜的纯文本LLM如开源LLM来完成核心的融合工作大幅降低成本。3.2 时间跨度管理器分层记忆与动态检索超长视频的时间跨度管理是另一个核心。我们借鉴了人类记忆的“工作记忆-短期记忆-长期记忆”模型设计了分层记忆系统并与图谱结合。工作记忆Working Memory容量极小存放智能体当前正在直接处理的几个记忆单元节点。例如在回答“手术第三步发生了什么”时与第三步直接相关的节点会被激活并调入工作记忆。短期记忆图谱Short-term Memory Graph存放最近一段时间如视频当前片段的前后10分钟内所有相关的记忆单元及其关系。这是在线通道主要维护和更新的部分。它结构相对完整支持复杂的局部推理。长期记忆图谱Long-term Memory Graph存放整个视频处理过程中产生的所有记忆单元。它规模庞大但经过离线通道的优化和剪枝。长期记忆中的节点重要性分数普遍较低或属于背景信息。动态检索机制是连接各层记忆、实现“跨越时间”查询的关键。当智能体需要信息来回答问题或做决策时触发检索第一步语义检索。将问题转换为嵌入向量在长期记忆图谱的向量索引中进行相似性搜索召回Top-K个相关节点。第二步图谱漫步Graph Walk。以召回的节点为起点在图谱中沿着关系边进行遍历。例如如果问题关于某个事件的原因系统会沿着causes边反向查找如果关于某个物体的后续状态会沿着时间边after查找。这一步能发现与问题语义上不直接相似但逻辑上紧密关联的节点。第三步上下文组装。将语义检索和图谱漫步得到的所有相关节点按其时间顺序和关系紧密程度组装成一个临时的、聚焦的子图谱。这个子图谱被送入LLM作为生成最终答案的上下文。这种“向量检索图谱推理”的结合比单纯用向量检索更能回答涉及复杂关系、需要逻辑链条的问题。4. 智能体集成与推理循环结构化记忆图谱本身是“静态”的知识库。要让智能体“活”起来需要将其嵌入到智能体的感知-决策-行动循环中。我们参考了经典的ReActReasoning and Acting框架并进行了增强。智能体的核心推理循环如下观察Observe接收当前视频帧或片段的多模态信息。通过在线处理通道生成或更新对应的记忆单元并整合到短期记忆图谱中。反思Reflect智能体由LLM驱动访问其工作记忆和短期记忆图谱。LLM会主动提出一些问题来“反思”当前状况例如“刚才提到的‘器械清点’步骤完成了吗图谱中是否有has_part关系指向‘清点完成’事件”“当前医生的动作记忆单元A与标准操作流程预先注入图谱的规则节点是否一致”。这个过程会主动触发对记忆图谱的查询和推理。规划Plan基于反思的结果和最终任务目标如“监控手术安全”LLM规划下一步动作。动作可能包括A. 请求关注“需要更仔细地观察接下来5秒的缝合动作”这会调整在线处理通道的关键帧检测灵敏度B. 主动查询“检索历史上所有出现‘出血’事件的前后情境”这会触发对长期记忆的深度检索C. 执行工具调用如“生成当前阶段的风险评估报告”。行动Act执行规划的动作。如果是调整关注或查询就更新内部状态如果是调用工具就执行并记录结果。行动的结果又可能作为新的观察产生新的记忆单元从而形成一个闭环。在这个循环中结构化记忆图谱扮演了智能体的“外脑”或“数字笔记本”角色。它让LLM摆脱了有限上下文窗口的束缚能够基于一个庞大但组织有序的知识库进行深度推理。经验之谈训练智能体有效地使用记忆图谱需要精心的提示工程和少量示例学习Few-shot Learning。我们制作了许多示例展示如何将自然语言问题如“为什么在步骤A之后发生了事件B”分解为对图谱的一系列查询操作先找B节点再找指向B的causes边再找到A节点最后综合A和B的属性生成解释。这个过程被称为“教会智能体使用自己的记忆”。5. 实战挑战与优化策略在将这套系统应用于真实场景如工业巡检视频分析、长教学视频理解时我们遇到了诸多挑战并总结出以下优化策略挑战一图谱噪声与错误累积在线通道LLM生成的关系可能存在错误如误判因果关系或错误连接节点。这些错误会在图谱中传播和累积。策略引入“置信度”机制。为每条LLM生成的关系边附加一个置信度分数。在离线深度分析阶段全局LLM会像“校对编辑”一样对这些低置信度边进行复审和修正。同时设计一致性检查规则例如如果节点Acauses节点B但B的时间戳早于A则系统自动标记该关系为矛盾需优先复审。挑战二计算资源与延迟的平衡双通道处理仍对算力有较高要求特别是离线深度分析阶段。策略采用“懒惰评估”与“按需优化”。并非所有视频都需要触发完整的离线深度分析。只有当智能体在执行任务过程中多次检索某部分记忆且反馈置信度低时才针对该部分关联的记忆子图触发异步的深度优化。这确保了资源用在“刀刃”上。挑战三领域知识的有效注入通用LLM对专业领域如医疗、金融视频的理解深度有限。策略构建“领域模式层”。在记忆图谱之上我们引入一个轻量的“领域模式”层。它由领域专家定义的规则、本体或常见工作流程构成。例如在手术视频中可以预定义“标准腹腔镜胆囊切除术步骤”的模式图。当在线生成记忆单元时系统会尝试将其与预定义的模式节点进行对齐从而用领域知识来指导和校正自动生成的内容提升摘要和关系的专业性。挑战四评估难题如何定量评估一个超长视频推理系统的性能传统的准确率、召回率指标难以适用。策略采用分层评估体系。单元级评估自动生成的记忆单元摘要与人工标注的摘要之间的ROUGE或BERTScore分数。关系级评估自动推断的图谱关系如因果、时序与人工标注的关系之间的一致性精确率、召回率。任务级设计端到端的问答任务或决策任务。例如给定一段长视频和一系列复杂问题需综合视频前中后信息才能回答评估智能体回答的准确率。这是最核心、也最困难的评估方式。6. 典型应用场景与未来展望基于结构化记忆的超长视频推理智能体其应用场景非常广泛高级视频监控与安全不再仅仅是检测打架、摔倒等简单事件而是能理解整个场景中多个实体长时间内的行为模式预测潜在风险。例如在工厂监控中能识别出“工人A未按规定佩戴安全装备进入高危区域随后在操作设备B时与工人C发生了非安全距离的交互”这样的复杂事件链。沉浸式教育与人机协作智能体可以观看完整的软件教学视频、实验操作视频或手术录像构建出该操作的知识图谱。学习者可以随时向智能体提问任意细节智能体能从视频中定位并解释。更进一步智能体可以充当虚拟助手在工程师维修设备时实时观看第一视角视频并根据记忆图谱中的维修手册视频提示下一步该做什么、注意什么。媒体内容分析与创作自动为长视频生成深度内容摘要、分章节标签、人物关系图甚至发现剧情中的伏笔与呼应。对于影视制作团队可以分析经典影片的叙事结构和节奏提供数据化的参考。我个人在实践中的最深体会是处理超长视频的核心矛盾在于“无限的信息输入”与“有限的处理能力”之间的冲突。结构化记忆图谱不是一个完美的解决方案但它提供了一个极具前景的折中路径它不追求存储所有信息而是致力于存储“对未来推理有用的信息”。这本质上是一个压缩和抽象的过程其质量高度依赖于摘要生成和关系抽取的准确性。因此未来工作的重点一方面在于利用更强大的多模态基础模型来提升“感知”和“抽象”的能力另一方面在于设计更精巧的图谱自演化、自纠错机制让记忆系统能够在与环境和任务的交互中不断学习、不断优化真正成为一个智能体可靠且高效的“外置大脑”。最后分享一个具体的小技巧在构建图谱关系时除了让LLM判断关系类型还可以强制要求LLM为每条关系生成一句简短的理由例如“A enables B因为A提供了B所需的工具”。将这些理由作为边的属性存储下来。在后续的推理和问答中当智能体需要解释自己的判断时这些存储的理由可以直接被引用或整合极大地提高了输出结果的可解释性也让整个系统的行为更加透明和可信。