公司动态

Agent系统为了降低Token消耗,如何设计上下文压缩与摘要的触发频率

📅 2026/8/12 15:06:35
Agent系统为了降低Token消耗,如何设计上下文压缩与摘要的触发频率
目录一、为什么Token消耗是Agent的核心瓶颈二、触发策略演进从固定阈值到自适应触发L1固定Token阈值 — 简单但粗暴L2语义边界触发 — 保住语义完整性L3分级触发策略 — 因场景而异三、ACON与ACM从被动等待到主动管理ACON强化学习触发ACM主动上下文管理四、三类压缩策略对比五、视频核心结论面试速记卡高频面试问答技术生态与前沿扩展相关技术方案核心一句话上下文压缩的触发频率设计本质是在信息保真度 × 计算成本 × 任务性能三维空间中寻找最优平衡点——分级触发、语义优先、主动管理而非简单的一刀切阈值。一、为什么Token消耗是Agent的核心瓶颈Agent系统与单轮对话不同它在多轮推理、工具调用、记忆检索中会持续累积上下文Token消耗呈现爆炸式增长。视频从三个维度论证了这一瓶颈的严重性Token消耗三大瓶颈——成本线性增长、延迟二次方增长、性能U型衰减深度思考这三个瓶颈不是独立的而是相互耦合的恶性循环上下文变长→成本增加→开发者试图用更便宜的模型→更便宜模型的长上下文能力更差→Lost in the Middle更严重→需要更多轮次才能完成任务→上下文更长。打破这个循环的根本手段就是在合适的时机做上下文压缩。二、触发策略演进从固定阈值到自适应触发触发策略的设计划分为清晰的演进路径从最简单的固定阈值逐步升级到智能化的自适应方案L1固定Token阈值 — 简单但粗暴最基础的方案当上下文Token数达到模型窗口的60%~80%时触发压缩操作。优点实现简单、行为可预测、无需额外计算缺点不考虑语义完整性——可能在句子中间、推理链中途切断上下文典型实现if current_tokens / max_window 0.7: trigger_compression()关键问题固定阈值的最大风险是语义断裂。Agent的多轮推理中第N步可能引用第N-3步的中间结果如果压缩恰好切在这两步之间会导致后续推理基于不完整信息产生幻觉。L2语义边界触发 — 保住语义完整性在L1基础上引入语义感知不在任意Token位置压缩而是在语义完整边界如对话回合结束、推理步骤完成、工具调用返回后触发压缩。技术手段句子边界检测、段落主题分割、对话回合识别优势压缩后的上下文保持语义连贯性减少信息碎片代价需要额外的NLP处理来判断语义边界L3分级触发策略 — 因场景而异不同任务对上下文的敏感度不同采用多级触发阈值而非单一阈值场景触发阈值压缩策略简单问答窗口50%激进压缩保留最近3轮多步推理窗口70%温和压缩保留推理链关键步骤代码生成窗口80%保守压缩仅压缩早期探索性代码三、ACON与ACM从被动等待到主动管理ACON强化学习触发将何时压缩、压缩多少建模为强化学习RL策略问题。Agent的压缩决策由RL策略网络驱动奖励函数同时考虑任务质量压缩后任务完成准确率不下降Token消耗实际使用的Token数量越少越好核心思路让Agent自己学习什么时候压缩最优而非人为设定阈值。类似于AlphaGo学习什么时候落子最优。ACM主动上下文管理给Agent配备压缩工具让它在上下文饱和前主动执行压缩而非被动等待阈值触发。Agent可以主动调用compress_context()工具在预判即将进行长推理链时提前压缩历史无关信息类似于人类思考时主动整理思路而非等到大脑装不下才整理核心洞察操作系统类比提出了一个精妙的类比——Agent上下文管理如同操作系统的内存管理OS内存管理Agent上下文管理对应关系物理内存RAM上下文窗口有限的容量资源虚拟内存/分页上下文压缩/摘要扩展可用资源内存预取PrefetchACM主动压缩提前准备避免等待页面置换LRU等旧上下文淘汰策略决定保留什么、丢弃什么工作集模型当前任务相关的上下文子集动态确定热数据深度思考这个OS类比不仅仅是修辞——它揭示了Agent上下文管理的工程本质。操作系统经过几十年演进从最初的固定分区分配到现代的虚拟内存预取TLB走的就是从固定阈值到自适应管理的路。Agent系统的上下文管理正在重走这条路只不过速度快得多——OS用了30年的演进Agent可能3年就走完。四、三类压缩策略对比视频对比了三类上下文压缩策略从保真度和节省率两个维度评估工程权衡选择压缩策略不是选最好的而是选最合适的。抽取式适合需要精确引用的场景生成式适合需要快速缩减上下文的场景语义压缩适合需要长期记忆的场景。生产系统中通常是混合使用——近期上下文用抽取式中期用生成式远期用语义压缩。五、视频核心结论一句话总结——三维空间最优平衡分级触发语义优先主动管理三个关键词的工程含义分级触发不同任务类型、不同上下文段落使用不同压缩阈值而非一刀切语义优先压缩决策基于语义完整性而非纯Token计数在语义边界处执行压缩主动管理Agent主动预判上下文增长趋势提前执行压缩而非被动等阈值面试速记卡高频面试问答Q1: 为什么Agent系统的Token消耗比普通对话大得多Agent系统在多轮推理中持续累积上下文每一步的思考过程、工具调用结果、中间推理都会追加到上下文中。一个10步推理任务上下文可能从最初的1K Token膨胀到50K。加上Transformer的O(n²)注意力复杂度不仅成本线性增长延迟也二次方增长还会触发Lost in the Middle效应导致性能下降。Q2: 固定阈值触发压缩有什么问题固定阈值如窗口70%触发的最大问题是语义断裂——它可能在推理链中间、句子半截处触发压缩导致关键上下文被截断。此外不同任务对上下文敏感度不同代码生成需要完整上下文而闲聊可以激进压缩单一阈值无法适应这种差异。Q3: ACON和ACM的区别是什么ACON是决策层方案——用强化学习学习何时压缩、压缩多少的最优策略奖励函数平衡任务质量和Token消耗。ACM是执行层方案——给Agent配备压缩工具让它在预判到上下文即将增长时主动调用压缩而非被动等待阈值。两者可以组合使用ACON决定策略ACM执行操作。Q4: 三类压缩策略怎么选抽取式保真高、节省30-50%适合需要精确引用的场景生成式保真中、节省60-80%适合快速缩减上下文语义压缩节省80%适合长期记忆。生产系统通常混合使用近期上下文用抽取式保持精度中期用生成式摘要远期用语义压缩检索。Q5: 如何用一句话回答如何设计触发频率上下文压缩的触发频率设计本质是在信息保真度 × 计算成本 × 任务性能三维空间中寻找最优平衡点——核心原则是分级触发、语义优先、主动管理而非简单的一刀切阈值。具体实现上建议按任务类型分级设定阈值在语义边界处执行压缩并让Agent具备主动压缩能力。Q6: Agent上下文管理和操作系统内存管理有什么类比关系上下文窗口对应物理内存有限容量压缩/摘要对应虚拟内存/分页扩展资源ACM主动压缩对应内存预取提前准备旧上下文淘汰对应页面置换算法LRU等当前任务相关上下文对应工作集模型。这个类比说明Agent上下文管理正在重走OS内存管理的演进路径。技术生态与前沿扩展相关技术方案方案类型核心思路LLMLinguaPrompt压缩基于困惑度筛选低信息量Token直接删除MemGPT / LettaMemory Retrieval将Context Window拆分为Working Memory和External MemoryClaude Code CompactAgent Runtime CompactionAgent运行时自动压缩状态保持执行连续性DeerFlowAgent Runtime Compaction开源Agent框架的上下文压缩实现OpenHandsAgent Runtime Compaction类似Claude Code Compact的开源实现趋势洞察上下文压缩正在从辅助优化变为核心基础设施。随着Agent任务越来越复杂从单轮问答到多日自主任务上下文管理的重要性将等同于数据库索引之于数据库——不是可选项而是系统能否运行的前提。四大方向Prompt压缩、语义压缩、Memory检索、Agent运行时压缩各有适用场景未来趋势是融合统一。