公司动态
上海AI Lab提出MemHarness框架:像人类一样重构经验,显著提升LLM Agent决策能力
【导语检索过往经验是增强LLM Agent决策能力的常见方法但现有记忆增强Agent很少判断经验是否适配当前上下文可能导致负面效果。上海AI Lab团队受人类调用记忆方式启发提出“LLM Agent经验重构”框架MemHarness性能显著提升且在OOD场景有强鲁棒性但仍存在一些不足。】MemHarness受人类启发的经验重构框架多数现有记忆增强Agent会把检索到的经验当作静态记录直接注入上下文很少判断这些经验是否适合当前上下文可能导致负迁移。而人类调用记忆会结合当前上下文重新判断以往经验的使用方式。受此启发上海AI Lab团队及其合作者提出了MemHarness框架通过在检索与动作之间插入显式的记忆重构环节来主动处理检索到的经验并通过GRPO端到端地学习这一能力无需额外人工标注。独特设计检索、批判与重构MemHarness的设计思路是在“检索”与“动作”之间显式插入“批判”与“重构”两个新环节将记忆从静态提示片段转变为具有上下文敏感性的指导信息。具体流程包括检索即根据最近几步的观测和动作判断是否调用历史经验并查询记忆库重构负责将检索到的经验改写成当前可用的指导结合多方面信息比较过去与现在的差异决定保留、改写还是丢弃动作生成模型结合当前历史信息和重构后的指导生成动作整个流程依赖任务奖励并通过GRPO端到端优化。实验验证性能显著提升研究团队在ALFWorld和WebShop两个具有挑战性的agent决策基准上评估了MemHarness。结果显示它持续优于纯RL基线以及SOTA静态记忆增强方法。消融实验表明去除重构阶段会使模型性能退化证实自适应重构是性能提升的主要驱动因素。在OOD评测中MemHarness能先判断记忆是否适用改写或舍弃不匹配内容具有强大鲁棒性。未来挑战待验证与提升目前MemHarness主要在ALFWorld和WebShop两个交互式基准上验证尚未覆盖更开放、更多样的真实环境未来需在更大规模模型和更开放环境中进一步验证。此外冷启动模型本身任务表现有限真正的重建和决策能力仍需依赖后续的任务级强化学习。编辑观点MemHarness框架为LLM Agent决策能力提升带来新思路实验效果显著但应用范围和冷启动问题待解决未来发展值得关注。