论文 · Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents

基础信息

  • 作者:Eric Hanchen Jiang, Zhi Zhang, Yuchen Wu, Levina Li, Dong Liu, Xiao Liang, Rui Sun, Yubei Li, Edward Sun, Haozheng Luo, Zhaolu Kang, Aylin Caliskan, Kai-Wei Chang, Ying Nian Wu
  • 期刊/日期:arXiv preprint, 2026-07-15
  • 核心贡献:MEMCON 不提出新 memory store,而是把 memory access/maintenance 建模为在线控制问题,用轻量 UCB contextual bandit 学习何时检索、重检索、注入计划、合并、遗忘或跳过。

Q1. 研究动机

多数 agent memory 用固定 top-k、固定 hop、固定 query template,不管任务早期/后期、记忆稀疏/丰富、agent 是否卡住都采用同一策略。作者认为真正有效的记忆行为是上下文依赖的,静态 pipeline 会在简单任务中过度检索、在复杂任务中检索不足。

Q2. 核心问题

论文要解决的是:如何在不增加额外 LLM 调用、不重新设计底层记忆库的情况下,让 agent 自适应决定 memory operation 的类型与参数。核心技术问题是把记忆管理从固定启发式改为可在线学习的 Memory MDP / contextual bandit。

Q3. 现有不足 & 本文改进

现有 graph memory、trajectory memory、reflection memory、latent-token memory 多数仍使用固定访问策略;MemGPT 虽然自适应,但让 LLM 充当 controller,会增加每次 memory operation 的 LLM 调用成本。

MEMCON 的改进是增加一个 backend-agnostic wrapper:它截获 retrieve/store 接口,观察任务状态和记忆状态,用 UCB 在有限动作集中选择 RETRIEVE、PLANINJECT、RE-RETRIEVE、CONSOLIDATE、FORGET、NOOP 及其参数。策略使用 warm-start priors、二元任务反馈和 reverse-discounted credit assignment,表格规模只有几百个离散 state。

Q4. 方法流程

输入是任务流、agent 当前执行状态、底层 memory backend 和历史成功/失败反馈。每次需要记忆时,wrapper 提取 state:任务类型、阶段、是否 stuck、持有物体/访问位置,以及 memory size、是否有 plan、学习阶段。策略用 UCB 选一个 memory action;wrapper 以相应 top-k、hop、query suffix 或 plan template 调用底层后端。任务结束后,根据成功、失败和效率奖励更新 Q-table,并把成功轨迹抽象成可复用 plan。

Q5. 实验设计与结论

实验 目的 关键结果与结论
GPT-4.1-mini 主结果(Table 1) 比较 MEMCON 与 9 个 memory baseline,在 3 个 agent framework、6 个 benchmark 上的 S/A MEMCON 在 Lobster 平均 42.6、LangGraph 43.4、Agent-FW 43.6,均为最高;例如 Lobster-ALFWorld 67.9,高于 G-Memory 59.7。
Sonnet-4 与 DeepSeek-V3.2(Tables 3,4) 检查 backbone robustness Sonnet-4 上 MEMCON 是 15/18 个 framework×benchmark cell 的最高;DeepSeek-V3.2 上 9 个 interactive cell 全部最高、总计 15/18 最高。
Token cost(Figure 3, Table 5) 排除“只是检索更多所以更准”的解释 GPT-4.1-mini Lobster-ALFWorld 中 MEMCON 用 39K tokens,低于 Empty 44K 和 G-Memory 45K,同时 S/A 从 59.7 提到 67.9;Agent-FW-ALFWorld 用 37K,低于 G-Memory 43K。
Case study(Figure 2) 展示策略如何随状态变化 WebWalkerQA 中 cold phase 先探索 shallow RETRIEVE,失败后因 stuck 触发 RE-RETRIEVE;GAIA 数值题中 plan_available=True,直接 PLANINJECT。
消融与敏感性(Figures 4,5; Table 2) 分析 UCB controller 和增强操作贡献 Static backend 在 ALFWorld/GAIA 为 59.7/21.2;+ learned UCB 到 64.9/22.4;+ plan injection 到 66.4/22.4;+ goal decomposition 到 67.2/22.4;全量 67.9/22.4。UCB 是最大贡献。

Q6. 局限性

作者明确说明每个 configuration 是 single deployment run,no seed averaging,用来贴近在线部署场景,但这也限制了统计稳健性。

以下为分析归纳,非原文明确说明:第一,主实验中 MEMCON wrapper 插在 G-Memory 上,backend-agnostic 的广泛性更多来自接口设计而非全面后端实测;第二,奖励依赖任务成功/失败反馈,不适合缺少清晰 reward 的开放式长期对话;第三,Q-table 离散状态可解释但表达力有限,可能难覆盖复杂工作流;第四,PLANINJECT 和 goal decomposition 对结构化 interactive tasks 更有利,在 QA 中贡献有限。

Q7. 学术价值

理论价值:把 memory operation 视为控制动作,强调“如何访问记忆”和“记住什么”同样重要。

方法价值:提供一个轻量、可插拔、无需额外 LLM call 的 online policy layer,可包在不同 memory backend 外。

应用价值:适合长任务流 agent、网页/工具使用 agent、游戏或交互环境 agent,尤其是有明确成功反馈且 token 成本敏感的部署。

Q8. 延伸研究方向

  1. 将 tabular UCB 扩展为更细粒度的函数近似策略,但保持零额外 LLM call 的成本约束。
  2. 在没有二元成功反馈的长期对话中设计 delayed reward 或用户满意度 reward。
  3. 系统测试 MEMCON 包裹不同后端,如 Mem0、Zep、vector store、latent memory,而不只主用 G-Memory。
  4. 研究 memory control 与主动遗忘/冲突解决系统的组合,例如让 controller 学习何时触发 FadeMem 或 TOKI 类操作。
  5. 加入不确定性校准,避免 policy 在 cold phase 因 UCB 探索选择对安全场景有风险的记忆动作。

Q9. 反直觉发现与方法失效分析

  • Table 5 显示 MEMCON 并非所有 token 指标都最低。例如 GPT-4.1-mini Agent-FW-WebWalkerQA 中 MEMCON 为 186 tokens,高于 Empty 154、G-Memory 428 低很多但高于多个轻量 baseline;因此其“token saving”主要相对强记忆 baseline,而不是所有 baseline。
  • Sonnet-4 Table 3 有三个例外:Lobster-ScienceWorld LatentMem 82.0 高于 MEMCON 81.6;LangGraph-TriviaQA MetaGPT 83.0 高于 MEMCON 82.8;Agent-FW-WebWalkerQA 多个 baseline 17.5 高于 MEMCON 17.1。作者把它们称为窄差距,但说明 MEMCON 不是绝对支配。
  • Table 2 中 GAIA 从 static 21.2 到 learned UCB 22.4 后,plan injection 和 goal decomposition 都没有继续提升,表明增强操作依赖任务结构,在普通 QA/tool-use 中未必触发。
  • 整体可信度:跨 benchmark/backbone/framework 的覆盖面强,消融也支持核心论点;但单次运行、缺少 seed averaging,使小幅优势 cell 的统计稳健性仍需谨慎。
Ting WeChat PayWeChat Pay
0%