# 论文 · Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents


## 基础信息
* 作者：Eric Hanchen Jiang, Zhi Zhang, Yuchen Wu, Levina Li, Dong Liu, Xiao Liang, Rui Sun, Yubei Li, Edward Sun, Haozheng Luo, Zhaolu Kang, Aylin Caliskan, Kai-Wei Chang, Ying Nian Wu
* 期刊/日期：arXiv preprint, 2026-07-15
* 核心贡献：MEMCON 不提出新 memory store，而是把 memory access/maintenance 建模为在线控制问题，用轻量 UCB contextual bandit 学习何时检索、重检索、注入计划、合并、遗忘或跳过。

## Q1. 研究动机

多数 agent memory 用固定 top-k、固定 hop、固定 query template，不管任务早期/后期、记忆稀疏/丰富、agent 是否卡住都采用同一策略。作者认为真正有效的记忆行为是上下文依赖的，静态 pipeline 会在简单任务中过度检索、在复杂任务中检索不足。

## Q2. 核心问题

论文要解决的是：如何在不增加额外 LLM 调用、不重新设计底层记忆库的情况下，让 agent 自适应决定 memory operation 的类型与参数。核心技术问题是把记忆管理从固定启发式改为可在线学习的 Memory MDP / contextual bandit。

## Q3. 现有不足 &amp; 本文改进

现有 graph memory、trajectory memory、reflection memory、latent-token memory 多数仍使用固定访问策略；MemGPT 虽然自适应，但让 LLM 充当 controller，会增加每次 memory operation 的 LLM 调用成本。

MEMCON 的改进是增加一个 backend-agnostic wrapper：它截获 retrieve/store 接口，观察任务状态和记忆状态，用 UCB 在有限动作集中选择 RETRIEVE、PLANINJECT、RE-RETRIEVE、CONSOLIDATE、FORGET、NOOP 及其参数。策略使用 warm-start priors、二元任务反馈和 reverse-discounted credit assignment，表格规模只有几百个离散 state。

## Q4. 方法流程

输入是任务流、agent 当前执行状态、底层 memory backend 和历史成功/失败反馈。每次需要记忆时，wrapper 提取 state：任务类型、阶段、是否 stuck、持有物体/访问位置，以及 memory size、是否有 plan、学习阶段。策略用 UCB 选一个 memory action；wrapper 以相应 top-k、hop、query suffix 或 plan template 调用底层后端。任务结束后，根据成功、失败和效率奖励更新 Q-table，并把成功轨迹抽象成可复用 plan。

## Q5. 实验设计与结论

| 实验 | 目的 | 关键结果与结论 |
| --- | --- | --- |
| GPT-4.1-mini 主结果（Table 1） | 比较 MEMCON 与 9 个 memory baseline，在 3 个 agent framework、6 个 benchmark 上的 S/A | MEMCON 在 Lobster 平均 42.6、LangGraph 43.4、Agent-FW 43.6，均为最高；例如 Lobster-ALFWorld 67.9，高于 G-Memory 59.7。 |
| Sonnet-4 与 DeepSeek-V3.2（Tables 3,4） | 检查 backbone robustness | Sonnet-4 上 MEMCON 是 15/18 个 framework×benchmark cell 的最高；DeepSeek-V3.2 上 9 个 interactive cell 全部最高、总计 15/18 最高。 |
| Token cost（Figure 3, Table 5） | 排除“只是检索更多所以更准”的解释 | GPT-4.1-mini Lobster-ALFWorld 中 MEMCON 用 39K tokens，低于 Empty 44K 和 G-Memory 45K，同时 S/A 从 59.7 提到 67.9；Agent-FW-ALFWorld 用 37K，低于 G-Memory 43K。 |
| Case study（Figure 2） | 展示策略如何随状态变化 | WebWalkerQA 中 cold phase 先探索 shallow RETRIEVE，失败后因 stuck 触发 RE-RETRIEVE；GAIA 数值题中 plan_available=True，直接 PLANINJECT。 |
| 消融与敏感性（Figures 4,5; Table 2） | 分析 UCB controller 和增强操作贡献 | Static backend 在 ALFWorld/GAIA 为 59.7/21.2；&#43; learned UCB 到 64.9/22.4；&#43; plan injection 到 66.4/22.4；&#43; goal decomposition 到 67.2/22.4；全量 67.9/22.4。UCB 是最大贡献。 |

## Q6. 局限性

作者明确说明每个 configuration 是 single deployment run，no seed averaging，用来贴近在线部署场景，但这也限制了统计稳健性。

以下为分析归纳，非原文明确说明：第一，主实验中 MEMCON wrapper 插在 G-Memory 上，backend-agnostic 的广泛性更多来自接口设计而非全面后端实测；第二，奖励依赖任务成功/失败反馈，不适合缺少清晰 reward 的开放式长期对话；第三，Q-table 离散状态可解释但表达力有限，可能难覆盖复杂工作流；第四，PLANINJECT 和 goal decomposition 对结构化 interactive tasks 更有利，在 QA 中贡献有限。

## Q7. 学术价值

理论价值：把 memory operation 视为控制动作，强调“如何访问记忆”和“记住什么”同样重要。

方法价值：提供一个轻量、可插拔、无需额外 LLM call 的 online policy layer，可包在不同 memory backend 外。

应用价值：适合长任务流 agent、网页/工具使用 agent、游戏或交互环境 agent，尤其是有明确成功反馈且 token 成本敏感的部署。

## Q8. 延伸研究方向

1. 将 tabular UCB 扩展为更细粒度的函数近似策略，但保持零额外 LLM call 的成本约束。
2. 在没有二元成功反馈的长期对话中设计 delayed reward 或用户满意度 reward。
3. 系统测试 MEMCON 包裹不同后端，如 Mem0、Zep、vector store、latent memory，而不只主用 G-Memory。
4. 研究 memory control 与主动遗忘/冲突解决系统的组合，例如让 controller 学习何时触发 FadeMem 或 TOKI 类操作。
5. 加入不确定性校准，避免 policy 在 cold phase 因 UCB 探索选择对安全场景有风险的记忆动作。

## Q9. 反直觉发现与方法失效分析

* Table 5 显示 MEMCON 并非所有 token 指标都最低。例如 GPT-4.1-mini Agent-FW-WebWalkerQA 中 MEMCON 为 186 tokens，高于 Empty 154、G-Memory 428 低很多但高于多个轻量 baseline；因此其“token saving”主要相对强记忆 baseline，而不是所有 baseline。
* Sonnet-4 Table 3 有三个例外：Lobster-ScienceWorld LatentMem 82.0 高于 MEMCON 81.6；LangGraph-TriviaQA MetaGPT 83.0 高于 MEMCON 82.8；Agent-FW-WebWalkerQA 多个 baseline 17.5 高于 MEMCON 17.1。作者把它们称为窄差距，但说明 MEMCON 不是绝对支配。
* Table 2 中 GAIA 从 static 21.2 到 learned UCB 22.4 后，plan injection 和 goal decomposition 都没有继续提升，表明增强操作依赖任务结构，在普通 QA/tool-use 中未必触发。
* 整体可信度：跨 benchmark/backbone/framework 的覆盖面强，消融也支持核心论点；但单次运行、缺少 seed averaging，使小幅优势 cell 的统计稳健性仍需谨慎。


---

> Author: [Ting](Tin10g.github.io)  
> URL: http://localhost:1313/posts/%E8%AE%BA%E6%96%87%E9%98%85%E8%AF%BB-memory-as-a-controlled-process-learned-adaptive-memory-management-for-llm-agents/  

