# 论文 · From RAG to Memory: Non-Parametric Continual Learning for Large Language Models


## 基础信息

* 作者：Bernal Jiménez Gutiérrez、Yiheng Shu、Weijian Qi、Sizhe Zhou、Yu Su（Ohio State University；Sizhe Zhou 来自 University of Illinois Urbana-Champaign；前两位作者共同贡献）
* 期刊/日期：Proceedings of the 42nd International Conference on Machine Learning（ICML 2025），PMLR 267；arXiv:2502.14802v2，2025-06-19
* 论文主题：面向大语言模型的非参数持续学习、长期记忆与结构增强 RAG

**核心贡献**：提出 HippoRAG 2，在 HippoRAG 的 OpenIE &#43; Personalized PageRank 基础上加入 passage 节点、query-to-triple 深层上下文链接和 LLM recognition memory 过滤，使同一套 RAG 在事实记忆、长篇语篇理解和多跳关联记忆三类任务上都超过最强 dense retriever，并在关联记忆任务上取得约 7% 的平均提升 。

## Q1. 研究动机

LLM 需要像人一样持续吸收新知识，同时避免持续微调带来的灾难性遗忘；RAG 通过外部语料提供了可更新的非参数记忆，因此成为现实系统的主流方案。

标准 RAG 依赖彼此独立的向量检索，只擅长找到与问题表面相似的片段，难以把分散事实串成多跳关系，也难以整合长篇、复杂或不确定的上下文。

已有结构增强方法虽然改善了 sense-making 或 associativity，却常以摘要/图扩展引入噪声，在简单事实问答上反而明显退化。

作者因此希望构建一种同时覆盖 factual memory、sense-making 和 associative memory 的稳健长期记忆系统。

## Q2. 核心问题

核心问题是：如何在不修改 LLM 参数的前提下，把“概念关联、原始上下文和多跳图搜索”统一到一个检索流程中，使结构化 RAG 不牺牲简单事实问答，并能随语料持续扩展而保持稳定性能？

## Q3. 现有不足 &amp; 本文改进

* **标准 dense RAG**：向量检索独立选择片段，缺少跨片段的关联传播；对多跳 QA 和长篇 discourse understanding 不够。
* **HippoRAG**：以 NER/实体为中心建立 phrase KG，查询和索引都偏概念化，容易丢失 passage 的语境；query parsing 也会漏掉上下文信号。
* **RAPTOR、GraphRAG、LightRAG**：用 LLM 摘要或摘要化 KG 扩充检索语料，可能产生事实改写、冗余和噪声，导致简单 QA 与多跳 QA 退化（作者在引言中明确指出这一现象）。
* **HippoRAG 2 的改进**：
  1. 把每个原始 passage 作为节点，以 “contains” 边连接其抽取出的 phrase，联合稀疏概念与稠密上下文；
  2. 用整个 query 匹配 triples，而不是只抽取 NER 或直接匹配节点，从而把关系和语境纳入种子选择；
  3. 对 top-5 triples 使用 LLM recognition memory 过滤，只保留与问题相关的事实；
  4. 将 phrase 节点和 passage 节点共同初始化 PPR，使图搜索既能多跳传播，又不会脱离原文 passage；没有有效 triple 时回退到 dense retrieval。

## Q4. 方法流程

方法分为离线索引和在线检索两阶段。

**离线索引**：

1. 对每个 passage 使用 LLM OpenIE，无预定义 schema 地抽取 subject-relation-object triples，subject/object 形成 phrase 节点，关系形成 relation edge。
2. 用 retrieval encoder 比较 phrase 向量，超过 synonym threshold（默认 0.8）则添加 synonym edge，把不同 passage 中的同义表达连起来。
3. 为每个原始 passage 建立 passage node，并用 “contains” context edge 连接该 passage 与其所有 phrase，形成同时包含概念和上下文的开放 KG。

**在线检索**：

1. 用 embedding encoder 取 query 与 KG triples 的 top-5 相似项（默认 query-to-triple）。
2. 用 Llama-3.3-70B-Instruct 进行 recognition memory 过滤，最多保留 4 个确实有助于回答问题的候选事实；若无相关事实，则直接返回 dense retrieval 的 top passages。
3. 从过滤后的 triples 选最多 5 个 phrase seed nodes；所有 passage nodes 也作为候选 seed，以扩大多跳激活范围。phrase 节点按 triple 相似度初始化，passage 节点按 query-passage 相似度初始化并乘 passage weight factor（默认 0.05）。
4. 在开放 KG 上运行 PPR，按 passage node 的 PageRank 得分排序，取 top-5 passages 交给 QA reader（Llama-3.3-70B-Instruct 或 GPT-4o-mini）生成答案。

## Q5. 实验设计与结论

| 实验 | 设置与目的 | 主要结论 |
| --- | --- | --- |
| 主 QA（Table 2） | 简单事实：NQ、PopQA；多跳关联：MuSiQue、2Wiki、HotpotQA、LV-Eval；长篇语篇：NarrativeQA。各 1,000 个问题（LV-Eval 124、NarrativeQA 293）。Llama-3.3-70B-Instruct 作为 reader，指标为 token F1。 | HippoRAG 2 平均 F1 为 59.8，超过 NV-Embed-v2 的 57.0，并在 NQ 63.3、MuSiQue 48.6、HotpotQA 75.5、LV-Eval 12.9、NarrativeQA 25.9 上领先；2Wiki 为 71.0，略低于 HippoRAG 的 71.8。相对 NV-Embed-v2，在 2Wiki 和 LV-Eval 分别高 9.5 和 3.1 个 F1 点。 |
| 检索（Table 3） | 对有 supporting-passage 标注的数据比较 recall@5。 | HippoRAG 2 平均 recall@5 为 78.2，超过 NV-Embed-v2 的 73.4；在 MuSiQue、2Wiki、HotpotQA 分别为 74.7、90.4、96.3，较最强 dense baseline 提升 5.0、13.9、1.8 个百分点。 |
| 组件消融（Table 4） | 替换 query-to-triple、移除 passage node、移除 triple filter。 | 完整方法在 MuSiQue/2Wiki/HotpotQA 平均 87.1；改为 NER-to-node 降至 74.6，query-to-node 降至 59.6，去掉 passage node 降至 81.0，去掉 filter 降至 86.4。query-to-triple 相对 NER-to-node 平均提升 12.5% recall@5。 |
| PPR 权重（Table 5） | passage reset weight 在 0.01–0.5 间变化，验证 phrase/passsage 两类 seed 的平衡。 | MuSiQue 最优为 0.05（80.5），NQ 在 0.05/0.1 为 76.9；权重过大时性能下降，因此默认取 0.05，说明该超参数对图搜索有实质影响。 |
| 持续学习（Figure 3） | 将 NQ、MuSiQue 各切成 4 段，固定一段评测并逐步加入其余段，模拟语料持续扩张。 | HippoRAG 2 在简单和关联任务上始终高于 NV-Embed-v2；简单 QA 随语料增长保持较稳，但多跳任务两者都以相近速率下降，表明扩展语料带来的干扰仍未解决。 |
| Retriever 鲁棒性（Table 7） | 用 GTE-Qwen2-7B、GritLM-7B、NV-Embed-v2 替换 dense retriever，在 MuSiQue 子集测 recall@5。 | HippoRAG 2 分别为 68.8、71.6、74.7，均高于对应 dense retrieval 的 63.6、66.0、69.7，结构收益不依赖单一 retriever。 |
| 额外 reader/模型（Table 8、9） | 使用 GPT-4o-mini 进行索引和 QA，并报告 EM、F1、recall@2/@5。 | 在绝大多数设置中保持领先，尤其 MuSiQue、2Wiki、LV-Eval；说明结论并非只由 Llama reader 造成。 |
| 资源效率（Table 12） | MuSiQue（11,656 passages），比较 token、索引时间、单查询时间、QA GPU memory。 | HippoRAG 2 使用 9.2M 输入/3.0M 输出 tokens，索引 99.5 min、1.2 s/query、9.9 GB；比 GraphRAG/LightRAG 少很多 token、快很多，但比 NV-Embed-v2 更慢、更耗显存。 |

## Q6. 局限性

**作者明确提到的局限**：

* 结论部分指出，后续仍需用图检索进一步增强 LLM 在长对话中的 episodic memory（§7）。
* passage 节点和 fact embeddings 带来额外内存开销；作者将其视为性能收益与资源成本之间的可接受权衡（Appendix F）。
* 多跳任务在持续扩展语料时仍会随干扰增加而下降（§6.3、Figure 3）。

**以下为基于论文结果的分析归纳，非作者明确表述**：

* 离线 OpenIE、同义边构建和在线 triple filtering 都依赖 LLM/embedding 质量，系统的索引与查询延迟明显高于标准 dense RAG；论文未给出端到端成本与更新频率的系统性敏感性分析。
* passage 节点“全部作为 seed”有利于召回，但在超大规模语料上会增加 PPR 图规模和随机游走成本；论文仅在约 1.2 万 passage 的 MuSiQue 上做资源比较。
* recognition filter 采用 top-5 triples、最多保留 4 条事实，固定截断可能不适合更长、更开放或需要更多证据链的问题。
* 评测主要来自 Wikipedia/NQ/多跳 QA 与 10 篇 NarrativeQA 长文，尚未充分覆盖时间演化、矛盾知识、真实交互式长期对话和跨域噪声。

## Q7. 学术价值

* **理论价值**：把人类长期记忆中的“稀疏概念编码—稠密情境编码”、recall/recognition 双过程和海马体式 PPR 联结到非参数 RAG，提出了一个可检验的记忆系统分解。
* **方法价值**：passage node &#43; context edge、query-to-triple、LLM triple filtering 和双类型 seed 的 PPR 初始化均是可复用模块；消融实验给出了各模块的独立增益。
* **应用价值**：适合需要持续加入文档、又要求多跳追踪证据的研究助理、法律/政策知识库、企业文档和长对话记忆。其不改动 LLM 参数的特性也便于增量更新和避免灾难性遗忘。

## Q8. 延伸研究方向

1. **面向持续扩展的图维护**：研究增量 OpenIE、同义边更新、时间戳和冲突边，测量新知识加入后旧知识召回与矛盾消解能力。
2. **自适应 recognition memory**：让过滤条数、置信度和是否回退 dense retrieval 由问题复杂度决定，减少 18%“过滤后零 triple”和 26%“过滤后不再匹配 supporting phrase”的错误（Appendix E）。
3. **PPR/种子策略学习化**：根据 hop 数、问题类型和证据密度动态调整 passage weight、阻尼因子及 passage seed 范围，降低多跳任务随语料增长的共同退化。
4. **更真实的长期记忆基准**：加入时间顺序、知识更新/撤销、跨会话指代、矛盾事实和超长对话，避免只用静态 QA 衡量 continual learning。
5. **效率与规模化**：探索分层/局部 PPR、图分片、缓存和更小的过滤模型，在百万级 passage 上验证延迟、内存和索引成本。

## Q9. 反直觉发现与方法失效分析

* **发现一（Table 2）**：结构增强 RAG 并不天然优于 dense RAG。LightRAG 的平均 F1 仅 6.6（NQ 16.6、PopQA 2.4、MuSiQue 1.6），远低于 NV-Embed-v2 的 57.0；RAPTOR/GraphRAG 也低于强 dense baseline。作者将这类退化归因于 LLM 摘要带来的检索语料噪声。HippoRAG 2 的改进在 2Wiki 上也不是绝对全面：其 F1 71.0 低于 HippoRAG 的 71.8，说明更复杂的整合机制仍可能在特定数据上失去优势。
* **发现二（Table 4、Appendix E）**：更强的图结构不等于更稳定的最终答案。去掉 filter 后平均 recall@5 仅从 87.1 降到 86.4，说明它在该指标上的边际增益有限；错误分析却显示，在 recall@5&lt;1 的 100 个样本中，26% 过滤后没有 supporting phrase，18% 过滤后得到零 triple。作者认为 recognition memory 的精度仍需提高。
* **发现三（Figure 3）**：HippoRAG 2 在语料扩展时保持相对领先，却没有阻止多跳性能随信息增加而下降；简单 NQ 曲线较平稳，多跳 MuSiQue 曲线两种方法都下滑。这表明当前系统更像“更好的静态检索器”，还不是已经解决干扰与遗忘的完整持续学习记忆。
* **发现四（Appendix E）**：图构建本身不是主要瓶颈--仅 2% 的错误样本在链接节点的一跳邻居中完全找不到 supporting phrase；但 PPR 搜索仍不足，在 50% 的错误样本中至少一半 linked phrase 出现在 supporting documents，却未能把正确 passage 排进 top-5。作者未将其归咎于单一原因，数据提示后续应重点改进图搜索和 reset probability。
* **整体评价**：证据支持“跨任务稳健的结构化 RAG”这一主张，尤其是检索 recall 与多 hop QA；但其优势是条件性的，依赖高质量 OpenIE、过滤 LLM、dense retriever 和 PPR 权重，且在持续扩容、资源成本和长对话 episodic memory 上仍存在明显边界。


---

> Author: [Ting](Tin10g.github.io)  
> URL: http://localhost:1313/posts/%E8%AE%BA%E6%96%87%E9%98%85%E8%AF%BB-from-rag-to-memorynon-parametric-continual-learning-for-large-language-models/  

