论文 · From RAG to Memory: Non-Parametric Continual Learning for Large Language Models
Contents
基础信息
- 作者:Bernal Jiménez Gutiérrez、Yiheng Shu、Weijian Qi、Sizhe Zhou、Yu Su(Ohio State University;Sizhe Zhou 来自 University of Illinois Urbana-Champaign;前两位作者共同贡献)
- 期刊/日期:Proceedings of the 42nd International Conference on Machine Learning(ICML 2025),PMLR 267;arXiv:2502.14802v2,2025-06-19
- 论文主题:面向大语言模型的非参数持续学习、长期记忆与结构增强 RAG
核心贡献:提出 HippoRAG 2,在 HippoRAG 的 OpenIE + Personalized PageRank 基础上加入 passage 节点、query-to-triple 深层上下文链接和 LLM recognition memory 过滤,使同一套 RAG 在事实记忆、长篇语篇理解和多跳关联记忆三类任务上都超过最强 dense retriever,并在关联记忆任务上取得约 7% 的平均提升 。
Q1. 研究动机
LLM 需要像人一样持续吸收新知识,同时避免持续微调带来的灾难性遗忘;RAG 通过外部语料提供了可更新的非参数记忆,因此成为现实系统的主流方案。
标准 RAG 依赖彼此独立的向量检索,只擅长找到与问题表面相似的片段,难以把分散事实串成多跳关系,也难以整合长篇、复杂或不确定的上下文。
已有结构增强方法虽然改善了 sense-making 或 associativity,却常以摘要/图扩展引入噪声,在简单事实问答上反而明显退化。
作者因此希望构建一种同时覆盖 factual memory、sense-making 和 associative memory 的稳健长期记忆系统。
Q2. 核心问题
核心问题是:如何在不修改 LLM 参数的前提下,把“概念关联、原始上下文和多跳图搜索”统一到一个检索流程中,使结构化 RAG 不牺牲简单事实问答,并能随语料持续扩展而保持稳定性能?
Q3. 现有不足 & 本文改进
- 标准 dense RAG:向量检索独立选择片段,缺少跨片段的关联传播;对多跳 QA 和长篇 discourse understanding 不够。
- HippoRAG:以 NER/实体为中心建立 phrase KG,查询和索引都偏概念化,容易丢失 passage 的语境;query parsing 也会漏掉上下文信号。
- RAPTOR、GraphRAG、LightRAG:用 LLM 摘要或摘要化 KG 扩充检索语料,可能产生事实改写、冗余和噪声,导致简单 QA 与多跳 QA 退化(作者在引言中明确指出这一现象)。
- HippoRAG 2 的改进:
- 把每个原始 passage 作为节点,以 “contains” 边连接其抽取出的 phrase,联合稀疏概念与稠密上下文;
- 用整个 query 匹配 triples,而不是只抽取 NER 或直接匹配节点,从而把关系和语境纳入种子选择;
- 对 top-5 triples 使用 LLM recognition memory 过滤,只保留与问题相关的事实;
- 将 phrase 节点和 passage 节点共同初始化 PPR,使图搜索既能多跳传播,又不会脱离原文 passage;没有有效 triple 时回退到 dense retrieval。
Q4. 方法流程
方法分为离线索引和在线检索两阶段。
离线索引:
- 对每个 passage 使用 LLM OpenIE,无预定义 schema 地抽取 subject-relation-object triples,subject/object 形成 phrase 节点,关系形成 relation edge。
- 用 retrieval encoder 比较 phrase 向量,超过 synonym threshold(默认 0.8)则添加 synonym edge,把不同 passage 中的同义表达连起来。
- 为每个原始 passage 建立 passage node,并用 “contains” context edge 连接该 passage 与其所有 phrase,形成同时包含概念和上下文的开放 KG。
在线检索:
- 用 embedding encoder 取 query 与 KG triples 的 top-5 相似项(默认 query-to-triple)。
- 用 Llama-3.3-70B-Instruct 进行 recognition memory 过滤,最多保留 4 个确实有助于回答问题的候选事实;若无相关事实,则直接返回 dense retrieval 的 top passages。
- 从过滤后的 triples 选最多 5 个 phrase seed nodes;所有 passage nodes 也作为候选 seed,以扩大多跳激活范围。phrase 节点按 triple 相似度初始化,passage 节点按 query-passage 相似度初始化并乘 passage weight factor(默认 0.05)。
- 在开放 KG 上运行 PPR,按 passage node 的 PageRank 得分排序,取 top-5 passages 交给 QA reader(Llama-3.3-70B-Instruct 或 GPT-4o-mini)生成答案。
Q5. 实验设计与结论
| 实验 | 设置与目的 | 主要结论 |
|---|---|---|
| 主 QA(Table 2) | 简单事实:NQ、PopQA;多跳关联:MuSiQue、2Wiki、HotpotQA、LV-Eval;长篇语篇:NarrativeQA。各 1,000 个问题(LV-Eval 124、NarrativeQA 293)。Llama-3.3-70B-Instruct 作为 reader,指标为 token F1。 | HippoRAG 2 平均 F1 为 59.8,超过 NV-Embed-v2 的 57.0,并在 NQ 63.3、MuSiQue 48.6、HotpotQA 75.5、LV-Eval 12.9、NarrativeQA 25.9 上领先;2Wiki 为 71.0,略低于 HippoRAG 的 71.8。相对 NV-Embed-v2,在 2Wiki 和 LV-Eval 分别高 9.5 和 3.1 个 F1 点。 |
| 检索(Table 3) | 对有 supporting-passage 标注的数据比较 recall@5。 | HippoRAG 2 平均 recall@5 为 78.2,超过 NV-Embed-v2 的 73.4;在 MuSiQue、2Wiki、HotpotQA 分别为 74.7、90.4、96.3,较最强 dense baseline 提升 5.0、13.9、1.8 个百分点。 |
| 组件消融(Table 4) | 替换 query-to-triple、移除 passage node、移除 triple filter。 | 完整方法在 MuSiQue/2Wiki/HotpotQA 平均 87.1;改为 NER-to-node 降至 74.6,query-to-node 降至 59.6,去掉 passage node 降至 81.0,去掉 filter 降至 86.4。query-to-triple 相对 NER-to-node 平均提升 12.5% recall@5。 |
| PPR 权重(Table 5) | passage reset weight 在 0.01–0.5 间变化,验证 phrase/passsage 两类 seed 的平衡。 | MuSiQue 最优为 0.05(80.5),NQ 在 0.05/0.1 为 76.9;权重过大时性能下降,因此默认取 0.05,说明该超参数对图搜索有实质影响。 |
| 持续学习(Figure 3) | 将 NQ、MuSiQue 各切成 4 段,固定一段评测并逐步加入其余段,模拟语料持续扩张。 | HippoRAG 2 在简单和关联任务上始终高于 NV-Embed-v2;简单 QA 随语料增长保持较稳,但多跳任务两者都以相近速率下降,表明扩展语料带来的干扰仍未解决。 |
| Retriever 鲁棒性(Table 7) | 用 GTE-Qwen2-7B、GritLM-7B、NV-Embed-v2 替换 dense retriever,在 MuSiQue 子集测 recall@5。 | HippoRAG 2 分别为 68.8、71.6、74.7,均高于对应 dense retrieval 的 63.6、66.0、69.7,结构收益不依赖单一 retriever。 |
| 额外 reader/模型(Table 8、9) | 使用 GPT-4o-mini 进行索引和 QA,并报告 EM、F1、recall@2/@5。 | 在绝大多数设置中保持领先,尤其 MuSiQue、2Wiki、LV-Eval;说明结论并非只由 Llama reader 造成。 |
| 资源效率(Table 12) | MuSiQue(11,656 passages),比较 token、索引时间、单查询时间、QA GPU memory。 | HippoRAG 2 使用 9.2M 输入/3.0M 输出 tokens,索引 99.5 min、1.2 s/query、9.9 GB;比 GraphRAG/LightRAG 少很多 token、快很多,但比 NV-Embed-v2 更慢、更耗显存。 |
Q6. 局限性
作者明确提到的局限:
- 结论部分指出,后续仍需用图检索进一步增强 LLM 在长对话中的 episodic memory(§7)。
- passage 节点和 fact embeddings 带来额外内存开销;作者将其视为性能收益与资源成本之间的可接受权衡(Appendix F)。
- 多跳任务在持续扩展语料时仍会随干扰增加而下降(§6.3、Figure 3)。
以下为基于论文结果的分析归纳,非作者明确表述:
- 离线 OpenIE、同义边构建和在线 triple filtering 都依赖 LLM/embedding 质量,系统的索引与查询延迟明显高于标准 dense RAG;论文未给出端到端成本与更新频率的系统性敏感性分析。
- passage 节点“全部作为 seed”有利于召回,但在超大规模语料上会增加 PPR 图规模和随机游走成本;论文仅在约 1.2 万 passage 的 MuSiQue 上做资源比较。
- recognition filter 采用 top-5 triples、最多保留 4 条事实,固定截断可能不适合更长、更开放或需要更多证据链的问题。
- 评测主要来自 Wikipedia/NQ/多跳 QA 与 10 篇 NarrativeQA 长文,尚未充分覆盖时间演化、矛盾知识、真实交互式长期对话和跨域噪声。
Q7. 学术价值
- 理论价值:把人类长期记忆中的“稀疏概念编码—稠密情境编码”、recall/recognition 双过程和海马体式 PPR 联结到非参数 RAG,提出了一个可检验的记忆系统分解。
- 方法价值:passage node + context edge、query-to-triple、LLM triple filtering 和双类型 seed 的 PPR 初始化均是可复用模块;消融实验给出了各模块的独立增益。
- 应用价值:适合需要持续加入文档、又要求多跳追踪证据的研究助理、法律/政策知识库、企业文档和长对话记忆。其不改动 LLM 参数的特性也便于增量更新和避免灾难性遗忘。
Q8. 延伸研究方向
- 面向持续扩展的图维护:研究增量 OpenIE、同义边更新、时间戳和冲突边,测量新知识加入后旧知识召回与矛盾消解能力。
- 自适应 recognition memory:让过滤条数、置信度和是否回退 dense retrieval 由问题复杂度决定,减少 18%“过滤后零 triple”和 26%“过滤后不再匹配 supporting phrase”的错误(Appendix E)。
- PPR/种子策略学习化:根据 hop 数、问题类型和证据密度动态调整 passage weight、阻尼因子及 passage seed 范围,降低多跳任务随语料增长的共同退化。
- 更真实的长期记忆基准:加入时间顺序、知识更新/撤销、跨会话指代、矛盾事实和超长对话,避免只用静态 QA 衡量 continual learning。
- 效率与规模化:探索分层/局部 PPR、图分片、缓存和更小的过滤模型,在百万级 passage 上验证延迟、内存和索引成本。
Q9. 反直觉发现与方法失效分析
- 发现一(Table 2):结构增强 RAG 并不天然优于 dense RAG。LightRAG 的平均 F1 仅 6.6(NQ 16.6、PopQA 2.4、MuSiQue 1.6),远低于 NV-Embed-v2 的 57.0;RAPTOR/GraphRAG 也低于强 dense baseline。作者将这类退化归因于 LLM 摘要带来的检索语料噪声。HippoRAG 2 的改进在 2Wiki 上也不是绝对全面:其 F1 71.0 低于 HippoRAG 的 71.8,说明更复杂的整合机制仍可能在特定数据上失去优势。
- 发现二(Table 4、Appendix E):更强的图结构不等于更稳定的最终答案。去掉 filter 后平均 recall@5 仅从 87.1 降到 86.4,说明它在该指标上的边际增益有限;错误分析却显示,在 recall@5<1 的 100 个样本中,26% 过滤后没有 supporting phrase,18% 过滤后得到零 triple。作者认为 recognition memory 的精度仍需提高。
- 发现三(Figure 3):HippoRAG 2 在语料扩展时保持相对领先,却没有阻止多跳性能随信息增加而下降;简单 NQ 曲线较平稳,多跳 MuSiQue 曲线两种方法都下滑。这表明当前系统更像“更好的静态检索器”,还不是已经解决干扰与遗忘的完整持续学习记忆。
- 发现四(Appendix E):图构建本身不是主要瓶颈–仅 2% 的错误样本在链接节点的一跳邻居中完全找不到 supporting phrase;但 PPR 搜索仍不足,在 50% 的错误样本中至少一半 linked phrase 出现在 supporting documents,却未能把正确 passage 排进 top-5。作者未将其归咎于单一原因,数据提示后续应重点改进图搜索和 reset probability。
- 整体评价:证据支持“跨任务稳健的结构化 RAG”这一主张,尤其是检索 recall 与多 hop QA;但其优势是条件性的,依赖高质量 OpenIE、过滤 LLM、dense retriever 和 PPR 权重,且在持续扩容、资源成本和长对话 episodic memory 上仍存在明显边界。
WeChat Pay