Ting

Ting

满怀希望就会所向披靡

论文 · Disco-RAG: Discourse-Aware Retrieval-Augmented Generation

基础信息

  • 作者:Dongqi Liu, Hang Ding, Qiming Feng, Xurong Xie, Zhucun Xue, Chengjie Wang, Jian Li, Jiangning Zhang, Yabiao Wang
  • 期刊/日期:ACL 2026 Long Papers,2026-07-02 至 2026-07-07,页 4106-4136
  • 项目:https://dongqi.me/projects/Disco-RAG

Q1. 研究动机

标准 RAG 把 Top-k 文本块当作无结构的“事实袋”。即使每个块都相关,生成器也未必知道块内哪些句子是核心主张、哪些是限定条件,也不知道块间是支持、对比、因果还是冲突关系。由此会出现两类结构盲区:块内无法识别局部论证层级,块间无法恢复跨文档连贯性。例如,一篇证据称维生素 D 使缺乏者在冬季的流感率下降,另一篇称总体效应不显著;扁平拼接容易把条件性结果错误泛化为普遍结论。

论文 · NuggetIndex: Governed Atomic Retrieval for Maintainable RAG

基础信息

  • 作者:Saber Zerhoudi, Michael Granitzer, Jelena Mitrović
  • 期刊/日期:SIGIR 2026,2026-07-20 至 2026-07-24
  • DOI:10.1145/3805712.3809687
  • 代码、数据与评测:https://github.com/searchsim-org/sigir26-nuggetindex

Q1. 研究动机

RAG 的评估正在转向 nugget-level,即检查回答覆盖了多少独立原子事实,但大多数系统仍检索包含多条事实的 passage 或没有状态管理的 proposition。这种“评估单位与检索单位不一致”在静态语料上主要造成噪声和 token 浪费,在动态语料上则会造成更严重的问题:同一属性的新旧版本、互相冲突的来源会被一同交给生成器,模型容易合并成一个流畅但时态错误的回答。

论文 · S2G-RAG: Structured Sufficiency and Gap Judging for Iterative Retrieval-Augmented QA

基础信息

  • 作者:Minghan Li, Junjie Zou, Xinxuan Lv, Chao Zhang, Guodong Zhou
  • 期刊/日期:ACL 2026 Long Papers,2026-07-02 至 2026-07-07,页 25846-25862
  • 代码:https://github.com/nianaaa/S2G-RAG

Q1. 研究动机

迭代 RAG 的瓶颈不只是“生成下一条查询”,而是每一轮都要可靠回答两个控制问题:当前证据是否足以回答?若不足,具体缺什么?现有方法常把这两个决定隐含在自由文本推理、答案置信度或 critic 反馈中,难以审计,也容易在噪声上下文中漂移、重复检索或过早停止。

论文 · Search for Coverage: Learning Coverage-Aware Retrieval With Augmented Sub-Question Answerability

基础信息

  • 作者:Jia-Huei Ju, Eugene Yang, Trevor Adriaanse, Suzan Verberne, Andrew Yates
  • 期刊/日期:SIGIR 2026,2026-07-20 至 2026-07-24
  • DOI:10.1145/3805712.3809752
  • 代码:https://github.com/DylanJoo/CoveR
  • SCOPE 数据:https://huggingface.co/datasets/DylanJHJ/scope

Q1. 研究动机

长答案 RAG 和报告生成要求结果集覆盖一个复杂问题的多个信息面,而不只是把最相关的文档排在最前。标准 dense retriever 用单一相关性监督把同一查询的正例聚到嵌入空间的狭窄区域,容易返回内容不同但 nugget 重复的文档。已有研究也发现,文档级 nDCG 提升并不稳定转化为 nugget coverage 提升。

论文 · STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering

基础信息

  • 作者:Wei Chen, Lili Zhao, Zhi Zheng, Huijun Hou, Tong Xu
  • 期刊/日期:SIGIR 2026,2026-07-20 至 2026-07-24
  • DOI:10.1145/3805712.3809703
  • 代码:https://github.com/fanshu6hao/STRIDE

Q1. 研究动机

多跳问答不仅要反复检索,还要决定“先解决哪一步、哪些步骤能并行、什么时候不必检索而应直接推理”。现有迭代式 RAG 常把原问题直接拆成绑定具体实体的子问题,容易因同名实体或词义歧义在第一步就选错对象,并将错误沿推理链放大;同时它们通常按固定顺序执行子问题,忽略顺序依赖、并行分支和 fork-join 等结构,造成冗余检索、证据冲突及跨分支信息无法融合。

论文 · From RAG to Memory: Non-Parametric Continual Learning for Large Language Models

基础信息

  • 作者:Bernal Jiménez Gutiérrez、Yiheng Shu、Weijian Qi、Sizhe Zhou、Yu Su(Ohio State University;Sizhe Zhou 来自 University of Illinois Urbana-Champaign;前两位作者共同贡献)
  • 期刊/日期:Proceedings of the 42nd International Conference on Machine Learning(ICML 2025),PMLR 267;arXiv:2502.14802v2,2025-06-19
  • 论文主题:面向大语言模型的非参数持续学习、长期记忆与结构增强 RAG

核心贡献:提出 HippoRAG 2,在 HippoRAG 的 OpenIE + Personalized PageRank 基础上加入 passage 节点、query-to-triple 深层上下文链接和 LLM recognition memory 过滤,使同一套 RAG 在事实记忆、长篇语篇理解和多跳关联记忆三类任务上都超过最强 dense retriever,并在关联记忆任务上取得约 7% 的平均提升 。

0%