论文 · Disco-RAG: Discourse-Aware Retrieval-Augmented Generation

基础信息

  • 作者:Dongqi Liu, Hang Ding, Qiming Feng, Xurong Xie, Zhucun Xue, Chengjie Wang, Jian Li, Jiangning Zhang, Yabiao Wang
  • 期刊/日期:ACL 2026 Long Papers,2026-07-02 至 2026-07-07,页 4106-4136
  • 项目:https://dongqi.me/projects/Disco-RAG

Q1. 研究动机

标准 RAG 把 Top-k 文本块当作无结构的“事实袋”。即使每个块都相关,生成器也未必知道块内哪些句子是核心主张、哪些是限定条件,也不知道块间是支持、对比、因果还是冲突关系。由此会出现两类结构盲区:块内无法识别局部论证层级,块间无法恢复跨文档连贯性。例如,一篇证据称维生素 D 使缺乏者在冬季的流感率下降,另一篇称总体效应不显著;扁平拼接容易把条件性结果错误泛化为普遍结论。

论文据此提出:RAG 的问题不只是召回不足,还存在“检索粒度与生成理解粒度不匹配”。生成前应显式恢复修辞结构,并用其规划最终答案的论证顺序。

Q2. 核心问题

在检索器和解码条件不变时,把篇章知识作为结构先验注入生成过程,是否能提高答案/摘要的正确性、连贯性与事实一致性?更具体地说,局部 RST 树、跨块修辞图和篇章驱动计划各自是否有独立贡献,以及这种收益在长上下文、噪声检索和不同模型规模下是否稳定?

Q3. 现有不足 & 本文改进

  • 块内结构盲区:普通 RAG 不区分 nucleus(核心)与 satellite(补充),也不识别 Elaboration、Cause、Contrast 等关系。Disco-RAG 为每个块离线构造 RST 树。
  • 块间连贯性缺失:实体图主要表达“谁与谁有关”,未必表达论证关系。本文在一次 listwise 推理中预测所有文本块对的有向修辞关系或 UNRELATED,形成跨块图。
  • 结构有了但不会组织答案:仅把图附加到提示词仍缺少生成策略。本文基于问题、原文块、RST 树和修辞图生成 discourse-aware plan,规定内容选择、论证流和证据优先级。
  • 方法定位:Disco-RAG 是推理时框架,默认不微调生成器;它优化的是检索后证据组织,而不是召回器本身。

Q4. 方法流程

  1. 用 Qwen3-Embedding-8B 对语料分块并进行 Top-10 语义检索,默认块长 256 tokens。
  2. 对每个检索块执行 EDU 切分和 RST 解析,得到带 nucleus/satellite 角色及修辞关系的块内树;论文说明该步骤可离线完成。
  3. 将全部 Top-k 块一次输入结构模型,预测块对之间的 SUPPORTSCONTRADICTSCAUSES 等有向关系或 UNRELATED,构成跨块修辞图。
  4. 结合原问题、文本块、局部树和全局图生成篇章计划,明确背景、论点、证据、限定与结论的组织方式。
  5. 最终生成器同时条件于原始证据与三类结构信息生成答案或摘要。结构器与生成器解耦,因此可用 8B 模型构图、70B 模型生成。

Q5. 实验设计与结论

  • 任务:Loong 长上下文知识推理(10K-250K tokens,含 locating/comparison/clustering/chain)、ASQA 长答案问答、SciNews 科学新闻通俗摘要。
  • 模型与指标:Llama-3.1-8B、Llama-3.3-70B、Qwen2.5-72B;Loong 用 EM 和 GPT-4-turbo LLM Score,ASQA 用 EM/ROUGE-L/DR,SciNews 用 ROUGE-L/BERTScore/SARI/SummaC。
  • Loong(表 1):Llama-3.3-70B 下整体 LLM Score 从标准 RAG 的 49.33 提升到 62.07,增益 12.74;在最长 Set 4 中为 54.62 vs. 35.61。它也超过 StructRAG 的整体 60.38
  • ASQA(表 2):Llama-3.1-8B 从标准 RAG 的 37.3/36.9/23.4 提升至 40.4/42.2/32.6(EM/RL/DR);Llama-3.3-70B 达到 42.0/42.3/32.8
  • SciNews(表 3):Llama-3.3-70B 达到 RL 21.11、BERTScore 65.67、SARI 44.37、SummaC 69.48,多数指标为最佳。
  • 消融(表 4):完整模型 62.07;去掉 RST 树、修辞图、计划分别降至 56.2257.1059.75。局部树和跨块图贡献高于普通自由计划,说明收益来自结构内容而非“多写了一段提示”。
  • 鲁棒性:在块长变化、Top-k 增至 50、Top-10 中 80% 块被替换为噪声时,Disco-RAG 的退化均小于标准 RAG。结构扰动会稳定降低性能,进一步支持结构质量与结果存在关联。
  • 人评:SciNews 上 15 篇文章、3 名研究生、四维三点量表;Disco-RAG 在相关性、简洁性、精炼度、忠实性上均优于标准 RAG,但低于人工参考。Fleiss’ kappa 为 0.65-0.73

Q6. 局限性

  1. 仅在 Loong、ASQA、SciNews 三个公开英文基准上验证,跨语言、体裁迁移与数据偏差未被系统研究。
  2. 依赖 LLM 执行 RST 解析、跨块关系预测和计划生成,额外调用增加 token、延迟与成本;作者建议缓存离线树、批处理或蒸馏轻量结构器。
  3. 实验只覆盖三种开源模型和固定检索器,尚不能证明对更小模型、专用模型或不同解码策略同样有效。
  4. Loong 的主指标依赖 GPT-4-turbo 自动裁判,可能继承模型偏好;人评规模只有 15 篇文章,统计覆盖有限。
  5. 跨块图需要对 Top-k 块对进行关系判断,k 增大时潜在边数为 O(k^2);论文展示了 Top-50 的效果鲁棒性,但没有完整报告结构阶段的成本曲线。

Q7. 学术价值

Disco-RAG 把篇章分析引入 RAG 的“检索后组织”环节,区分了实体/语义相关性与修辞连贯性。它证明 RAG 的提升不必全部来自更强检索器或微调生成器,显式表示证据的论证角色和跨文档关系也能显著改善长答案合成。三层结构的消融、结构扰动和混合模型部署实验共同增强了因果解释力。

Q8. 延伸研究方向

  1. 仅对不确定或相互冲突的块对做自适应关系预测,降低 O(k^2) 构图成本。
  2. 将检索相关性、RST nucleus 权重和跨块图中心性联合用于二次排序,而不只在生成阶段使用结构。
  3. 训练带置信度校准的修辞解析器,让生成器在结构不可靠时回退到原始证据。
  4. 把引用对齐加入计划,使每个结论显式对应支持/反驳证据,并检测结构图与原文冲突。
  5. 在法律、医学等高风险领域测试修辞关系是否会把“作者论证方式”误当成“事实真值”。

Q9. 反直觉发现与方法失效分析

  • 更多文本不等于更好:Loong 中完整上下文在长输入上显著弱于结构化 Top-k 检索,说明上下文窗口变长不能自动解决证据组织问题。
  • 计划不是最大贡献者:去掉 planning 仅从 62.07 降到 59.75,而去掉 RST 树降至 56.22。真正关键的是高质量结构先验,不是通用的“先计划再回答”。
  • 小结构器也有效:8B 结构器 + 70B 生成器得到 60.52,接近全 70B 的 62.07,说明篇章结构预测可被相对小模型承担。
  • 可能失效的场景:若原文并无清晰修辞结构、块被截断导致 EDU 边界错误,或多个来源的“对比”其实是时间/人群条件差异,错误修辞边会把生成器引向一条连贯但不真实的论证链。结构提示越强,结构错误的放大风险也越高。
Ting WeChat PayWeChat Pay
0%