# 论文 · Disco-RAG: Discourse-Aware Retrieval-Augmented Generation


## 基础信息
* 作者：Dongqi Liu, Hang Ding, Qiming Feng, Xurong Xie, Zhucun Xue, Chengjie Wang, Jian Li, Jiangning Zhang, Yabiao Wang
* 期刊/日期：ACL 2026 Long Papers，2026-07-02 至 2026-07-07，页 4106-4136
* 项目：https://dongqi.me/projects/Disco-RAG

## Q1. 研究动机

标准 RAG 把 Top-k 文本块当作无结构的“事实袋”。即使每个块都相关，生成器也未必知道块内哪些句子是核心主张、哪些是限定条件，也不知道块间是支持、对比、因果还是冲突关系。由此会出现两类结构盲区：块内无法识别局部论证层级，块间无法恢复跨文档连贯性。例如，一篇证据称维生素 D 使缺乏者在冬季的流感率下降，另一篇称总体效应不显著；扁平拼接容易把条件性结果错误泛化为普遍结论。

论文据此提出：RAG 的问题不只是召回不足，还存在“检索粒度与生成理解粒度不匹配”。生成前应显式恢复修辞结构，并用其规划最终答案的论证顺序。

## Q2. 核心问题

在检索器和解码条件不变时，把篇章知识作为结构先验注入生成过程，是否能提高答案/摘要的正确性、连贯性与事实一致性？更具体地说，局部 RST 树、跨块修辞图和篇章驱动计划各自是否有独立贡献，以及这种收益在长上下文、噪声检索和不同模型规模下是否稳定？

## Q3. 现有不足 &amp; 本文改进

* **块内结构盲区**：普通 RAG 不区分 nucleus（核心）与 satellite（补充），也不识别 Elaboration、Cause、Contrast 等关系。Disco-RAG 为每个块离线构造 RST 树。
* **块间连贯性缺失**：实体图主要表达“谁与谁有关”，未必表达论证关系。本文在一次 listwise 推理中预测所有文本块对的有向修辞关系或 `UNRELATED`，形成跨块图。
* **结构有了但不会组织答案**：仅把图附加到提示词仍缺少生成策略。本文基于问题、原文块、RST 树和修辞图生成 discourse-aware plan，规定内容选择、论证流和证据优先级。
* **方法定位**：Disco-RAG 是推理时框架，默认不微调生成器；它优化的是检索后证据组织，而不是召回器本身。

## Q4. 方法流程

1. 用 Qwen3-Embedding-8B 对语料分块并进行 Top-10 语义检索，默认块长 256 tokens。
2. 对每个检索块执行 EDU 切分和 RST 解析，得到带 nucleus/satellite 角色及修辞关系的块内树；论文说明该步骤可离线完成。
3. 将全部 Top-k 块一次输入结构模型，预测块对之间的 `SUPPORTS`、`CONTRADICTS`、`CAUSES` 等有向关系或 `UNRELATED`，构成跨块修辞图。
4. 结合原问题、文本块、局部树和全局图生成篇章计划，明确背景、论点、证据、限定与结论的组织方式。
5. 最终生成器同时条件于原始证据与三类结构信息生成答案或摘要。结构器与生成器解耦，因此可用 8B 模型构图、70B 模型生成。

## Q5. 实验设计与结论

* **任务**：Loong 长上下文知识推理（10K-250K tokens，含 locating/comparison/clustering/chain）、ASQA 长答案问答、SciNews 科学新闻通俗摘要。
* **模型与指标**：Llama-3.1-8B、Llama-3.3-70B、Qwen2.5-72B；Loong 用 EM 和 GPT-4-turbo LLM Score，ASQA 用 EM/ROUGE-L/DR，SciNews 用 ROUGE-L/BERTScore/SARI/SummaC。
* **Loong（表 1）**：Llama-3.3-70B 下整体 LLM Score 从标准 RAG 的 `49.33` 提升到 `62.07`，增益 `12.74`；在最长 Set 4 中为 `54.62 vs. 35.61`。它也超过 StructRAG 的整体 `60.38`。
* **ASQA（表 2）**：Llama-3.1-8B 从标准 RAG 的 `37.3/36.9/23.4` 提升至 `40.4/42.2/32.6`（EM/RL/DR）；Llama-3.3-70B 达到 `42.0/42.3/32.8`。
* **SciNews（表 3）**：Llama-3.3-70B 达到 RL `21.11`、BERTScore `65.67`、SARI `44.37`、SummaC `69.48`，多数指标为最佳。
* **消融（表 4）**：完整模型 `62.07`；去掉 RST 树、修辞图、计划分别降至 `56.22`、`57.10`、`59.75`。局部树和跨块图贡献高于普通自由计划，说明收益来自结构内容而非“多写了一段提示”。
* **鲁棒性**：在块长变化、Top-k 增至 50、Top-10 中 80% 块被替换为噪声时，Disco-RAG 的退化均小于标准 RAG。结构扰动会稳定降低性能，进一步支持结构质量与结果存在关联。
* **人评**：SciNews 上 15 篇文章、3 名研究生、四维三点量表；Disco-RAG 在相关性、简洁性、精炼度、忠实性上均优于标准 RAG，但低于人工参考。Fleiss&#39; kappa 为 `0.65-0.73`。

## Q6. 局限性

1. 仅在 Loong、ASQA、SciNews 三个公开英文基准上验证，跨语言、体裁迁移与数据偏差未被系统研究。
2. 依赖 LLM 执行 RST 解析、跨块关系预测和计划生成，额外调用增加 token、延迟与成本；作者建议缓存离线树、批处理或蒸馏轻量结构器。
3. 实验只覆盖三种开源模型和固定检索器，尚不能证明对更小模型、专用模型或不同解码策略同样有效。
4. Loong 的主指标依赖 GPT-4-turbo 自动裁判，可能继承模型偏好；人评规模只有 15 篇文章，统计覆盖有限。
5. 跨块图需要对 Top-k 块对进行关系判断，k 增大时潜在边数为 O(k^2)；论文展示了 Top-50 的效果鲁棒性，但没有完整报告结构阶段的成本曲线。

## Q7. 学术价值

Disco-RAG 把篇章分析引入 RAG 的“检索后组织”环节，区分了实体/语义相关性与修辞连贯性。它证明 RAG 的提升不必全部来自更强检索器或微调生成器，显式表示证据的论证角色和跨文档关系也能显著改善长答案合成。三层结构的消融、结构扰动和混合模型部署实验共同增强了因果解释力。

## Q8. 延伸研究方向

1. 仅对不确定或相互冲突的块对做自适应关系预测，降低 O(k^2) 构图成本。
2. 将检索相关性、RST nucleus 权重和跨块图中心性联合用于二次排序，而不只在生成阶段使用结构。
3. 训练带置信度校准的修辞解析器，让生成器在结构不可靠时回退到原始证据。
4. 把引用对齐加入计划，使每个结论显式对应支持/反驳证据，并检测结构图与原文冲突。
5. 在法律、医学等高风险领域测试修辞关系是否会把“作者论证方式”误当成“事实真值”。

## Q9. 反直觉发现与方法失效分析

* **更多文本不等于更好**：Loong 中完整上下文在长输入上显著弱于结构化 Top-k 检索，说明上下文窗口变长不能自动解决证据组织问题。
* **计划不是最大贡献者**：去掉 planning 仅从 `62.07` 降到 `59.75`，而去掉 RST 树降至 `56.22`。真正关键的是高质量结构先验，不是通用的“先计划再回答”。
* **小结构器也有效**：8B 结构器 &#43; 70B 生成器得到 `60.52`，接近全 70B 的 `62.07`，说明篇章结构预测可被相对小模型承担。
* **可能失效的场景**：若原文并无清晰修辞结构、块被截断导致 EDU 边界错误，或多个来源的“对比”其实是时间/人群条件差异，错误修辞边会把生成器引向一条连贯但不真实的论证链。结构提示越强，结构错误的放大风险也越高。


---

> Author: [Ting](Tin10g.github.io)  
> URL: http://localhost:1313/posts/%E8%AE%BA%E6%96%87%E9%98%85%E8%AF%BB-disco-rag-discourse-aware-retrieval-augmented-generation/  

