# 论文 · STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering


## 基础信息
* 作者：Wei Chen, Lili Zhao, Zhi Zheng, Huijun Hou, Tong Xu
* 期刊/日期：SIGIR 2026，2026-07-20 至 2026-07-24
* DOI：10.1145/3805712.3809703
* 代码：https://github.com/fanshu6hao/STRIDE

## Q1. 研究动机

多跳问答不仅要反复检索，还要决定“先解决哪一步、哪些步骤能并行、什么时候不必检索而应直接推理”。现有迭代式 RAG 常把原问题直接拆成绑定具体实体的子问题，容易因同名实体或词义歧义在第一步就选错对象，并将错误沿推理链放大；同时它们通常按固定顺序执行子问题，忽略顺序依赖、并行分支和 fork-join 等结构，造成冗余检索、证据冲突及跨分支信息无法融合。

论文的核心动机是把多跳 RAG 从“连续生成若干查询”重新定义为一个分层决策过程：先建立不依赖具体实体的推理结构，再对任务进行动态调度，最后把检索、事实抽取与逻辑推理解耦。

## Q2. 核心问题

论文试图回答三个问题：

1. 能否先生成实体无关的抽象推理骨架，再实例化为具体子问题，从而降低词汇歧义导致的级联错误？
2. 能否用一个全局控制器显式建模子问题依赖，并动态选择顺序、并行、改写或直接推理？
3. 能否仅利用系统自身的执行轨迹，分别微调规划、调度、抽取和推理模块，而不依赖人工标注或更强教师模型？

## Q3. 现有不足 &amp; 本文改进

* **过早实体落地**：直接围绕实体生成子问题，容易把电影 *Lincoln* 错当作人物 Lincoln。STRIDE 的 Meta-Planner 先产生 General Strategy，例如“电影 -&gt; 原著 -&gt; 作者”，再生成实体化的 Concrete Plan。
* **固定串行执行**：传统方法无法表达独立分支或依赖关系。Supervisor 维护已完成集合、待处理集合和失败查询记录，根据依赖关系调度顺序、并行和 fork-join 执行。
* **检索与推理不分**：所有步骤都发起检索会产生浪费。Supervisor 对每个就绪子问题选择 `retrieve`、`rewrite` 或 `answer`，已有事实足够时直接推理。
* **失败恢复弱**：检索无结果时记录失败查询，下一轮语义改写；到达最大迭代次数仍未完成时，由 Fallback Reasoner 基于已有计划与事实给出尽力回答。
* **开源小模型结构化能力不足**：STRIDE-FT 从自执行轨迹为四个模块构造不同训练信号，包括 Meta-Planner 的 DPO 偏好对、Supervisor 的成功改写样本、Extractor 的最小充分事实以及 Reasoner 的简洁答案样本。

## Q4. 方法流程

1. **战略层**：Meta-Planner 输入问题，输出实体无关的 General Strategy 和带实体的 Concrete Plan。
2. **控制层**：Supervisor 维护执行状态，找出依赖已满足的子问题，并为其选择检索、改写或直接回答。独立子问题可并行，依赖节点等待前置结果。
3. **执行层**：若需检索，Contriever/FAISS 返回文档，Extractor 抽取原子事实，Reasoner 只基于事实回答；若只需推理，Reasoner 使用全部累计事实。
4. **迭代与恢复**：成功结果写回状态，失败查询进入失败集合并触发改写；最多迭代 5 轮，未完成则进入 Fallback Reasoner。
5. **模块化自训练**：每题采样 8 个计划并执行。计划以最终正确性、F1、迭代次数和失败状态评分；四个模块分别用 DPO 或 SFT 做 LoRA 微调。

该设计的关键不是增加一个更强生成器，而是把“怎么推理”“下一步做什么”“如何执行”分开，使每层拥有明确职责和可检查状态。

## Q5. 实验设计与结论

* **数据与设置**：2WikiMultihopQA、HotpotQA、MuSiQue，各 1,000 个问题；主干为 Qwen3-8B，并以 GPT-4o-mini 验证跨模型适用性。最大迭代 5 轮，默认 Top-k=5，STRIDE 在 2Wiki 和 MuSiQue 使用 k=3。指标为 EM、F1、Precision、Recall。
* **主结果（表 1）**：在 Qwen3-8B 上，STRIDE-FT 达到 2Wiki `0.738/0.796`、HotpotQA `0.601/0.691`、MuSiQue `0.350/0.448`（EM/F1）。训练前 STRIDE 在 MuSiQue 上也明显超过 DualRAG：GPT-4o-mini 下 F1 `0.467 vs. 0.399`，Qwen3-8B 下 `0.401 vs. 0.316`。
* **消融（表 2、3）**：删除 Supervisor 的损失最大，MuSiQue EM 从 `0.288` 降到 `0.183`；删除 Meta-Planner 使 2Wiki EM 从 `0.692` 降到 `0.495`。微调消融中，Reasoner-FT 最重要，去除后 2Wiki EM 下降 `0.037`。
* **改写与鲁棒性**：成功改写比例由 STRIDE 的平均 `40.3%` 提升到 STRIDE-FT 的 `58.7%`；扩大到每个数据集 50K 文档后，STRIDE 的相对退化最小。
* **效率（表 5）**：STRIDE 平均 F1 为 `0.609`，高于 GenGround 的 `0.557` 和 DualRAG 的 `0.555`；相对 DualRAG，token 减少 `54%-71%`、时间减少 `60%-80%`。但它仍比轻量 GenGround 更慢。
* **结论**：抽象规划对检索场景尤其有效，动态调度是性能增益的最大来源；模块化自训练能让 8B 开源模型接近或超过闭源模型在部分数据集上的表现。

## Q6. 局限性

1. 论文没有独立的 Limitations 章节。实验语料由各数据集的金标准支持文档与干扰文档汇总而成，虽补充了 50K 文档实验，但仍不能完全代表开放网络中的时效性、恶意内容和跨域噪声。
2. 系统包含 Meta-Planner、Supervisor、Extractor、Reasoner 和 Fallback 多次 LLM 调用，工程复杂度与延迟高于单轮 RAG；表 5 也表明其时间开销高于 GenGround。
3. MuSiQue 中 Meta-Plan 的规划错误几乎未下降（表 6：`230 -&gt; 234`），说明抽象规划并不能解决高深度任务的所有规划失败，只是降低了后续检索和执行错误。
4. 错误归因依赖 DeepSeek-V3.2 在金文档条件下判断计划是否正确，该自动判别本身可能有偏差。
5. 自训练仅从最终结果反推模块质量，可能把偶然成功的轨迹当作正例；Extractor 还用同一冻结模型选择“最小事实”，存在自举偏差。

## Q7. 学术价值

论文最有价值的贡献是把迭代 RAG 的控制问题形式化为分层决策，而不再只研究“如何生成下一条查询”。实体无关的策略层提高了计划可迁移性，Supervisor 则把依赖调度、失败恢复和检索/推理选择统一为显式动作空间。STRIDE-FT 进一步说明，复杂 Agent/RAG 系统可按模块职责从自身轨迹构造监督，而不是用一个统一目标端到端微调。

## Q8. 延伸研究方向

1. 将 Concrete Plan 显式表示为 DAG，并用可验证的依赖约束代替自然语言计划。
2. 学习成本敏感的 Supervisor，将准确率、延迟、token 与检索次数纳入同一决策目标。
3. 用校准过的事实置信度和来源可靠性驱动“继续检索还是直接推理”，而非只判断事实是否为空。
4. 对自生成轨迹使用反事实验证，例如删除某次改写后重放流程，以确认该动作对成功是否真正具有因果贡献。
5. 在持续更新、跨语言和 Web 规模语料上验证实体歧义与调度鲁棒性。

## Q9. 反直觉发现与方法失效分析

* **小模型不一定全面弱于闭源模型**：Qwen3-8B 在结构较规整的 2Wiki 上 EM 高于 GPT-4o-mini（`0.692 vs. 0.661`），但在更深的 MuSiQue 上相反，说明“指令可控性”和“语言理解/泛化”对不同任务的贡献不同。
* **更大的 Top-k 不一定更好**：STRIDE 在 2Wiki 上 k=3 达到峰值，k=5 或 8 仅有边际收益，表明结构化子问题可降低对宽检索的依赖。
* **Meta-Plan 的主要收益不只在计划正确率**：MuSiQue 的规划错误没有改善，但检索与执行错误下降，说明一个不完美但更可执行的计划仍能提升端到端表现。
* **最可能的失效链**：抽象骨架误判关系 -&gt; Concrete Plan 产生错误依赖 -&gt; Supervisor 高效地执行错误计划。Fallback 只能保证输出，不能保证事实正确；因此需要在计划层引入验证或多计划竞争，而不只是执行层恢复。


---

> Author: [Ting](Tin10g.github.io)  
> URL: http://localhost:1313/posts/%E8%AE%BA%E6%96%87%E9%98%85%E8%AF%BB-stride-strategic-iterative-decision-making-for-retrieval-augmented-multi-hop-question-answering/  

