论文 · STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering
Contents
基础信息
- 作者:Wei Chen, Lili Zhao, Zhi Zheng, Huijun Hou, Tong Xu
- 期刊/日期:SIGIR 2026,2026-07-20 至 2026-07-24
- DOI:10.1145/3805712.3809703
- 代码:https://github.com/fanshu6hao/STRIDE
Q1. 研究动机
多跳问答不仅要反复检索,还要决定“先解决哪一步、哪些步骤能并行、什么时候不必检索而应直接推理”。现有迭代式 RAG 常把原问题直接拆成绑定具体实体的子问题,容易因同名实体或词义歧义在第一步就选错对象,并将错误沿推理链放大;同时它们通常按固定顺序执行子问题,忽略顺序依赖、并行分支和 fork-join 等结构,造成冗余检索、证据冲突及跨分支信息无法融合。
论文的核心动机是把多跳 RAG 从“连续生成若干查询”重新定义为一个分层决策过程:先建立不依赖具体实体的推理结构,再对任务进行动态调度,最后把检索、事实抽取与逻辑推理解耦。
Q2. 核心问题
论文试图回答三个问题:
- 能否先生成实体无关的抽象推理骨架,再实例化为具体子问题,从而降低词汇歧义导致的级联错误?
- 能否用一个全局控制器显式建模子问题依赖,并动态选择顺序、并行、改写或直接推理?
- 能否仅利用系统自身的执行轨迹,分别微调规划、调度、抽取和推理模块,而不依赖人工标注或更强教师模型?
Q3. 现有不足 & 本文改进
- 过早实体落地:直接围绕实体生成子问题,容易把电影 Lincoln 错当作人物 Lincoln。STRIDE 的 Meta-Planner 先产生 General Strategy,例如“电影 -> 原著 -> 作者”,再生成实体化的 Concrete Plan。
- 固定串行执行:传统方法无法表达独立分支或依赖关系。Supervisor 维护已完成集合、待处理集合和失败查询记录,根据依赖关系调度顺序、并行和 fork-join 执行。
- 检索与推理不分:所有步骤都发起检索会产生浪费。Supervisor 对每个就绪子问题选择
retrieve、rewrite或answer,已有事实足够时直接推理。 - 失败恢复弱:检索无结果时记录失败查询,下一轮语义改写;到达最大迭代次数仍未完成时,由 Fallback Reasoner 基于已有计划与事实给出尽力回答。
- 开源小模型结构化能力不足:STRIDE-FT 从自执行轨迹为四个模块构造不同训练信号,包括 Meta-Planner 的 DPO 偏好对、Supervisor 的成功改写样本、Extractor 的最小充分事实以及 Reasoner 的简洁答案样本。
Q4. 方法流程
- 战略层:Meta-Planner 输入问题,输出实体无关的 General Strategy 和带实体的 Concrete Plan。
- 控制层:Supervisor 维护执行状态,找出依赖已满足的子问题,并为其选择检索、改写或直接回答。独立子问题可并行,依赖节点等待前置结果。
- 执行层:若需检索,Contriever/FAISS 返回文档,Extractor 抽取原子事实,Reasoner 只基于事实回答;若只需推理,Reasoner 使用全部累计事实。
- 迭代与恢复:成功结果写回状态,失败查询进入失败集合并触发改写;最多迭代 5 轮,未完成则进入 Fallback Reasoner。
- 模块化自训练:每题采样 8 个计划并执行。计划以最终正确性、F1、迭代次数和失败状态评分;四个模块分别用 DPO 或 SFT 做 LoRA 微调。
该设计的关键不是增加一个更强生成器,而是把“怎么推理”“下一步做什么”“如何执行”分开,使每层拥有明确职责和可检查状态。
Q5. 实验设计与结论
- 数据与设置:2WikiMultihopQA、HotpotQA、MuSiQue,各 1,000 个问题;主干为 Qwen3-8B,并以 GPT-4o-mini 验证跨模型适用性。最大迭代 5 轮,默认 Top-k=5,STRIDE 在 2Wiki 和 MuSiQue 使用 k=3。指标为 EM、F1、Precision、Recall。
- 主结果(表 1):在 Qwen3-8B 上,STRIDE-FT 达到 2Wiki
0.738/0.796、HotpotQA0.601/0.691、MuSiQue0.350/0.448(EM/F1)。训练前 STRIDE 在 MuSiQue 上也明显超过 DualRAG:GPT-4o-mini 下 F10.467 vs. 0.399,Qwen3-8B 下0.401 vs. 0.316。 - 消融(表 2、3):删除 Supervisor 的损失最大,MuSiQue EM 从
0.288降到0.183;删除 Meta-Planner 使 2Wiki EM 从0.692降到0.495。微调消融中,Reasoner-FT 最重要,去除后 2Wiki EM 下降0.037。 - 改写与鲁棒性:成功改写比例由 STRIDE 的平均
40.3%提升到 STRIDE-FT 的58.7%;扩大到每个数据集 50K 文档后,STRIDE 的相对退化最小。 - 效率(表 5):STRIDE 平均 F1 为
0.609,高于 GenGround 的0.557和 DualRAG 的0.555;相对 DualRAG,token 减少54%-71%、时间减少60%-80%。但它仍比轻量 GenGround 更慢。 - 结论:抽象规划对检索场景尤其有效,动态调度是性能增益的最大来源;模块化自训练能让 8B 开源模型接近或超过闭源模型在部分数据集上的表现。
Q6. 局限性
- 论文没有独立的 Limitations 章节。实验语料由各数据集的金标准支持文档与干扰文档汇总而成,虽补充了 50K 文档实验,但仍不能完全代表开放网络中的时效性、恶意内容和跨域噪声。
- 系统包含 Meta-Planner、Supervisor、Extractor、Reasoner 和 Fallback 多次 LLM 调用,工程复杂度与延迟高于单轮 RAG;表 5 也表明其时间开销高于 GenGround。
- MuSiQue 中 Meta-Plan 的规划错误几乎未下降(表 6:
230 -> 234),说明抽象规划并不能解决高深度任务的所有规划失败,只是降低了后续检索和执行错误。 - 错误归因依赖 DeepSeek-V3.2 在金文档条件下判断计划是否正确,该自动判别本身可能有偏差。
- 自训练仅从最终结果反推模块质量,可能把偶然成功的轨迹当作正例;Extractor 还用同一冻结模型选择“最小事实”,存在自举偏差。
Q7. 学术价值
论文最有价值的贡献是把迭代 RAG 的控制问题形式化为分层决策,而不再只研究“如何生成下一条查询”。实体无关的策略层提高了计划可迁移性,Supervisor 则把依赖调度、失败恢复和检索/推理选择统一为显式动作空间。STRIDE-FT 进一步说明,复杂 Agent/RAG 系统可按模块职责从自身轨迹构造监督,而不是用一个统一目标端到端微调。
Q8. 延伸研究方向
- 将 Concrete Plan 显式表示为 DAG,并用可验证的依赖约束代替自然语言计划。
- 学习成本敏感的 Supervisor,将准确率、延迟、token 与检索次数纳入同一决策目标。
- 用校准过的事实置信度和来源可靠性驱动“继续检索还是直接推理”,而非只判断事实是否为空。
- 对自生成轨迹使用反事实验证,例如删除某次改写后重放流程,以确认该动作对成功是否真正具有因果贡献。
- 在持续更新、跨语言和 Web 规模语料上验证实体歧义与调度鲁棒性。
Q9. 反直觉发现与方法失效分析
- 小模型不一定全面弱于闭源模型:Qwen3-8B 在结构较规整的 2Wiki 上 EM 高于 GPT-4o-mini(
0.692 vs. 0.661),但在更深的 MuSiQue 上相反,说明“指令可控性”和“语言理解/泛化”对不同任务的贡献不同。 - 更大的 Top-k 不一定更好:STRIDE 在 2Wiki 上 k=3 达到峰值,k=5 或 8 仅有边际收益,表明结构化子问题可降低对宽检索的依赖。
- Meta-Plan 的主要收益不只在计划正确率:MuSiQue 的规划错误没有改善,但检索与执行错误下降,说明一个不完美但更可执行的计划仍能提升端到端表现。
- 最可能的失效链:抽象骨架误判关系 -> Concrete Plan 产生错误依赖 -> Supervisor 高效地执行错误计划。Fallback 只能保证输出,不能保证事实正确;因此需要在计划层引入验证或多计划竞争,而不只是执行层恢复。
WeChat Pay