Ting

Ting

满怀希望就会所向披靡

论文 · Understand What LLM Needs:Dual Preference Alignment for Retrieval-Augmented Generation

基础信息

  • 论文标题:Understand What LLM Needs: Dual Preference Alignment for Retrieval-Augmented Generation
  • 作者:Guanting Dong, Yutao Zhu, Chenghao Zhang, Zechen Wang, Ji-Rong Wen, Zhicheng Dou
  • 会议:WWW 2025

核心贡献:本文提出 DPA-RAG,通过构造 LLM 偏好知识、训练偏好对齐 reranker,并在 SFT 前加入 LLM 自对齐阶段,同时缓解检索器与 LLM 之间的外部偏好错位和 LLM 利用知识时的内部偏好错位,从而在四个知识密集型 QA 数据集上稳定优于传统 RAG、reranker RAG 和已有偏好对齐方法。

论文 · GraphRAG:From Local to Global

基础信息

  • 论文标题:From Local to Global: A GraphRAG Approach to Query-Focused Summarization
  • 作者:Darren Edge, Ha Trinh, Newman Cheng, Joshua Bradley, Alex Chao, Apurva Mody, Steven Truitt, Dasha Metropolitansky, Robert Osazuwa Ness, Jonathan Larson

核心贡献:GraphRAG 将文档集合预处理成 LLM 抽取的实体-关系图,并基于图社区生成层级 community summaries,使系统能够回答面向整个语料库的全局 sensemaking 问题,而不是只回答局部事实检索问题。

论文 · Self-RAG:Learning to Retrieve, Generate, and Critique Through Self-Reflection

基础信息

  • 论文标题:Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection
  • 作者:Akari Asai, Zeqiu Wu, Yizhong Wang, Avirup Sil, Hannaneh Hajishirzi
  • 机构:University of Washington, Allen Institute for AI, IBM Research AI

核心贡献:Self-RAG 训练语言模型在生成过程中按需检索、评估检索证据、判断生成内容是否被证据支持,并用 reflection tokens 控制推理过程,从而提升知识密集型任务中的 factuality、citation accuracy 和整体生成质量。

论文 · Memory综述

基础信息

  • 会议/期刊:arXiv preprint, 2026
  • 关键词:memory governance, selective forgetting, retrieval, conditional success probability, Bayesian update

核心贡献:本文首次系统综述 LLM-based agents 的 memory mechanism,给出狭义/广义 memory 定义,并从 memory sources、memory forms、memory operations、evaluation 和 applications 已有研究。

论文 · RAG综述

基础信息

  • 会议/期刊:arXiv preprint, 2026
  • 关键词:memory governance, selective forgetting, retrieval, conditional success probability, Bayesian update

核心贡献:本文从信息检索视角把文本 RAG 统一拆解为 pre-retrieval、retrieval、post-retrieval、generation 四个阶段,并系统梳理每一阶段的典型技术、评估框架、系统挑战与未来方向。

论文 · Just-in-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates

基础信息

  • 论文标题:Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates
  • 发表信息:ICML 2026, PMLR 306
  • 代码:https://github.com/liushiliushi/JitRL
  • 关键词:LLM Agent, continual learning, test-time learning, reinforcement learning, non-parametric memory, logit update
  • 核心贡献:论文提出 JitRL,一个无需梯度更新的测试时强化学习框架,通过存储历史轨迹、检索相似经验、估计动作优势并直接调整 LLM 输出 logits,使冻结权重的 LLM agent 能在部署过程中持续学习;作者证明该加性 logit 更新是 KL 约束策略优化目标的闭式解,并在 WebArena 与 Jericho 上取得训练免费方法中的最好结果,且相较 WebRL 将成本降低 30 倍以上。
  • 主要结论:在 WebArena 主实验中,JitRL 的平均 / 最终成功率为 46.98% / 51.35%,高于所有训练免费基线;在 WebArena-Lite 上,JitRL 最终成功率 60.00%,高于 WebRL 的 46.06%;在 Jericho 中,JitRL 在 Library、Zork1、Zork3 的平均分分别为 25.9、53.0、3.1,均高于训练免费与 GRPO 基线。

Q1. 研究动机

部署后的 LLM agent 权重通常被冻结,面对新环境或动态任务时会重复犯错,缺少类似人类的“边做边学”能力。传统 RL 可更新策略,但成本高、样本需求大且有灾难性遗忘风险;纯 ICL / 反思 / 记忆方法又受上下文长度和文本提示能力限制。因此作者希望让 agent 在不训练参数的情况下,从交互经验中持续改进。

0%