Ting

Ting

满怀希望就会所向披靡

论文 · the Behavioral Fabric of LLM-Powered GUI Agents Human Values and Interaction Outcomes

基础信息

  • 标题:The Behavioral Fabric of LLM-Powered GUI Agents: Human Values and Interaction Outcomes
  • 类型:Human values / GUI agent behavior empirical study
  • 核心贡献:构建 Web GUI agent 行为测试床,注入 12 类人类 values 和 preferences,实证分析价值/偏好提示如何影响 agent 的推理、轨迹、对齐结果和隐性价值偏向。

Q1. 研究动机

LLM-powered GUI agents 正逐渐代表用户在网页中决策,但我们对用户偏好和抽象价值如何影响 agent 行为了解有限。作者关注的不只是任务是否成功,而是 agent 是否会在操作路径和最终选择中体现用户价值。

论文 · How to Train Long-Context Language Models (Effectively)

基础信息

  • 论文:How to Train Long-Context Language Models (Effectively)
  • 作者:Tianyu Gao, Alexander Wettig, Howard Yen, Danqi Chen
  • 会议:ACL 2025 Long Papers
  • 主题:long-context continual pre-training, SFT, data mixture, evaluation protocol, ProLong
  • 核心贡献:本文系统研究如何把短上下文 LM 继续训练成有效长上下文模型,提出以 HELMET 和 SFT 后评测为核心的训练决策流程,并用 code repos + books + ShortMix + UltraChat SFT 得到 ProLong-8B,在 128K 长上下文任务上达到同规模开源模型领先水平,同时可处理到 512K tokens。

Q1. 研究动机

长上下文模型已经支持书籍级 QA、长文总结和 many-shot in-context learning,但开源社区缺少可靠的训练 recipe。已有工作常用 perplexity 或 Needle-in-a-Haystack 做开发指标,容易把“能找针”误判为“能做真实长上下文任务”。同时,长上下文训练常牺牲短文本能力,因此作者希望系统回答:数据怎么配、训练长度怎么选、SFT 是否需要长合成指令、评测应该怎么看。

论文 · LongBench V2: Towards Deeper Understanding and Reasoning on Realistic Long-Context Multitasks

基础信息

  • 论文:LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
  • 作者:Yushi Bai, Shangqing Tu, Jiajie Zhang, Hao Peng, Xiaozhi Wang, Xin Lv, Shulin Cao, Jiazheng Xu, Yuxiao Dong, Jie Tang, Lei Hou, Juanzi Li
  • 会议:ACL 2025 Long Papers
  • 主题:long-context benchmark, deep understanding, reasoning, multiple-choice evaluation
  • 核心贡献:本文构建 LongBench v2,一个包含 503 道多选题、上下文长度从 8K 到 2M words、覆盖 6 大类真实长上下文任务的 benchmark,用自动和人工双重审核确保题目难度与可靠性,显示当前 LLM 即使拥有长窗口,也仍难以完成需要深层理解和推理的长上下文任务。

Q1. 研究动机

近一年 LLM context window 从 8K 扩展到 128K、1M 甚至更长,但长窗口不等于真正理解长文本。已有 benchmark 往往偏抽取式检索、synthetic recall、F1/ROUGE 或 LLM-as-judge,不能稳定评估真实长文档中的理解、学习和推理能力。作者希望构建一个更难、更可靠、更贴近现实的长上下文评测。

论文 · LongReD: Mitigating Short-Text Degradation of Long-Context Large Language Models via Restoration Distillation

基础信息

  • 论文:LongReD: Mitigating Short-Text Degradation of Long-Context Large Language Models via Restoration Distillation
  • 作者:Zican Dong, Junyi Li, Jinhao Jiang, Mingyu Xu, Wayne Xin Zhao, Bingning Wang, Weipeng Chen
  • 会议:ACL 2025 Long Papers
  • 主题:context window extension, short-text degradation, restoration distillation, catastrophic forgetting
  • 核心贡献:本文指出长上下文扩展后短文本能力下降主要来自 hidden/attention 分布漂移和 continual pre-training 的灾难性遗忘,并提出 LongReD,在长文本训练之外加入短文本隐藏层蒸馏和 short-to-long 输出蒸馏,以保留短文本能力并维持可比的长上下文能力。

Q1. 研究动机

许多长上下文扩展方法通过 RoPE scaling 加轻量 continued pre-training,把窗口扩到 128K 或更长,但 Figure 1 显示这些方法会损害 MMLU、HumanEval、PIQA、TriviaQA 等短文本任务。以往工作多关注如何扩长和提升长任务,较少解释短文本退化的原因,也缺少专门修复这种退化的训练策略。

论文 · MrRoPE: Mixed-Radix Rotary Position Embedding

基础信息

  • 论文:MrRoPE: Mixed-radix Rotary Position Embedding
  • 作者:Qingyuan Tian, Wenhong Zhu, Xiaoran Liu, Xiaofeng Wang, Rui Wang
  • 会议:ICLR 2026
  • 主题:RoPE extension, radix conversion, training-free long-context extrapolation
  • 核心贡献:本文把 RoPE 扩展统一解释为 mixed-radix conversion,指出 NTK、YaRN 等方法是不同的 radix conversion 策略,并提出训练免费的 MrRoPE-Pro,用 progressive radix conversion 改善中频维度缩放,在 NIAH、RULER、Infinite-Bench 等长上下文任务上优于 YaRN。

Q1. 研究动机

RoPE 是许多 LLM 的位置编码基础,但模型在训练窗口之外会遇到未见过的旋转角,导致长上下文泛化失败。已有训练免费扩展方法如 NTK、YaRN 各自有效,但理论解释分散,尤其是中间频率维度应如何缩放缺少统一原则。作者希望建立一个能解释和设计 RoPE extension 的统一框架。

0%