Ting

Ting

满怀希望就会所向披靡

论文 · Large Language Models Empowered Personalized Web Agents

基础信息

  • 标题:Large Language Models Empowered Personalized Web Agents
  • 类型:Benchmark + personalized Web agent framework
  • 核心贡献:提出 PersonalWAB 个性化 Web agent benchmark 和 PUMA 框架,通过长期用户记忆、SFT 与 DPO 让 Web agent 更好地根据用户历史行为生成函数参数和执行个性化任务。

Q1. 研究动机

现有 Web agent 多关注通用网页导航和工具调用,较少评测 agent 是否能利用用户长期偏好完成个性化任务。真实 Web 场景中的搜索、推荐和评论生成都依赖用户历史行为,因此需要专门 benchmark 和对齐方法。

论文 · RepairAgent_An_Autonomous_LLM-Based_Agent_for_Program_Repair

基础信息

  • 标题:RepairAgent: An Autonomous LLM-Based Agent for Program Repair
  • 类型:Automated Program Repair / LLM agent
  • 核心贡献:提出 RepairAgent,一个基于 GPT-3.5、14 个工具、动态 prompt 和有限状态机控制的自治程序修复 agent,在 Defects4J 和 GitBug-Java 上验证其自动修复能力。

Q1. 研究动机

传统自动程序修复方法通常依赖预定义模板、搜索策略或专门训练模型,而 LLM 具备理解代码和生成补丁的能力。作者希望探索 LLM 是否能作为自治 agent,通过读取代码、搜索、运行测试和编辑文件完成端到端修复。

论文 · Scenario-Guided LLM-Based Mobile App GUI Testing

基础信息

  • 标题:Scenario-Guided LLM-based Mobile App GUI Testing
  • 类型:Mobile GUI testing / multi-agent framework
  • 核心贡献:提出 ScenGen,一个场景引导的 LLM-based 移动 GUI 测试框架,通过多 agent 协作、视觉定位、自校正和完成度判断生成更贴合用户场景的测试序列并发现真实 crash bugs。

Q1. 研究动机

移动 GUI 测试需要覆盖真实用户场景,而传统随机或模型驱动工具常偏向广泛探索,LLM-based 方法又容易受动态界面、控件定位和完成判断影响。作者希望用场景目标约束探索,让测试既符合业务流程又能发现场景内缺陷。

论文 · the Behavioral Fabric of LLM-Powered GUI Agents Human Values and Interaction Outcomes

基础信息

  • 标题:The Behavioral Fabric of LLM-Powered GUI Agents: Human Values and Interaction Outcomes
  • 类型:Human values / GUI agent behavior empirical study
  • 核心贡献:构建 Web GUI agent 行为测试床,注入 12 类人类 values 和 preferences,实证分析价值/偏好提示如何影响 agent 的推理、轨迹、对齐结果和隐性价值偏向。

Q1. 研究动机

LLM-powered GUI agents 正逐渐代表用户在网页中决策,但我们对用户偏好和抽象价值如何影响 agent 行为了解有限。作者关注的不只是任务是否成功,而是 agent 是否会在操作路径和最终选择中体现用户价值。

Synonym List

题目表达 原文表达 关系 备注
feel it is unlikely that they will return once-in-a-lifetime visit 同义词:否定之否定

论文 · How to Train Long-Context Language Models (Effectively)

基础信息

  • 论文:How to Train Long-Context Language Models (Effectively)
  • 作者:Tianyu Gao, Alexander Wettig, Howard Yen, Danqi Chen
  • 会议:ACL 2025 Long Papers
  • 主题:long-context continual pre-training, SFT, data mixture, evaluation protocol, ProLong
  • 核心贡献:本文系统研究如何把短上下文 LM 继续训练成有效长上下文模型,提出以 HELMET 和 SFT 后评测为核心的训练决策流程,并用 code repos + books + ShortMix + UltraChat SFT 得到 ProLong-8B,在 128K 长上下文任务上达到同规模开源模型领先水平,同时可处理到 512K tokens。

Q1. 研究动机

长上下文模型已经支持书籍级 QA、长文总结和 many-shot in-context learning,但开源社区缺少可靠的训练 recipe。已有工作常用 perplexity 或 Needle-in-a-Haystack 做开发指标,容易把“能找针”误判为“能做真实长上下文任务”。同时,长上下文训练常牺牲短文本能力,因此作者希望系统回答:数据怎么配、训练长度怎么选、SFT 是否需要长合成指令、评测应该怎么看。

0%