Ting

Ting

满怀希望就会所向披靡

论文 · Android Agent Arena for Mobile GUI Agents With Essential-State Procedural Evaluation

基础信息

  • 标题:Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation
  • 类型:Benchmark / evaluation system
  • 核心贡献:提出 A3,一个面向动态在线 Android app 的 GUI agent 评测系统,包含 20 个主流在线 app、100 个任务、essential-state 程序化评测方法和 A3RM reward model。

Q1. 研究动机

移动 GUI agent 的评测长期依赖静态截图、离线 app 或可插桩的开源应用,难以反映真实在线 app 中内容变化、路径多样和错误累积。作者希望构建一个更接近真实用户环境、但仍能复现和自动评测的动态 benchmark。

论文 · Benchmarking LLMs and LLM-Based Agents in Practical Vulnerability Detection for Code Repositories

基础信息

  • 标题:Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories
  • 类型:Benchmark + 实证评测
  • 核心贡献:提出 JITVUL,基于 879 个 CVE 和 91 类 CWE 构造 1,758 个 vulnerable/fixed pairwise commits,用于评测 LLM 和 ReAct agent 的 just-in-time repository-level 漏洞检测能力。

Q1. 研究动机

函数级漏洞 benchmark 不能反映真实代码仓库中跨函数、跨调用链的漏洞语义;已有仓库级 benchmark 成本高、缺少 pairwise 修复前后比较,也较少研究 agent 通过工具按需获取上下文的能力。作者希望评测 LLM 和 ReAct agent 是否真正区分漏洞版本与修复版本。

论文 · Beyond_Static_GUI_Agent_Evolving_LLM-Based_GUI_Testing_via_Dynamic_Memory

基础信息

  • 标题:Beyond Static GUI Agent: Evolving LLM-based GUI Testing via Dynamic Memory
  • 类型:Mobile GUI testing / memory-augmented agent
  • 核心贡献:提出 MemoDroid,一个三层动态记忆机制,通过 episodic、reflective 和 strategic memory 让 LLM-based GUI testing agent 在跨 app、跨版本和跨平台测试中复用经验、提升覆盖率和 bug 检测。

Q1. 研究动机

现有 LLM-based GUI testing agent 多把每个 app 测试视为独立任务,缺少像人类测试员一样从历史 app 中积累经验的能力。作者希望让 GUI agent 通过动态记忆不断演化,复用过往路径、功能模式和 bug-prone 行为。

论文 · Demystifying LLM-Based Software Engineering Agents

基础信息

  • 标题:Demystifying LLM-Based Software Engineering Agents
  • 类型:方法论文 + SWE-bench 实证分析
  • 核心贡献:提出 Agentless,用传统软件工程流水线式的定位、修复和补丁验证替代复杂自治 agent 规划,在 SWE-bench 上证明简单非自治流程也能达到强性能和低成本。

Q1. 研究动机

SWE-bench 推动了 LLM 软件工程 agent 的发展,但许多系统越来越依赖复杂的自治工具调用、规划和交互框架。作者质疑:这些复杂 agent 机制是否真是解决仓库级 bug 修复的必要条件,还是结构化的 SE 流水线已经足够有效。

论文 · Evaluating LLM-Based Agents for Multi-Turn Conversations

基础信息

  • 标题:Evaluating LLM-based Agents for Multi-turn Conversations: A Survey
  • 类型:Survey / evaluation taxonomy
  • 核心贡献:系统综述多轮对话 LLM agent 的评测方法,提出“评什么”和“怎么评”两套互相关联的 taxonomy,用于覆盖任务完成、响应质量、用户体验、安全、记忆、规划和工具调用。

Q1. 研究动机

多轮对话 agent 已从规则系统发展到能使用工具、保持上下文、执行计划的 LLM agent,但评测仍常停留在单轮回复质量或静态指标。作者希望整理评测对象和评测方法,解决多轮交互中上下文累积、错误传播和动态任务完成难以衡量的问题。

论文 · Large Language Model-Based Agents for Software Engineering

基础信息

  • 标题:Large Language Model-Based Agents for Software Engineering: A Survey
  • 类型:Survey / software engineering agents
  • 核心贡献:系统综述 124 篇 LLM-based software engineering agent 论文,从 SE 任务视角和 agent 架构视角同时梳理应用、组件、挑战和未来方向。

Q1. 研究动机

LLM agent 已大量进入需求、编码、测试、调试、运维和维护等 SE 场景,但相关工作分散在不同任务和架构范式中。作者希望系统回答:这些 agent 在软件工程中做什么、如何设计、哪些机制有效、仍有哪些开放问题。

0%