Ting

Ting

满怀希望就会所向披靡

论文 · Benchmarking LLMs and LLM-Based Agents in Practical Vulnerability Detection for Code Repositories

基础信息

  • 标题:Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories
  • 类型:Benchmark + 实证评测
  • 核心贡献:提出 JITVUL,基于 879 个 CVE 和 91 类 CWE 构造 1,758 个 vulnerable/fixed pairwise commits,用于评测 LLM 和 ReAct agent 的 just-in-time repository-level 漏洞检测能力。

Q1. 研究动机

函数级漏洞 benchmark 不能反映真实代码仓库中跨函数、跨调用链的漏洞语义;已有仓库级 benchmark 成本高、缺少 pairwise 修复前后比较,也较少研究 agent 通过工具按需获取上下文的能力。作者希望评测 LLM 和 ReAct agent 是否真正区分漏洞版本与修复版本。

论文 · Evaluating LLM-Based Agents for Multi-Turn Conversations

基础信息

  • 标题:Evaluating LLM-based Agents for Multi-turn Conversations: A Survey
  • 类型:Survey / evaluation taxonomy
  • 核心贡献:系统综述多轮对话 LLM agent 的评测方法,提出“评什么”和“怎么评”两套互相关联的 taxonomy,用于覆盖任务完成、响应质量、用户体验、安全、记忆、规划和工具调用。

Q1. 研究动机

多轮对话 agent 已从规则系统发展到能使用工具、保持上下文、执行计划的 LLM agent,但评测仍常停留在单轮回复质量或静态指标。作者希望整理评测对象和评测方法,解决多轮交互中上下文累积、错误传播和动态任务完成难以衡量的问题。

论文 · Large Language Model-Based Agents for Software Engineering

基础信息

  • 标题:Large Language Model-Based Agents for Software Engineering: A Survey
  • 类型:Survey / software engineering agents
  • 核心贡献:系统综述 124 篇 LLM-based software engineering agent 论文,从 SE 任务视角和 agent 架构视角同时梳理应用、组件、挑战和未来方向。

Q1. 研究动机

LLM agent 已大量进入需求、编码、测试、调试、运维和维护等 SE 场景,但相关工作分散在不同任务和架构范式中。作者希望系统回答:这些 agent 在软件工程中做什么、如何设计、哪些机制有效、仍有哪些开放问题。

论文 · Large Language Models Empowered Personalized Web Agents

基础信息

  • 标题:Large Language Models Empowered Personalized Web Agents
  • 类型:Benchmark + personalized Web agent framework
  • 核心贡献:提出 PersonalWAB 个性化 Web agent benchmark 和 PUMA 框架,通过长期用户记忆、SFT 与 DPO 让 Web agent 更好地根据用户历史行为生成函数参数和执行个性化任务。

Q1. 研究动机

现有 Web agent 多关注通用网页导航和工具调用,较少评测 agent 是否能利用用户长期偏好完成个性化任务。真实 Web 场景中的搜索、推荐和评论生成都依赖用户历史行为,因此需要专门 benchmark 和对齐方法。

论文 · RepairAgent_An_Autonomous_LLM-Based_Agent_for_Program_Repair

基础信息

  • 标题:RepairAgent: An Autonomous LLM-Based Agent for Program Repair
  • 类型:Automated Program Repair / LLM agent
  • 核心贡献:提出 RepairAgent,一个基于 GPT-3.5、14 个工具、动态 prompt 和有限状态机控制的自治程序修复 agent,在 Defects4J 和 GitBug-Java 上验证其自动修复能力。

Q1. 研究动机

传统自动程序修复方法通常依赖预定义模板、搜索策略或专门训练模型,而 LLM 具备理解代码和生成补丁的能力。作者希望探索 LLM 是否能作为自治 agent,通过读取代码、搜索、运行测试和编辑文件完成端到端修复。

论文 · Scenario-Guided LLM-Based Mobile App GUI Testing

基础信息

  • 标题:Scenario-Guided LLM-based Mobile App GUI Testing
  • 类型:Mobile GUI testing / multi-agent framework
  • 核心贡献:提出 ScenGen,一个场景引导的 LLM-based 移动 GUI 测试框架,通过多 agent 协作、视觉定位、自校正和完成度判断生成更贴合用户场景的测试序列并发现真实 crash bugs。

Q1. 研究动机

移动 GUI 测试需要覆盖真实用户场景,而传统随机或模型驱动工具常偏向广泛探索,LLM-based 方法又容易受动态界面、控件定位和完成判断影响。作者希望用场景目标约束探索,让测试既符合业务流程又能发现场景内缺陷。

0%