1. Learning Globally Reusable Skills for Coding Agents

推荐理由: 很多 self-evolving agent 只从单次失败里追加一条 skill,容易越积越碎、相互冲突。GSE 把 skill bank 当成一个需要全局维护的系统,开始触及“长期运行 agent 如何积累经验而不腐化”的核心问题。

核心要点:

  • GSE 用 Skill Relation Graph 显式维护 skill 之间的 dependency、co-usage 和 conflict,让一次局部更新能够检查并联动相关 skill,而不是孤立修改。
  • 它先从失败轨迹提炼更新,再通过 cluster-based consolidation 把多个局部经验抽象成更通用的能力,并用历史 case replay 检查 regression 后才写回 skill bank。
  • 在 OpenHands 和 mini-SWE-agent 上,GSE 在 bug-revealing test generation 与 false-positive filtering 两类任务均优于现有 skill evolution 方法;内部工业 agent 上 F1 进一步提升 61.4%。

2. CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents

推荐理由: 这篇把 coding agent 的 repository exploration 单独抽成一个可训练子系统。相比继续堆大模型,它更像真正的软件工厂优化:找出 rollout 中最贵的工序,再换一个专门 agent 去做。

核心要点:

  • 作者观察到 OpenHands 在 SWE-Bench Verified 的成功任务平均需要 23 轮、631K tokens,大量预算耗在 grep、glob 和读取文件,而非真正修改代码。
  • CodeGrep 是一个 14B retrieval agent,通过 GRPO 学习多轮并行 grep/glob/read 操作,再把候选文件交给冻结的 downstream coding agent;训练数据来自 67K 条开源 agent trajectories。
  • 在全部 500 个 SWE-Bench Verified 任务上,resolve rate 从无 retrieval 的 25.8% 保持到 27.0%,同时成功任务减少 15% rounds 和 19% tokens;实验还显示 retrieval precision 必须跨过一定阈值才真正降低 agent 成本。