1. Learning Globally Reusable Skills for Coding Agents
- 作者/来源: Chen Yang、Jiashuo Tian、Ziqi Wang、Xinyin Liu、Meiru Ye、Junjie Chen
- 发布日期: 2026-08-06
- arXiv: https://arxiv.org/abs/2608.06153
- AlphaXiv: https://www.alphaxiv.org/abs/2608.06153
推荐理由: 很多 self-evolving agent 只从单次失败里追加一条 skill,容易越积越碎、相互冲突。GSE 把 skill bank 当成一个需要全局维护的系统,开始触及“长期运行 agent 如何积累经验而不腐化”的核心问题。
核心要点:
- GSE 用 Skill Relation Graph 显式维护 skill 之间的 dependency、co-usage 和 conflict,让一次局部更新能够检查并联动相关 skill,而不是孤立修改。
- 它先从失败轨迹提炼更新,再通过 cluster-based consolidation 把多个局部经验抽象成更通用的能力,并用历史 case replay 检查 regression 后才写回 skill bank。
- 在 OpenHands 和 mini-SWE-agent 上,GSE 在 bug-revealing test generation 与 false-positive filtering 两类任务均优于现有 skill evolution 方法;内部工业 agent 上 F1 进一步提升 61.4%。
2. CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents
- 作者/来源: Wuya Chen、Yihao Yang、Yang Cao、Yue Lin
- 发布日期: 2026-08-06
- arXiv: https://arxiv.org/abs/2608.05886
- AlphaXiv: https://www.alphaxiv.org/abs/2608.05886
推荐理由: 这篇把 coding agent 的 repository exploration 单独抽成一个可训练子系统。相比继续堆大模型,它更像真正的软件工厂优化:找出 rollout 中最贵的工序,再换一个专门 agent 去做。
核心要点:
- 作者观察到 OpenHands 在 SWE-Bench Verified 的成功任务平均需要 23 轮、631K tokens,大量预算耗在 grep、glob 和读取文件,而非真正修改代码。
- CodeGrep 是一个 14B retrieval agent,通过 GRPO 学习多轮并行 grep/glob/read 操作,再把候选文件交给冻结的 downstream coding agent;训练数据来自 67K 条开源 agent trajectories。
- 在全部 500 个 SWE-Bench Verified 任务上,resolve rate 从无 retrieval 的 25.8% 保持到 27.0%,同时成功任务减少 15% rounds 和 19% tokens;实验还显示 retrieval precision 必须跨过一定阈值才真正降低 agent 成本。