1. An Exploratory Study of Agent Plans for Agentic AI Coding Tools in Open-Source Software
- 作者/来源: Muhammad Auwal Abubakar、Seyedmoein Mohsenimofidi、Jai Lal Lulla、Jie M. Zhang、Christoph Treude、Sebastian Baltes、Matthias Galster
- 发布日期: 2026-08-05
- arXiv: https://arxiv.org/abs/2608.04661
- AlphaXiv: https://www.alphaxiv.org/abs/2608.04661
推荐理由: 这篇论文研究了 .cursor/plans、.claude/plans 这类任务级 plan 文件,把它们视为区别于 AGENTS.md 的新型 repository artifact。对于想把 agent 工作流沉淀进仓库的人,它给出了少见的真实开源数据。
核心要点:
- 研究扫描 36,710 个工程化 GitHub 仓库,只找到 10 个仓库中的 85 个 Agent Plan 文件,说明“把计划提交进仓库”仍是非常早期的实践。
- Plan 最常包含三类信息:implementation steps、具体 files/locations,以及 testing/validation;它们位于开发者任务意图与 agent 实际执行之间。
- 多数 plan 只出现于一次 commit 中、后续没有持续维护,因此目前更像可追溯的任务执行记录,而不是长期项目文档;但一旦入库,就能被 reviewer、未来开发者和后续 agent 复用。
2. Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports
- 作者/来源: Haobin Li、Ping Deng、Weizhong Qian、Liang Jiang、Zhenyu Huang、Mouxing Yang、Xi Peng
- 发布日期: 2026-08-05
- arXiv: https://arxiv.org/abs/2608.04682
- AlphaXiv: https://www.alphaxiv.org/abs/2608.04682
推荐理由: SWE-bench 一类 benchmark 默认“人已经把 bug 写成了高质量 issue”。Active-SWE 去掉这层提示,直接要求 agent 在仓库里自己找 bug、定位、修复并证明修复有效,更接近未来长期运行的软件维护 agent。
核心要点:
- Active-SWE 构建了 1,663 个任务,覆盖六类 bug 和八种编程语言,并同时包含单 bug 与多 bug 场景。
- 评测不只检查历史已知 bug 是否修好,还要求 agent 为自己发现的潜在 bug 生成可复现的 fail-to-pass 测试,用测试证据验证“这个 bug 真的存在”。
- 当前前沿模型仍明显依赖外部 issue guidance:统一使用 Claude Code scaffold 时,最佳 recorded-bug resolved rate 只有 20.0%;在同一子集上 Claude Opus 4.8 从 reactive 的 59% 降到 proactive 的 26%。