1. A coding agent opened 306 PRs on our repos since April. 289 merged.
- 作者/来源: Sinatra
- 发布日期: 2026-09-16
- 原文: https://www.sinatra.dev/blog/coding-agent-pr-merge-rate
推荐理由: 这篇不是 benchmark,而是一个 background coding agent 在两个真实生产仓库里连续 19 周运行后的数据复盘。最值得看的不是 94% 的 merge rate 本身,而是作者主动解释了为什么这个数字这么高:任务在进入 Agent 之前已经被结构化,失败会先被 sandbox/test/self-review 消化,最终 merge 权仍然留在人手里。 它把 software factory 的重点从“模型写代码有多强”拉回到整条交付流水线。
核心要点:
- 306 个 PR 中 289 个合并,但这是一个 best-case dataset。 统计窗口是 2026-04-27 到 2026-09-09:306 个 PR、289 merged、14 closed without merge、3 still open。作者明确说明两个仓库都是自家生产代码,而且写 ticket、调 Agent、review PR 的也是 Agent 的开发者,因此不能把 94% 直接外推成通用 coding-agent 成功率。
- 高合并率主要由 harness/workflow 决定。 每个 PR 都必须人工 review,Agent 没有 merge 权;ticket 会提前写 acceptance criteria、reproduction steps 和 file pointers;测试在 sandbox 中先跑,失败会回到同一 branch 继续修;进入人工 review 前,Agent 还会先对自己的 diff 做一次 self-review。
- 真实瓶颈往往不是“代码写坏了”,而是“解决了错误的问题”。 被关闭的 PR 更多来自实现方向不合适、任务被替代或 ticket 过期,而不是明显坏代码。作者认为 vague ticket、超大 refactor 和强架构 taste 的任务更容易需要人工接管;同时 review time 本身会成为新的 throughput bottleneck,因此 ticket size 直接决定一个 software factory 能否持续运转。
核心启示:生产 coding agent 的成功率是
specification → sandbox verification → self-review → human merge gate的系统指标,而不是模型指标。随着代码生成变便宜,任务规格和 review capacity 会更快成为瓶颈。
2. The Router Within: Eliciting Native Skill Routing from a Frozen LLM
- 作者: Ruishuo Chen、Xun Wang、Yu Chen、Zhuoran Li、Longbo Huang
- 发布日期: 2026-09-14
- arXiv: https://arxiv.org/abs/2609.15982
- AlphaXiv: https://www.alphaxiv.org/abs/2609.15982
推荐理由: Agent Skill 库变大以后,一个越来越现实的问题是:到底应该把所有 Skill 的 metadata 预先塞进 context,让模型自己挑,还是先用 embedding/retriever 在模型外做检索?这篇提出第三种方案:直接读取执行 Agent 自己的 hidden states 做 Skill routing。它把“Skill 发现”从额外的 RAG 子系统重新拉回到 Agent runtime 本身,而且支持在执行到一半、看到 tool result 后再触发新 Skill。
核心要点:
- Progressive disclosure 和外部 retrieval 各有结构性问题。 前者需要把 Skill 名称/描述持续放进 context,Skill 数量增长后会消耗 token 并分散注意力;后者虽然更可扩展,但路由判断由一个独立 retriever 完成,和真正执行任务的 Agent 对当前 trajectory 的理解并不完全一致。
- Gavel 只训练两个线性投影,基础 LLM 保持冻结。 Skill 安装时先用 Agent 模型生成并缓存中间层表示;运行时的
glance阶段用当前 task/trajectory hidden states 扫描 Skill 库得到 shortlist,verdict阶段再让同一个 Agent 模型对候选 Skill 做更完整的 likelihood + yes/no 判断。这样新增 Skill 只需要索引,不需要重新训练整个 router。 - 最大的收益出现在 mid-trajectory routing。 论文在 Qwen3-32B 上报告:相对 retrieve-and-rerank baseline,written-task routing 最多提升 13.4 个百分点;当 Skill 需求是在 tool evidence、Agent plan 或错误恢复过程中才出现时,最多提升 21.9 个百分点。在端到端 Skill-Use harness 中,progressive disclosure 的正确 Skill trigger rate 为 1.1%,加入 Gavel 后达到 90.9%。不过主要实验集中在 Qwen3 系列,SkillTraj 也是模拟 trajectory,因此仍需要真实生产 Agent 的进一步验证。
核心启示:Skill routing 不一定要变成独立 RAG 服务。未来 harness 可以把 Skill library 当成模型外存储,但让执行模型自己的内部表示负责动态检索,从而实现
large skill library + small active context + mid-trajectory disclosure。