1. Agentic Batch Changes
- 作者/来源: Robert Lin / Sourcegraph
- 发布日期: 2026-09-14
- 原文: https://sourcegraph.com/changelog/agentic-batch-changes-ga
推荐理由: 这篇展示了一个很具体的 software factory 形态:不是简单地把同一个 coding agent 并行启动几百次,而是在更外层增加一个 coordinator,让它先理解整个代码空间、决定每类修改该用确定性程序还是 coding agent,再通过成熟的批量变更执行引擎分阶段 rollout。它把“大规模代码修改”从单仓库 Agent 能力问题,转成了 orchestration、verification 和 rollout 问题。
核心要点:
- 外层 coordinator 不应该默认所有任务都交给 coding agent。 Agentic Batch Changes 先借助 Deep Search 理解涉及的仓库和差异;可确定的修改会生成脚本或程序批量执行,只有需要逐仓库判断的部分才委托 Claude Code 或 Codex,并通过 Sourcegraph MCP 提供上下文。这里的关键不是更多 Agent,而是根据任务结构选择最低不确定性的执行方式。
- 大规模变更需要 canary 和分阶段 rollout,而不是一次性 fan-out。 Agent 先制定计划,在一个仓库上生成和检查变更,再逐步扩展到更多目标;执行过程中可以加入 tests、linters 等 verifier,并在需要人类决策时暂停。Sourcegraph 过去的 Batch Changes 已有单次超过 2,200 个 changeset 的经验,Agentic Batch Changes 是在这套执行底座之上增加规划和判断能力。
- PR 创建之后仍属于 Agent loop。 CI 失败后,系统可以获取日志、修改计划,或再次委托 coding agent 修复;遇到 merge conflict 也可触发 Agent 处理。换句话说,software factory 的执行单位不是“生成一个 diff”,而是
plan → canary → rollout → CI feedback → repair → human approval的完整变更生命周期。
核心启示:规模化 coding agent 更像一个分层编译/执行系统:outer-loop coordinator 负责切分与选策略,deterministic automation 处理规则明确的部分,inner-loop coding agents 处理局部不确定性,而 rollout、CI 和 human gate 构成独立的控制面。
2. The Missing Complement: State-Conditioned Minimal Sufficient Evidence for Coding Agents
- 作者: Zhexi Feng、Ruiyi Zhang、Yongbo Yang、Pengtao Xie
- 发布日期: 2026-09-17
- arXiv: https://arxiv.org/abs/2609.20050
- AlphaXiv: https://www.alphaxiv.org/abs/2609.20050
推荐理由: 这篇把 context engineering 中一个很常见但经常被忽略的问题说清楚了:coding agent 运行到一半时,它已经读过大量“最相关”的文件,此时继续按 similarity 检索,容易把预算浪费在同一事实的多个近似版本上。真正需要检索的是 当前决策还缺什么证据。因此作者把 retrieval 从 passage ranking 改写成 state-conditioned 的最小充分证据集合构造问题。
核心要点:
- 相关性不是充分性。 SERBench 从 45 个仓库采集 500 个 held-out Agent states,不只问某段代码与 issue 是否相似,而是记录 Agent 已经看过什么,并要求返回的 evidence set 覆盖当前下一步决策所需要的所有事实。评价单位从“单个 passage 是否 relevant”升级成“整个证据集合是否 sufficient”。
- MSS-Complement 把 retrieval 做成 set construction。 方法先提出一个联合充分的候选集合,再显式寻找缺失的 complement,最终返回 4–8 个完整 source units,并把总上下文限制在 6,144 tokens。固定配置下,5 个 evidence items 的 complete-set recovery 为 73.0%,8 个时为 80.6%;Qwen3 embedding + reranking 分别为 61.4% 和 72.4%。相似度匹配的控制组只有 66.6%,说明增益主要来自“补齐集合”这一策略。
- 少掉一个必要证据组会明显伤害 Agent 决策。 在两个 executor 上,从完整 evidence set 中移除一个必需 evidence group,repair-localization precision 分别下降 12.3 和 11.1 个百分点;在 AMA-Bench 上,该方法还用小 76.2% 的 answer prompt 获得比 benchmark memory agent 高 2.08 个百分点的准确率。Context engineering 的目标因此不应只是“检索更多相关内容”,而是以最小 token 成本补齐当前状态的证据缺口。
核心启示:面向长时程 Agent 的 retrieval 应从
query → top-k similar chunks转向agent state → missing facts → minimal sufficient evidence set。真正值得优化的不是 context 的相关性,而是下一步决策的证据完备度。