1. Agentic AI overwhelmed CI, and test selection cut queueing from hours to minutes

推荐理由: 这是一个很具体的 software factory scaling 案例:只有一个工程师,但 coding agents 已经能把约 50 万行代码项目的 change arrival rate 推高到让 CI 变成瓶颈。文章最有价值的地方不是“再加 runner”,而是提出更适合 agent 时代的原则:verification cost 应该跟 change scope 一起缩放,而不是每个 change 都支付全量测试成本。

核心要点:

  • Agent 生成改动的速度已经超过 CI 消化速度:一次完整 PR 验证约 20 分钟,多个 change 同时准备好后会不断产生等待、rebase 和再次验证,形成额外 CI 工作。作者最终没有继续堆 runner,而是先减少每个 change 触发的测试量。
  • Test selection 同时利用 scheduled full runs 的 runtime coverageTypeScript dependency graph,只运行某次修改可能影响的测试;不确定时保持保守,完整 suite 仍然每晚运行,用来刷新 coverage 信息并兜底。
  • 最终普通 full-PR wall time 从约 21 分钟降到 13 分钟,p95 E2E 从约 23 分钟降到 6 分钟;计入排队后,p95 总 CI 时间从约 7 小时 35 分钟降到 35 分钟(-92%)。真正减少最多的是 queueing contention,而不仅是单测本身变快。

2. What is Missing from AI Post-Training AI: An Empirical Analysis

推荐理由: 这篇对长周期 Agent 有一个很重要的提醒:会持续执行,不等于会持续重新判断。 当前 agent 已经能写训练代码、跑实验、修 bug、评估 checkpoint,但一旦最初 strategy 定下来,后面往往只会在这个策略内部做局部优化。这个结论同样适用于 coding agent、research agent 和 autonomous workflow:replanning 不能只写在 prompt 里,而要成为 harness 中显式可触发的控制机制。

核心要点:

  • 作者分析了 1,338 条 PostTrainBench agent trajectories,覆盖 7 个 benchmark、4 个 base model、20 种 agent configuration。Agent 通常在第一次 planning 时就锁定 training strategy,随后整个预算主要花在调参、修代码、改数据格式等 execution-level adjustment 上。
  • Strategy lock-in 很明显:Claude Code 的轨迹中 80.7% 收敛到 full-parameter SFT,而 Codex CLI 有 89.6% 偏向 PEFT;这说明策略很大程度来自 agent 自身 prior,而不是随着任务和实验结果动态更新。
  • 增加 experiment journal、skill library、evaluator agent 后,GSM8K 提升 +12.6 points、HumanEval 提升 +40.8 points,但 strategy 仍几乎不变;甚至多花 2–8× inference tokens 也没有解决最难任务上的问题。核心缺口不是更多 memory 或 thinking,而是一个能在运行中主动触发 strategy reevaluation / reset 的机制。