1. The AI-Native SDLC playbook

推荐理由: 这篇不是继续讨论“怎样让 coding agent 多写一点代码”,而是直接承认 code 已经不再是主要瓶颈:当 build 从几天压缩到几小时,真正拖慢交付的会变成 plan、review/test、deploy 和 governance。Anthropic 给出的解法,是把 SDLC 从线性人工 handoff 改成由版本化 artifact、自动触发器和人工 gate 组成的循环。

核心要点:

  • Artifact 成为跨阶段协议。 intent.mdspec.mdplan.mdCLAUDE.md 不只是文档,而是 human-readable + machine-actionable 的状态载体;一个阶段接受某个 artifact 后,commit / merge 本身可以触发下一阶段,让 handoff 从“人去通知人”变成事件驱动的 workflow。
  • Agent 配置也要像代码一样做回归测试。 Anthropic 建议把真实历史任务做成 eval suite,并在 CLAUDE.md、skills、hooks 变化时自动跑;生产事故也转成永久 regression eval。也就是说,prompt / skill / harness 不再是随手改的配置,而是需要 CI gate 的工程资产。
  • 自动化不等于取消控制。 CI 中的 agent job 先从 read-only triage 开始,再逐步开放写权限;写入通过 PR、branch protection 和已有测试进入主干,执行环境使用 sandbox 和短期 scoped token,deploy / rollback 通过 allowlisted MCP tools 暴露。人的注意力从每一步操作转移到关键 gate 和异常决策。

2. SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation

推荐理由: 这篇把 coding-agent harness 带到真正高约束的软件环境:PLC 代码不仅要“看起来对”,还必须能集成到现有工程、通过编译,并在真实 runtime 上表现正确。它非常清楚地展示了一个可迁移到普通软件工程的原则:Agent 不能自己宣布 done,完成状态必须由外部可执行证据决定。

核心要点:

  • SemaPLC 使用严格的 verification gate:只有 specification check、integrated compilation 和 runtime behavior 都被日志化的外部检查确认后,任务才算完成;Agent 的自评不参与最终完成判定。
  • 在 117 个独立 POU 任务上,7 个模型的 mean strict verified pass rate 达到 72.6%;在 65 个 project-context 任务上,它也在 integrated compilation、static behavior 和 dynamic behavior 三层取得最高平均结果。
  • 最值得注意的是 static score 会掩盖真正的运行时差异:各方法静态指标相差不大,但 live PLC runtime 的 dynamic behavior 分数,基线只有 22.4–31.4,SemaPLC 达到 52.2。对 AI-native software factory 的启示很直接:最终 verifier 应尽量贴近真实 execution,而不是停在 lint、静态检查或 LLM judge。