1. Every Coding Agent Trend Is Program Synthesis
- 作者/来源: Yad Konrad
- 发布日期: 2026-09-10(2026-09-12 更新)
- 原文: https://yad.codes/posts/every-agent-trend-is-program-synthesis/
推荐理由: 这篇不是再发明一个新的 Agent Engineering 名词,而是把近两年的 prompt engineering、context engineering、harness/loop engineering、eval、multi-agent orchestration 与 software factory 放回 program synthesis / CEGIS 的老问题里看。这个视角很有用,因为它把很多看似分散的 AI-native 实践压缩成几个稳定的工程对象:如何表达 intent、如何约束 search space、如何选择 search technique、如何建立可信 verifier,以及如何把失败作为下一轮搜索的反馈。
核心要点:
- Context engineering 本质上是在设计 search space。 作者把 CLAUDE.md、skills、tool schemas、repository map 等看成类似 SyGuS grammar 的约束:不是给模型更多信息,而是让候选解只能在更合理的空间里搜索。context 越长不一定越好,真正重要的是减少无关自由度。
- Harness / loop engineering 对应 search technique,eval 对应 verifier。 Agent 本身只是候选生成器;真正决定系统能否收敛的是
candidate → verify → counterexample → retry。作者特别指出,今天很多 Agent 系统把 eval 当最终打分,而不是像 CEGIS 那样把失败反馈重新送回搜索过程。 - Software factory 不是一个全新的范式,而是把 synthesis loop 扩展到整个 SDLC。 specification、candidate implementation、独立 verifier、反馈闭环和 human acceptance gate 一旦串起来,就已经非常接近一个可持续的软件工厂;因此下一阶段的核心竞争点可能不是生成更多代码,而是建立更强的 verifier 与反馈机制。
核心启示:AI-native engineering 可以少追逐新名词,多把系统显式建模成
specification → constrained search → candidate → verifier → counterexample feedback。这比单纯讨论 prompt、skill 或 agent 数量更容易形成可测试、可优化的工程方法。
2. Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks
- 作者: Wasu Top Piriyakulkij、Rachel Lawrence、Alicia Curth、Sushrut Karmalkar、Niranjani Prasad
- 发布日期: 2026-09-07
- arXiv: https://arxiv.org/abs/2609.09233
- AlphaXiv: https://www.alphaxiv.org/abs/2609.09233
推荐理由: 这篇直接回答了现在 Agent 系统里一个越来越实际的问题:同一个可复用 skill,到底应该把 SKILL.md 加载进主 Agent context,还是把它包装成独立 subagent 执行?论文发现答案不是“subagent 永远更好”,而取决于 skill 是否被设计成具有清晰输入输出契约的程序化能力。这让 skill design 从“写一段好提示词”进一步变成真正的模块接口设计。
核心要点:
- 没有明确 I/O contract 的知识型 skill,更适合直接加载进主 context。 在原始 SkillsBench 的人工 skill packages 上,agent-skill 模式整体与 subagent 持平或更好;这些 skill 多数提供相关知识,但没有清楚定义输入、输出和终止条件,因此强行隔离成 subagent 反而增加 delegation failure。
- 程序化、contract-driven skill 更适合作为 subagent。 作者从成功轨迹中合成带明确 input/output contract 的 procedural skills 后,结果反转:subagent execution 在测试模型上整体优于 inline agent skill,而且模型越小、context bandwidth 越有限,优势越明显。
- Subagent 用更多总 token 换更低的 peak context。 对 GPT-5.3 Codex、Kimi K2.6 等较强模型,subagent 在超过 80% 的任务上降低了峰值 context 长度,并且随着 distractor tools 增多退化更慢;代价是主 Agent 与 subagent 之间需要重复传递信息,因此总 token 消耗明显增加。
核心启示:Skill 是否应该“安装到主 Agent”还是“变成一个 subagent”,可以用接口设计来判断:知识说明型内容留在 context;能够定义成
input → procedure → output的能力,则更适合隔离成独立执行单元。未来大型 skill library 很可能需要像软件模块一样做分层、接口化和 refactoring。