1. Inside a Software Factory
- 作者/来源: Paul Iusztin / O’Reilly Radar
- 发布日期: 2026-09-04
- 原文: https://www.oreilly.com/radar/inside-a-software-factory/
推荐理由: 这篇比“software factory”概念宣传更具体。作者把自己三个月实际搭建 Squid 的经验拆开,给出从 intake、brainstorm、planning、implementation、QA、review、CI、release 到 production feedback 的完整流水线,也明确承认第一版因为追求全自动而过度设计、最后反而不好用。它最有价值的地方是把 software factory 定义成一套 可中断、可验证、可逐步自动化的软件工程过程,而不是一群并行跑的 coding agents。
核心要点:
- Factory 的核心不是 Agent 数量,而是完整反馈闭环。 作者把流程分成“决定做什么”“实现和检查”“从生产反馈中自我改进”三段,并让 production incident / telemetry 重新进入 triage。贯穿所有阶段的是共享 context layer;planning 阶段还要求维护 ADR、glossary 和与任务绑定的文档,而不是只把一段 prompt 交给 coding agent。
- Human bottleneck 被有意保留在 brainstorming / planning。 作者的实践是让最强模型用于前期规划,因为一个好的 plan 可以让后续较便宜的 executor 少走大量弯路。实现阶段再拆成 software-engineer agent 与独立 QA agent,并用 lint、unit、integration、E2E 等逐级 verifier 形成反馈环,而不是让写代码的 Agent 自己给自己判分。
- 不要从“大一统自治流水线”开始。 作者第一版 Squid 最大的问题是 run 一旦偏航就难以暂停、调试和重新定向。更可用的设计是先保留
/plan、/implement、/review等细粒度入口,再根据成熟度把它们组合成长流水线。真正应该优先自动化的是团队最痛的瓶颈,而不是为了“full autonomy”增加 orchestration complexity。
核心启示:software factory 的成熟度,不取决于能并行启动多少 Agent,而取决于每一阶段是否有清晰输入、独立验证、可中断控制和可回流的生产证据。
2. Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
- 作者/来源: Jianlyu Chen、Yuyang Hu、Hongjin Qian、Jiawei Liu、Wenqing Wei、Xiaolong Chen、Defu Lian、Zhicheng Dou、Chaozhuo Li、Qiwei Ye、Zheng Liu / BAAI、USTC、RUC、PolyU
- 发布日期: 2026-09-02
- arXiv: https://arxiv.org/abs/2609.02749
- AlphaXiv: https://www.alphaxiv.org/abs/2609.02749
- 代码: https://github.com/VectorSpaceLab/AREX-Skill
推荐理由: 这篇把 Agent 的能力栈从 model + harness 再向外扩了一层:operational knowledge。很多工程知识已经存在于成熟 GitHub 仓库中,但它们是给人读的 README、源码、脚本和隐含约定,无法每次完整塞进 context。作者提出 DisCo,把这些 repo 蒸馏成可执行、可验证、可按需路由的 Skills,让 Agent 不必在每次任务里重新摸索“一个方法到底怎么落地”。
核心要点:
- 把 repository 从参考资料变成 Agent-facing knowledge artifact。 DisCo 同时支持 task-agnostic 和 task-oriented 两种 distillation:前者批量从成熟项目提炼通用操作知识,后者围绕具体任务生成需要的 skills。AREX-Skill Library 最终从 1,000 个 ML repositories 中构建了 5,000+ verified skills,并组织成 20 个领域、178 个 capability families,运行时只路由相关 skill,避免把整个知识库塞进 context。
- 固定模型和 harness 后,knowledge layer 仍能显著改变 Agent 能力。 在 GPT-5.5 backbone、research harness 和执行预算保持不变的设置下,引入 skills 后,论文报告 MLE-bench 提升 134.3%、PaperBench 提升 34.4%、FrontierCS 提升 9.2%、PassNet 提升 14.0%。这组结果说明 Agent scaling 不只发生在 model 或 orchestration 上,高质量的 reusable operating context 本身也是一个独立 scaling axis。
- 关键不只是“生成 SKILL.md”,而是验证和路由。 如果把任意 repo 摘要都称为 skill,很容易把错误经验永久化。DisCo 的思路是让 skill 经过执行验证和迭代 refinement,再通过 taxonomy/router 做 progressive disclosure。对 coding/research agent 更实际的方向是
repo → executable evidence → verified skill → task-time routing,而不是维护越来越长的全局 instruction 文件。
核心启示:未来 Agent 的长期工程能力很可能不只存在于 memory 里,而会以版本化、可验证、可按任务加载的 Skill Library 形式沉淀。