1. When code is abundant
- 作者: Bill Staples / GitLab
- 发布日期: 2026-08-24
- 原文: https://about.gitlab.com/blog/when-code-is-abundant/
推荐理由: 这篇把“code is no longer the bottleneck”继续往系统层推进。GitLab 的判断是:当 Agent 可以大规模生成实现后,真正稀缺的东西变成 trust,而 trust 不能只靠更强模型或更长 prompt,而要由 context、verification、governance、identity、provenance 和 evidence 组成一个独立于具体模型的持久控制层。对 software factory 来说,优化目标也不应再是 lines of code 或 token throughput,而应转成 cost per accepted change。
核心要点:
- GitLab 将一个有效的软件变更成本拆成 generation、environment setup、context、verification、review、remediation 和 governance。AI 主要压低的是 generation;如果 CI、review、validation 等环节没有同步压缩,整体交付速度不会线性提升。文章因此建议直接测量 cost / time per accepted change,而不是继续用代码产量衡量 Agent 效率。
- Agentic development 的 durable layer 应该独立于模型存在。GitLab 将下一代平台抽象成四层:Agent Platform、machine-scale Execution、Context、Governance。模型可以被替换,甚至不同任务使用不同模型,但组织的 instructions、identity、policy、provenance、verification evidence 和历史不能随模型一起消失。
- 当 intent、code、policy、evidence、deployment 和 production outcome 之间的关系以机器速度增长时,provenance 不再只是事后审计问题,而会进入 execution path。文章把这一闭环描述为从传统 SDLC 向 PDLC / software factory 演化:business intent 进入系统,Agent 生成软件,verification / governance 决定能否继续,production signal 再反馈到下一轮。
注:这是 GitLab CEO 的平台方法论文章,包含明显的 GitLab 产品立场;更值得参考的是它对 software-factory constraint shift 和控制层职责的拆解,而不是把具体平台方案视为唯一实现路径。
2. WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
- 作者: Liyan Tang、Cyrus Rashtchian、Chun-Sung Ferng、Andrew Tomkins、Da-Cheng Juan、Tu Vu / Google Research
- 发布日期: 2026-08-27
- arXiv: https://arxiv.org/abs/2608.27454
- AlphaXiv AI Overview: https://www.alphaxiv.org/abs/2608.27454
推荐理由: 很适合放在近期 self-improving agent / skills 这条线上看。过去的 skill evolution 往往直接从 trajectory 改 SKILL.md,导致大量失败原因、被拒绝的方案和跨迭代规律散落在日志中。WikiSkill 增加了一个独立的 persistent Wiki Layer,把经验先编译成结构化知识,再用这些知识指导可执行 skill 的修改。关键点是:skill 可以 rollback,但 knowledge 不 rollback。
核心要点:
- Workspace 被明确拆成三层:Raw Layer 保存不可变 execution traces;Wiki Layer 持久记录 failure patterns、successful strategies、proposal impact 和演化历史;Skill Layer 只保存当前真正供 Agent 执行的 procedural instructions。这样可以把“发生过什么”“学到了什么”“现在应该怎么做”三个问题分开管理。
- 每轮 evolution 由 Inference Agent → Wiki Maintainer → Skill Proposer → validation gate 组成。候选 skill 只有在 validation 上变好才会被接受,否则 rollback;但 wiki 会保留失败提案及其证据,避免下一轮重复犯同样的错误。消融实验中,给 Skill Proposer 提供 persistent wiki 后,平均 benchmark performance 从 48.7% 提升到 63.7%(+15.0 points)。
- Skill evolution 与 model scaling 是互补的:Qwen 系列 4B / 9B / 27B 使用 WikiSkill 后平均分别提升 12.3 / 17.5 / 23.9 points;而且 skill 可以跨模型迁移。ALFWorld 上,Qwen-3.5-9B 使用 Qwen-3.6-27B 演化出的 skill 达到 70.2%,高于使用自身 skill 的 63.4%。这说明 knowledge discovery 与 skill execution 可以解耦,未来完全可以让更强模型负责总结经验,让更便宜的模型负责执行。
注:论文覆盖五类 benchmark 和五个模型,但仍属于受控实验。更值得关注的是三层知识架构、失败知识不回滚,以及把 skill discovery / execution 分离的设计,而不是直接外推具体分数到生产系统。