1. The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks
- 作者/来源: Bardia Mohammadi、Lars Klein、Aman Chadha、Akhil Arora、Laurent Bindschaedler
- 发布日期: 2026-08-17
- arXiv: https://arxiv.org/abs/2608.16630
- AlphaXiv: https://www.alphaxiv.org/abs/2608.16630
推荐理由: 这篇把 repository-scale coding agent 的 context problem 讲得非常具体:问题不只是“上下文太长”,而是一次修改依赖的事实是否在 agent 真正写代码的那个时刻仍然可用。作者把缺失的耦合事实称为 coherence debt,并通过 7 个模型和 5 个 harness 做控制实验。它对 context engineering 的启示很直接:应该围绕 edit dependency 维护 working set,而不是把更多仓库内容一股脑塞进 prompt。
核心要点:
- 作者把 repo-level 修改抽象成 coupled-fact graph:测试、import、配置、migration rule 等事实要么来自当前 context,要么来自模型的 parametric memory;两者都覆盖不到的部分就是 coherence debt。实验表明,事实一旦缺失,增加 token 或让 agent 多探索并不能恢复正确性。
- availability 比 distance 更重要。 只要关键事实仍在上下文里,它离实际 edit 很远也可以正常工作;反过来,缺一个事实就会精确损失依赖它的那部分工作。更麻烦的是 agent 往往不会停下来报告“不知道”,而是猜一个值、造一个文件,把缺口伪装成已经完成的工作。
- 不同 harness 为维持同样的事实可用性付出的 token 成本可相差 10 倍以上。而且 stale convention 比没有 convention 更危险:当代码与规范冲突时,agent 往往遵从规范。对 harness 的要求因此不是简单“多读文件”,而是 在写入时确保依赖事实可用,并从产物反查 agent 实际使用了什么事实。
2. Asana cleared 5 years of engineering work in 2 weeks with Codex
- 作者/来源: OpenAI / Asana
- 发布日期: 2026-08-18
- 原文: https://openai.com/index/asana/
推荐理由: 这是近期非常具体的 production software-factory 案例:Asana 没有拿 agent 做绿地 demo,而是让它处理一个多年累积的真实基础设施迁移——彻底移除已经成为前端升级阻塞点的 Enzyme。更值得注意的是流程并不复杂:短 prompt、最多 4 个并行 agent、隔日两次人工检查、所有修改仍由工程师 review。它说明 AI-native workflow 的价值经常来自 把原本经济上“不值得做”的大规模维护任务重新变得可执行。
核心要点:
- 项目从一个只有 5 句话的 prompt 开始,最多 4 个 Codex coding agents 在各自独立的 codebase copy 中并行工作;工程师每天检查两次进度并 review 每个 proposed change。Asana 还发现,简单指令反而比更复杂的 agent setup 更有效。
- Enzyme 最终在约 1.5 周工程工作量、跨 2 个日历周内完全移除;模型和基础设施成本约 $12K。Asana 之前的 staffing plan 预计至少需要 5 年、约 $6M。这些数字来自厂商案例,应当作为单个项目证据而不是普遍生产率结论。
- 更重要的变化不是单次“提速”,而是项目选择逻辑发生改变:团队开始重新评估过去因为成本过高而搁置的 migration、rewrite 和 performance cleanup。Software factory 的一个现实落点因此可能是 持续消化技术债和长尾维护 backlog,而不只是更快生成新功能。