1. How we make AI coding more cost efficient without sacrificing task quality
- 作者/来源: Erik Kristensen、Napalys Klicius / GitHub
- 发布日期: 2026-09-02
- 原文: https://github.blog/ai-and-ml/github-copilot/how-we-make-ai-coding-more-cost-efficient-without-sacrificing-task-quality/
推荐理由: 这篇很适合作为 coding-agent harness 成本优化的工程实践。GitHub 的核心结论不是“尽量减少每次 tool call 的 token”,而是优化整个任务从请求到完成的总成本:如果压缩掉了 Agent 后面还会重新读取的信息,局部 token 下降反而会让总 turns、总 context 和 latency 上升。
核心要点:
- 不要优化单次 tool call,要优化完整任务。 GitHub 测试 RTK 类 shell-output 压缩时发现,过度删减会导致 Agent 重新打开原始输出或重跑命令,最终平均 token 和耗时反而增加。上线方案因此只压缩 install/build/test/lint 等可预测噪声,
cat、git diff、git show等 source-like 输出保持完整,并保留原始输出的直接恢复路径。 - 先删无意义格式,再删信息。 Copilot
viewtool 过去会给每行源码加行号,但当前编辑工具已经不依赖这些行号。删除它们后,离线 agentic coding benchmark 的 model-inference cost 约下降 5%,线上 Copilot CLI 用户的平均 daily model-inference cost 约下降 3%,未检测到实质质量回退。 - Prompt 和 orchestration 都应该有 regression eval。 GitHub 用 meta-prompting 将 task-tool prompt 缩短约一半,但首次线上实验意外把可并行 sub-agent 串行化,于是先补 behavior regression test 再改 prompt。最终每轮减少约 1,300 prompt tokens、normalized cost per active hour 降约 2.9%;同时把后台任务完成结果直接随通知返回,减少纯 retrieval model turn,又降低约 2.3% token-related usage。
核心启示:context compression、prompt compression 和 orchestration optimization 都必须按 end-to-end task outcome 做 eval,而不是看某个局部 token 指标。
2. Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement
- 作者/来源: Haoyang Yan、Min-le Su、Hangfan Zhang、Zhanhao Li、Chen Zhang、Shao Zhang、Yang Chen、Lei Bai、Shuyue Hu
- 发布日期: 2026-09-01
- arXiv: https://arxiv.org/abs/2609.01481
- AlphaXiv: https://www.alphaxiv.org/abs/2609.01481
- 项目页: https://flesymeb.github.io/HarnessOfHarness/
推荐理由: 这篇直接研究“Agent 如何连续开发几天,而不是完成一次任务”。它没有替换 Codex、OpenCode、Pi 等现有 harness,而是在它们上面增加一层 meta-harness,把长期开发组织成反复的 plan → code → test → evaluate → next loop,很接近真正 software factory 的控制层。
核心要点:
- HoH 不规定 Agent 每一步怎么做,而是约束可验证的输出和迭代边界:把需求切成小而可验证的增量,平衡 bug repair 与 capability growth,并逐步暴露 deliverables、role-specific tools 和 skills,减少一次性塞入过多 context。
- 它明确分离 implementation-time testing 与 independent evaluation,同时保存 versioned project history、issue/evidence 轨迹并鼓励复用已有产物。这个结构的意义是:写代码的 Agent 不再同时拥有最终“宣布自己完成”的权力。
- 在 GameCraft-Bench、FrontierSWE、ProgramBench 和三组 harness-model pairing 上,HoH 相比 standalone harness 平均相对提升 52.25%,三轮后最高提升 82.86%;作者还运行了 70+ iterations 的 multi-day case,从空 workspace 自主开发出一个可玩的 FPS。这个结果仍属于论文 benchmark + 单个长周期案例,但验证了一个重要方向:长期自治更像需要一个持续迭代的工程控制系统,而不是单次更强的 coding agent。