1. JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

推荐理由: 这篇把 agent harness 从“工程师事先设计的一套固定框架”推进成了一个可以被模型自己生成和优化的对象。它提出的关键概念是 harness intelligence:模型能力并不只取决于 weights,memory、planning、action protocol、tools/skills orchestration 这些外围结构本身也可以成为可训练、可迁移、可持续累积的能力。

核心要点:

  • JIT-Agent 把 harness 形式化成四个可组合模块:Memory、Planning、Action、Capability Orchestration。运行时不是从一个固定 ReAct loop 出发,而是根据任务即时生成适合当前问题的 harness。例如研究任务可以采用递归 delegation,artifact 任务可以生成 dependency graph,而需要严格验证的任务可以采用更线性的 verification loop。
  • 训练过程本身也针对 harness 生命周期拆成三层:先通过 teacher supervision 学习 task-adaptive customization,再利用 compiler/runtime diagnostics 学习 harness repair,最后把执行 reward、latency、cost 等反馈沉淀进持续扩张的 harness archive,让下一轮生成能够复用过去有效的结构。也就是说,演化的对象不只是 prompt/skill,而是整个 Agent control flow。
  • 论文报告,接入 JIT-Agent 后 DeepSeek-V4-Flash 在 DeepSearchQA 和 OdysseyBench 上分别超过 GPT-5.6 9.1 / 4.3 分,GLM-5.2 在部分任务最高提升 20.2 分;生成出的 harness 在受测任务上也能与 OpenCode、Claude Code 等成熟 runtime 竞争。更值得注意的是,它把“换更强模型”之外增加了一条独立 scaling axis:让 harness 本身成为动态生成和持续优化的软件。

注:这是新论文中的实验结果,具体收益高度依赖 benchmark、backbone model 和执行环境;更值得关注的是把 harness 作为 first-class optimization target 的方法,而不是直接外推具体分数。

2. How Warp builds self-improving agents on Claude

推荐理由: 相比复杂的 self-evolving-agent 框架,这篇给出了一个非常容易落地的生产模式:base skill + improver skill + human feedback。Agent 的失败不再停留在一次 session 里,而是被转化成正常 Git/PR workflow 中可 review、可 merge、可回滚的 knowledge update。

核心要点:

  • Warp 最初通过人工改 prompt 和补 AGENTS.md 改善 code-review agent,但问题是每次 session 结束后反馈都会消失。现在每个 Agent 有一个 base skill 保存领域知识与执行原则;人类直接在 PR/issue 等工作现场给出反馈,尤其要求说明“为什么这个结果不好”,让反馈成为可复用的 domain signal。
  • 第二个 improver skill 不参与每次任务,而是定时读取一段时间内积累的反馈,对比 Agent 原输出和人类修正,并只提出最小、聚焦的 base-skill 修改。因为 skill 是普通文件,这些修改天然可以走 agent → PR → human review → merge → next run inherits it 的版本化闭环,而不是静默改写系统 prompt。
  • Warp 已把这个模式用于开源仓库里的 spec-writing、code review、issue triage 等多个 Agent。实际 issue-triage 案例中,维护者指出漏掉 ready to spec 标签并解释原因,scheduled improver 自动收集这条反馈、修改 triage skill 并提交 PR。关键设计不是“Agent 自动学习一切”,而是 低摩擦采集高质量反馈 + 小步更新 + 人类 gate + Git history,把持续改进变成普通软件工程过程。

注:这是 Anthropic 发布的 Warp 客户案例,规模与效果描述来自双方公开材料;它的价值主要在可复用的 workflow pattern,而不是把厂商数据视为独立 benchmark。