1. Codex as a platform: build on the open agent harness

推荐理由: 这篇把 Codex 从“一个 coding assistant 产品”拆成了更基础的东西:可复用的 agent harness/runtime。真正值得借鉴的不是再做一个通用聊天框,而是让业务产品保留自己的界面、数据模型、权限和审批流,只把 agent loop、上下文维持、tool use、sandbox 与 approval lifecycle 交给 harness。这个边界非常接近 AI-native product 应该怎么分层。

核心要点:

  • 一个可用 Agent 不只是 prompt + model,还需要 context state、tool execution、failure handling、approval、sandbox 和 progress streaming。OpenAI 将这些能力放进 Codex harness,并通过 codex exec、SDK 和 app-server 三层接口暴露:分别对应一次性任务、程序化工作流和嵌入式产品 Agent。
  • 产品本身继续拥有 业务上下文、界面、权限和 system of record。文章里的 Relay 示例不是让用户先写 prompt,而是在 shipment dashboard 里直接选任务;应用自动提供当前记录和 MCP tools,Agent 调查后只有在用户批准时才执行 consequential write。
  • Harness 本身会显著影响能力,而不只是“包一层 UI”。文章给出的 ARC-AGI-3 例子中,retained reasoning + context compaction 将 GPT-5.6 Sol 从 13.3% 提升到 38.3%,同时 output tokens 减少约 。对 AI-native 产品来说,harness engineering 已经是独立于模型选择的一层核心工程。

2. SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution

推荐理由: 它解决的是 coding agent 很现实的 repository cold start:模型会写代码,但第一次进入一个项目时不知道内部 API、模块约定和历史坑。SkillForge 不等真实 issue 出现后再边做边学,而是先利用已有测试主动制造项目内 synthetic issues,再把成功/失败轨迹压成可复用 skills,相当于让 Agent 在“上岗前”先自己熟悉仓库。

核心要点:

  • SkillForge 从已有 test-covered core functionality 出发,遮掉关键实现并要求模型重写,从而制造与当前仓库强相关、还能被现有测试验证的 synthetic bugs。Agent 解决这些问题的轨迹就成为项目知识来源,不依赖历史 issue/PR 是否足够丰富。
  • 学到的知识分成两层:全局 diagnostic skills 提供模块用途、导航和相关 API;局部 intervention skills 绑定具体文件/函数,在 Agent 真正访问该 entity 时再 just-in-time 注入,避免把整个 skill bank 一次性塞进 context。
  • 在 SWE-bench Verified 上,使用 DeepSeek-V3.2 的 SkillForge 达到 72.2% Pass@1,比基础 Agent 高 5.8 个百分点;GPT-5-mini 也达到 60.6% Pass@1。一个重要实验现象是:skills 并不能完全跨模型复用,说明 skill bank 不只是仓库事实,也会吸收底层模型自己的 reasoning pattern 和 blind spots。