1. Cursor Projects

推荐理由: 这是 coding agent 从“一个会话完成一个任务”走向 长期 project-level agent runtime 的明显一步。Projects 面向 feature、migration、完整 app 这类跨天甚至跨月工作,由 coordinator agent 持续维护项目状态、共享上下文和任务分解,而不是每次重新把背景塞给一个新的 coding session。

核心要点:

  • Coordinator 与执行 Agent 分层。 Project 的 coordinator 本身不写代码,而是负责规划、拆解、创建和管理执行 Agent,并把完成结果收回来供人检查;需要时可以并行启动大量 subagents。这个结构更像项目调度器,而不是更大的单体 coding agent。
  • Shared context 变成长期资产。 每个 Project 维护一组跨 cloud/local machine 同步的文件,Agent 会持续写入 research、artifacts、代码库知识和工作方法。一个 Agent 学会某个服务如何测试后,后续 Agent 可以直接复用,而不需要重新 onboarding。
  • Agent 可以由事件驱动,而不只是由 prompt 驱动。 Project 可监听 Slack、定时任务和 PR;收到 bug report 或其他信号后自动开始委派工作。Project 自己运行在云端计算机上,即使用户关闭笔记本也能继续执行,需要本机环境时再启动 local agent。

核心启示:coding agent 的基本单位正在从 session 变成 project。真正长期有效的 Agent 系统需要持久 context、独立 coordinator、并行执行和 event-driven subscriptions,而不只是更长的 context window。

2. Introducing SWE-2: Pushing the Pareto Frontier

推荐理由: SWE-2 值得关注的不是又一个 coding benchmark 排名,而是 Cognition 把 任务成功率和 rollout 成本一起写入训练目标。这更接近真实 software factory 的优化问题:不是让 Agent 不惜代价多想,而是在不同难度任务上找到合适的探索、验证和成本水平。

核心要点:

  • 优化目标从最高分变成整条 cost-performance Pareto frontier。 Cognition 报告 SWE-2 在 FrontierCode 1.1 Main 得到 50.0%,距离 Fable 5.1 的 50.9% 不到 1 个百分点,同时其测算成本低 64%;在 DeepSWE 1.1 和 Terminal-Bench 2.1 上也接近或超过多款 frontier coding model。这里的数字属于 Cognition 自己的评测,需要结合独立 benchmark 看待。
  • 多个 reasoning effort 在一次 RL 中共同训练。 SWE-2 基于 Kimi K3 继续 post-training,并为不同 effort level 使用 R = S - λₑC 的 cost-penalized reward,其中 λ 根据 base model 当前 Pareto curve 的局部斜率设置。目标不是把所有模式都压缩成最短,而是让 medium/high/max 分别沿自己的最优 cost-quality 区域前进。
  • 更强的 Agent 行为体现为减少无效探索。 在 Cognition 的 FrontierCode 测试中,SWE-2 medium 相比 SWE-1.7 平均 turns 减少 58%、平均成本降低 81%;第一次真正修改代码的中位步骤从 48 降到 18。团队还强调 end-to-end tests、遇阻后的替代路径和重新验证结论,而不是简单重复先前判断。

核心启示:coding agent 的“智能”越来越需要用任务级经济性衡量:成功率、turn 数、探索成本、验证质量和最终美元成本应该一起进入 eval,甚至直接进入训练目标。