1. Research acceleration: The view inside OpenAI
- 作者/来源: OpenAI
- 发布日期: 2026-09-06
- 原文: https://openai.com/index/research-acceleration-view-inside-openai/
推荐理由: 这是近期少见的、带组织级真实数据的 AI-native 研发实践,而不是单个 benchmark。OpenAI 试图回答一个更实际的问题:当 coding agent 真正进入研究团队日常后,研发流程到底发生了什么变化。文章的价值不在“Agent 已经替代研究员”,而在于它展示了 Agent 正在首先吃掉 Build / Run / troubleshooting / monitoring 这些执行密集环节,并把新的瓶颈推向方向判断、实验设计和结果选择。
核心要点:
- Agent 已从辅助工具变成并发劳动力。 到 2026 年 8 月中旬,OpenAI 研究组织按标准 8 小时工作日折算,已经达到每 1 个 human workday 对应约 3.1 个 agent-workdays;中位研究员每天使用的 Agent 推理成本按 API 价格计超过 600 美元,90 分位超过 7,000 美元。更重要的是,越来越多研究员会同时运行 4 个以上 Agent / sub-agent,而不是单线程问答。
- 真正增长最快的是执行层,而不是高层规划。 OpenAI 将 AI R&D 拆成 Decide、Design、Build、Run、Analyze、Communicate 六类后发现,Agent 使用在所有类别都增加,但 research / infrastructure code、technical help 和 run monitoring 增长最明显;高层 planning 仍只占很小比例。实验数量也随 Codex adoption 增长,但 OpenAI 明确提醒:同期可用 compute 也显著增加,因此不能把全部增量简单归因于 Agent。
- Long-horizon autonomy 仍需要人持续介入。 对能找到 ground-truth outcome 的任务,Agent 成功率在提升,但过去 6 个月中,成功完成的 4–8 小时任务里仍有 超过一半至少需要一次人工 intervention。这说明当前更现实的组织模式不是“无人研发”,而是
human sets direction → agents execute in parallel → human judges / redirects → agents continue。
核心启示:AI-native 研发的核心指标不该只是“生成了多少代码”,而应该观察 agent-workdays、实验吞吐、任务时长、人工介入率和真正的系统瓶颈如何迁移。代码生成越便宜,方向选择、验证和算力分配越会成为新的稀缺资源。
2. Announcing Mastra Factory Beta
- 作者/来源: Sam Bhagwat / Mastra
- 发布日期: 2026-09-08
- 原文: https://mastra.ai/blog/announcing-mastra-factory-beta
推荐理由: 这篇是很具体的 software factory 生产实践:Mastra 不只是描述“让 Agent 自动写代码”,而是把真实开源项目的 GitHub issues、Linear、Slack、sandbox、memory、review 和 human gate 放进同一条流水线。更值得看的是他们对 full-auto 失败模式 的复盘——自动化不是越连续越好,关键在于把每个阶段做成可暂停、可审查、可重新路由的控制点。
核心要点:
- Factory 的单位不是一次 Agent session,而是一条可配置 SDLC。 Mastra 用
Intake → Triage → Planning → Build → Review → Done组织工作,每个阶段都能独立设为 manual 或 auto;Agent 在 sandbox 中运行,用户可以查看 diff、tool activity、workspace 文件,随时补充上下文或批准动作。Mastra 表示,自 7 月 alpha 运行以来,Factory 已经承担约 25–35% 的 PR,并关闭 50–60% 的 issues。 - 他们从 full-auto 主动退回 staged automation。 最初 issue 一旦进入就一路自动跑到 review,但 backlog 导入会产生突发负载、基础设施压力和大量难审查工作;更严重的是,triage 阶段的错误假设会在 planning / implementation 中被放大。最终他们改成按阶段配置自动化:例如 triage 自动,但 planning、implementation、review 保留人工 gate,或者只让 bugfix 自动流转。
- Context 被做成持久化系统,而不是不断堆 prompt。 调查过程中大量文件内容、搜索和测试输出会被 observational memory 压缩为关键事件日志;更长期的知识则进入 graph-based wiki,节点保存带 citation 和 source-session 链接的事实,专门的 curator agent 维护它。运行中的 Agent 还可以通过 Signals 接收用户、协作者或其他 Agent 的新信息,并在原 session 中继续执行,而不是重新开一轮对话。
核心启示:Software factory 的难点不在“能否从 issue 自动生成 PR”,而在如何控制错误传播。真正可用的架构需要 staged gates、persistent context、sandbox isolation、可观察 session 和中途 steering;full autonomy 应该是这些控制面成熟后的结果,而不是起点。