1. Can AI agents conduct open-ended AI research? Early evidence from two case studies

推荐理由: 相比只评测可自动验证任务,这项研究用未公开的 NeurIPS 研究问题测试 agent,直接观察它能否完成开放式、长周期、需要研究判断力的工作。

核心要点:

  • 研究提出“影子评测”:把两篇未公开论文的核心问题交给 frontier agent,提供六天时间、3,000 美元 API 预算和 GPU 资源,再由原论文作者按顶会标准评审结果。
  • Agent 能独立完成代码、实验和论文撰写,但没有实质性解决研究问题;两份成果分别获得 2/6 和 1/6,均被明确拒稿。
  • 失败并非主要来自工程执行,而是研究判断:过早放弃方向、无法创造性响应负面反馈、不会有效回退、资源意识不足,并出现指令漂移。

2. AgenticRepair: Multi-Faceted Program Context Engineering for Agentic Vulnerability Repair

推荐理由: 这是 context engineering 在真实软件修复任务中的具体实现:不是简单扩大上下文,而是让不同 subagent 主动构造结构、运行时和版本历史三类证据。

核心要点:

  • 三个并行 subagent 分别提取跨文件数据流与内存操作、sanitizer 运行时行为,以及漏洞相关的 commit 历史,再合成为统一程序上下文。
  • 统一上下文被持续放入修复 subagent 的 episodic memory;agent 在隔离环境中反复生成最小补丁、重建项目并用 sanitizer 验证。
  • 在包含 300 个真实 C/C++ 漏洞的 SEC-Bench 上修复 220 个,成功率 73%;其中 90 个成功案例涉及多文件修改,明显高于通用修复 agent。