1. SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements

推荐理由: 现有 coding-agent benchmark 大多只看功能是否正确,这篇工作把评测扩展到重构、可维护性和结构改进,更接近真实软件工程。

核心要点:

  • SWE-NFI 从真实开源项目已合并的 Pull Request 中构建了 188 个任务,并将非功能改进整理为 92 条可执行规则。
  • 最佳 agent 的功能正确率达到 70%,但整体非功能改进能力仍落后于人类开发者。
  • 差距在结构性改进上最明显,说明“测试通过”不能作为 agent 代码质量的唯一验收标准。

2. (Im)Paired Programming: Coding Agents Improve Productivity but Harm Understanding

推荐理由: 这篇研究关注 coding agent 的隐性成本:任务完成更快,但开发者可能逐渐失去对代码的理解、维护和监督能力。

核心要点:

  • 研究让 54 名学生分别使用可直接修改代码的 agent 或普通聊天助手完成网站开发任务。
  • Agent 组初始完成效率更高,但在代码理解测试和后续独立扩展任务中表现更差。
  • 复制粘贴式提示和自动接受修改与更低的代码理解度相关;AI-native 工作流应主动要求解释、审查和人工复述关键设计。