1. From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale

推荐理由: 面向 AI 大规模产出代码后传统 review 吞吐不足的问题,把审查重点从泛化建议转向意图、偏移和高风险 diff 区域,属于较完整的软件工厂质量控制方案。

核心要点:

  • ARCTIC 包含意图预测、基于反向翻译的 drift detection,以及对最值得人工检查区域排序的 code spotlight;其设计来自 18,000 次代码审查的主题归纳。
  • 离线评测中,意图预测达到 0.86 F1,偏移检测与人工标注的 QWK 为 0.907;spotlight 用约五分之一 token 获得基线 AI reviewer 2.4 倍的质量估计效果。
  • 实验上线后,drift score 使代码错位额外下降 5.76 个点,意图预测获得 90.2% 认可;论文称上线以来尚无缺陷被归因于 self-reviewed diff。

2. Reusing Past Repairs Through Hierarchical Trajectory Abstraction for Coding Agents

推荐理由: 解决 coding agent 每次从零开始、丢弃历史修复经验的问题;它没有简单回放旧轨迹,而是将经验抽象成可迁移的多层计划。

核心要点:

  • STAIR 将历史修复轨迹转换为从细粒度诊断动作到高层修复策略的层次树,并保留不同抽象粒度的经验。
  • 面对新 issue 时,系统从多个层级选择相关计划节点,再适配成可执行的当前任务计划,通过 prompt 注入 agent。
  • 在 SWE-bench Verified 上,STAIR + Lingxi 达到 81.2% Pass@1;迁移到结构不同的 mini-SWE-agent v2 时,无需修改代码即可把 Pass@1 从 75.8% 提升到 81.0%,且原始未抽象轨迹明显更差。