1. From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale
- 作者/来源: Chandra Maddila、Mashrur Rashik、Euna Mehnaz Khan、Smriti Jha、James Saindon、Nachi Nagappan、Peter C. Rigby
- 发布日期: 2026-07-31
- arXiv: https://arxiv.org/abs/2607.29516
- AlphaXiv: https://www.alphaxiv.org/abs/2607.29516
推荐理由: 面向 AI 大规模产出代码后传统 review 吞吐不足的问题,把审查重点从泛化建议转向意图、偏移和高风险 diff 区域,属于较完整的软件工厂质量控制方案。
核心要点:
- ARCTIC 包含意图预测、基于反向翻译的 drift detection,以及对最值得人工检查区域排序的 code spotlight;其设计来自 18,000 次代码审查的主题归纳。
- 离线评测中,意图预测达到 0.86 F1,偏移检测与人工标注的 QWK 为 0.907;spotlight 用约五分之一 token 获得基线 AI reviewer 2.4 倍的质量估计效果。
- 实验上线后,drift score 使代码错位额外下降 5.76 个点,意图预测获得 90.2% 认可;论文称上线以来尚无缺陷被归因于 self-reviewed diff。
2. Reusing Past Repairs Through Hierarchical Trajectory Abstraction for Coding Agents
- 作者/来源: Yisen Xu、Jiayuan Zhou、Ruiqi Pan、Tse-Hsun Chen
- 发布日期: 2026-07-31
- arXiv: https://arxiv.org/abs/2607.29658
- AlphaXiv: https://www.alphaxiv.org/abs/2607.29658
推荐理由: 解决 coding agent 每次从零开始、丢弃历史修复经验的问题;它没有简单回放旧轨迹,而是将经验抽象成可迁移的多层计划。
核心要点:
- STAIR 将历史修复轨迹转换为从细粒度诊断动作到高层修复策略的层次树,并保留不同抽象粒度的经验。
- 面对新 issue 时,系统从多个层级选择相关计划节点,再适配成可执行的当前任务计划,通过 prompt 注入 agent。
- 在 SWE-bench Verified 上,STAIR + Lingxi 达到 81.2% Pass@1;迁移到结构不同的 mini-SWE-agent v2 时,无需修改代码即可把 Pass@1 从 75.8% 提升到 81.0%,且原始未抽象轨迹明显更差。