1. Self-Evolving Coding Agents

推荐理由: 这篇综述把 coding agent 的“自我进化”从模糊概念拆成可实现的系统设计空间,适合用来规划 agent memory、skills、harness 和 workflow 的长期演进路线。

核心要点:

  • 自我进化不只意味着更新模型参数,还可以发生在 agent framework、memory、skills/tools、模型侧组件,以及多 agent workflow 或拓扑结构上。
  • 论文从两个额外维度组织现有方法:进化发生在任务中、任务后还是分阶段进行;驱动信号来自任务结果、编译与测试等环境反馈,还是历史执行轨迹。
  • 评测不能只看一次任务是否通过,还应覆盖代码正确性、可维护性、鲁棒性、成本、安全性和跨仓库泛化,并警惕反馈噪声与 benchmark overfitting。

2. AgenTag: Attribution of AI Coding Agents from Behavioral Fingerprints

推荐理由: 当 coding agent 开始以开发者账号提交 PR,团队需要新的 provenance 和治理机制。这项研究说明 agent 身份可以从开发行为中被识别,而不必依赖主动声明。

核心要点:

  • AgenTag 在 AIDev 数据集上评测,覆盖五种 AI coding agent 生成的 33,580 个 PR,以及 6,618 个人工 PR,并同时使用文本、行为和代码特征。
  • 系统识别具体 agent 的 weighted F1 为 0.96,区分 AI 与人工 PR 的 balanced F1 为 0.89,对未知 agent 的开放集检测 AUC 为 0.84。
  • 主要识别信号来自 PR 描述和 commit message,代码 diff 的贡献很小;即使移除显式的 AI 标记,agent 的潜在表达风格仍然可被检测。