1. Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents
- 作者/来源: Zining Huang、Haoran Que、Hong Zeng、Ge Zhang、Zuo Wang、Jin Chen、Haodong Wang、Zhongfei Hou、Changxin Pu、Shen Yan、Wenhao Huang
- 发布日期: 2026-08-12
- arXiv: https://arxiv.org/abs/2608.11727
- AlphaXiv: https://www.alphaxiv.org/abs/2608.11727
推荐理由: coding agent 的规则已经不只存在于 user prompt,而是散落在 system prompt、项目文件、tool description、skill description 等多个 instruction surface。Harness-IF 试图回答一个更工程化的问题:Agent 真的是在“遵守规则”,还是刚好本来就会这么做?这对 AGENTS.md、CLAUDE.md、Skills 和 MCP/tool contract 的设计都很直接。
核心要点:
- Benchmark 包含 60 个真实多轮 coding tasks、642 条规则库、256 条实际判定规则,规则被放到五种可配置 instruction surface 上,而不是只测 user prompt。
- 提出 Against-Prior Accuracy(AP-Acc):只统计那些与模型默认行为相反的规则,从而区分“真正服从”与“碰巧一致”。12 个 frontier model 的总体准确率为 72.1%–85.9%,AP-Acc 只有 66.1%–78.6%;所有模型在 against-prior 规则上都下降,平均差 5.81 个百分点。
- 一个冲突实验发现 instruction precedence 并不简单服从“prompt 越深优先级越低/高”的直觉:聚合结果中 system prompt、project files、user instructions 的优先级高于 tool 和 skill descriptions。对 harness 来说,instruction placement 本身就是需要评测的系统设计变量。
2. Software Engineering for and with GUI Agent
- 作者/来源: Shengcheng Yu、Yuchen Ling、Junyang Xing、Quan Zhou、Chunrong Fang、Zhenyu Chen
- 发布日期: 2026-08-10
- arXiv: https://arxiv.org/abs/2608.09278
- AlphaXiv: https://www.alphaxiv.org/abs/2608.09278
推荐理由: GUI agent 很容易被当成“模型会不会点按钮”的能力问题,这篇综述把它重新放回完整的软件工程生命周期:architecture、testing、recovery、observability、privacy、human escalation 和 maintenance。对所有会操作真实环境的 agent,这些问题其实都成立。
核心要点:
- 作者系统梳理了 2018 年 1 月到 2026 年 4 月的 336 篇 GUI-agent 论文;当前架构越来越趋向模块化的 perceive–reason–act loop,但 recovery、human escalation、safety enforcement 和 auditability 明显落后于核心能力。
- 评测虽然越来越 interactive,却仍主要围绕 task success,protocol 难以横向比较;对 release 后的维护、benchmark 之外的测试和真实运行故障覆盖不足。
- 真正走向 production 需要把 GUI agent 当作长期运行的软件系统:把 可恢复执行 + lifecycle testing + reproducible eval + permission/privacy control + human governance 一起设计,而不是继续单独堆模型能力。