1. StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents
- 作者/来源: Yining Hua、Hongbin Na、Yifan Zhou、Akshay Kalose、Cyrus Ayubcha、Levi Lian
- 发布日期: 2026-08-18
- arXiv: https://arxiv.org/abs/2608.18050
- AlphaXiv: https://www.alphaxiv.org/abs/2608.18050
推荐理由: 这篇把 coding agent 已经比较熟悉的 repository state contract 推广到文档、表格、幻灯片、PDF 和混合文件工作区。核心问题很实际:Agent 搜索时看到的 parsed view、真正编辑的 native file、review 时看的 diff,以及最终提交的 artifact,可能并不是同一个版本。StagedWorkspace 的思路是把 workspace state 本身变成 Agent runtime 的一等公民,而不是默认文件系统永远一致。
核心要点:
- 提出 workspace-state contract:parsed search、native operations、review diff 和 submission 都必须显式绑定到具体 workspace version;系统用 native file 的 content hash 绑定解析记录和 diff,防止 Agent 基于旧证据修改新文件,或提交与推理证据不一致的产物。
- 在固定 harness 的 OfficeQA Pro / APEX-Agents ablation 中,同时提供 parsed + native 双视图在所有受测模型上都有最高点估计;相对受限的单视图,OfficeQA Pass@1 提升 8.3–12.1 个百分点,APEX mean rubric score 提升 4.7–9.2 个百分点。作者的 SW-AGENT 在同模型比较下也显著高于已发布结果。
- 对 57 个 file-editing tasks 的 paired ablation 显示,让 Agent 看得到 diff 本身就是能力变量。这说明知识工作 Agent 不应该只拥有“文件读写工具”,还需要 staged edits、versioned evidence、reviewable diff 和明确 submission state,形成类似 Git 的工作区语义。
2. On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification
- 作者/来源: Qinyuan Ye、Yu Li、Yada Pruksachatkun、Jiaxin Zhang、Chien-Sheng Wu / Salesforce AI Research
- 发布日期: 2026-08-18
- arXiv: https://arxiv.org/abs/2608.18066
- AlphaXiv: https://www.alphaxiv.org/abs/2608.18066
推荐理由: 这是对“Agent 会通过 memory 越用越聪明”这个直觉的重要压力测试。作者重新评估 Agent Workflow Memory 和 ReasoningBank,发现 self-improvement loop 不只是积累经验,也会积累随机性、错误归因和环境误解。对任何准备做长期 memory / skill evolution 的 Agent 系统都很有警示意义。
核心要点:
- 在多次重复实验中,加入 self-improvement memory 后,24 个比较中的 17 个(约 71%)运行方差变大,同一实验最好与最坏 run 的差距最高可到约 10 个百分点。原因是 memory state 有路径依赖:早期一次随机成功或失败,会改变之后写入和检索的经验。
- 任务顺序是一个隐藏变量。默认 benchmark 顺序带有明显的 easy-to-hard curriculum;ReasoningBank 在默认顺序上平均表现是 +1.5%,随机打乱任务后反而变成 -4.5%。真实用户请求不会按课程表出现,因此只在固定顺序下展示“持续进步”很可能高估了系统稳定性。
- 错误 memory 的根源之一是 underspecification:memory writer 不知道环境不能调用 API、不能请求用户确认,或者误解了模糊任务,于是把“看起来合理但不可执行”的策略写进长期记忆,随后反复传播。加入 rubric、环境反馈和更明确的 memory prompt 后,只追回了约 31% 的 shuffled-order 性能损失,说明 self-improving agent 需要 memory validation、provenance 和多 run / 多 order eval,而不只是继续堆经验。