1. Online Monitoring and Corrective Steering of Programming Agents

推荐理由: 长周期 coding agent 的问题经常不是“不会写”,而是执行到中途偏离原计划、反复尝试失败动作,或者在没有可用 patch 时提前结束。LivePlan 的价值在于把监督层做得很轻:默认用确定性规则持续监控轨迹,只有发现异常时才调用 advisor LLM 给出高层纠偏建议。这更像一个可部署的 agent runtime guardrail,而不是再叠一个昂贵的 planner。

核心要点:

  • LivePlan 将“判断是否偏航”和“如何纠偏”拆开:规则监控器检查轨迹中的通用异常信号,只有触发异常后才调用 advisor LLM,因此避免每一步都重新规划。
  • 在 SWE-agent 上、跨 SWE-bench Verified 与 SWE-bench Pro、使用 5 个不同 LLM 评测时,问题解决率相对 vanilla SWE-agent 最高提升 15.2%,平均提升 9.9%,额外成本仅约 0.08 美元/实例。
  • 新增成功主要集中在中等和困难任务,同时对原本已成功的运行造成的 regression 很少。对 software factory 的启示是:agent autonomy 不一定需要更大的 orchestrator,而可以增加一个低成本、持续在线的 trajectory control plane。

2. AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection

推荐理由: 当 agent workflow 越来越长,LLM API 本身就变成基础设施依赖:server error、截断响应、错误 tool call 字段都可能沿着 multi-agent 链路放大。AgentChaos 把传统分布式系统里的 chaos engineering 引入 agent 系统,而且通过统一 HTTP 层注入故障,不要求修改 agent 源码,很适合做 agent platform / harness 的可靠性 eval。

核心要点:

  • AgentChaos 在共享的 LLM HTTP API 层做运行时、非侵入式 fault injection,覆盖 content 和 tool-call 字段上的 crash、omission、value 三大类故障,而不是为每个 agent framework 单独改代码。
  • 跨 agent 系统、benchmark 和 backbone LLM 的 65 种故障配置中,所有系统性能都明显下降,pass@1 最大可下降 50 个百分点;系统之间的韧性排名在不同模型上仍较稳定。
  • 这意味着可靠性更取决于 agent system implementation,而不只是模型能力;现有 fault diagnosis 对故障类型识别准确率低于 53%,对故障步骤定位低于 56%。对于 agentic software factory,LLM API failure injection 应当像数据库、网络和服务故障注入一样进入常规测试体系。