1. Build zero-trust AI agents that judge intent, not just syntax

推荐理由: 这篇把 Agent 安全从“在 Agent 代码里写更多 guardrail”推进到了独立的 runtime governance plane。Google 的思路不是要求模型永远识别攻击,而是让所有 prompt、tool call 和跨轮行为都经过 Agent Gateway,再由模型外的安全组件决定是否允许继续执行。对 AI-native 系统来说,这种设计比单纯做 prompt injection 防御更重要:权限、业务规则和异常检测应该属于平台,而不是属于某个 Agent prompt。

核心要点:

  • 把治理从 Agent code 移到 runtime。 Model Armor 在模型执行前筛查 prompt injection、jailbreak、恶意 URL 和敏感数据;Semantic Governance Policies 则在 tool call 真正执行之前,根据用户意图、会话历史和业务规则判断是否允许调用,Agent 本身无法绕过这层控制。
  • 规则需要理解语义,而不只是检查参数是否合法。 文中的退款案例中,参数和 SQL 都完全合法,但“数字软件超过 30 美元不能自动退款”属于业务语义;自然语言 policy engine 可以直接对 issue_refund 这样的高风险工具进行 allow / deny,而不必把所有产品类别写进 regex 或硬编码规则。
  • 安全要覆盖整条 trajectory,而不是单轮输入输出。 单次 20 美元退款都可能合法,但连续多轮累积退款可以形成攻击。Agent Anomaly Detection 通过 session telemetry 观察重复 tool call、写入频率和累计参数,并可把检测结果反向生成新的 runtime policy,无需修改或重新部署 Agent。

核心启示:生产 Agent 的治理边界应该独立于 Agent 本身:prompt screening → semantic policy gate → tool execution → trajectory anomaly detection → policy remediation 可以成为平台级闭环。

2. T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

推荐理由: 很多 coding-agent 工作主要优化 inference-time harness:prompt、tool、context、retry 和 verifier。T1 更进一步,直接把真实 terminal interaction 和 executable verifier 放进强化学习训练过程,让模型学习如何在 300+ tool-call 的长任务里探索、失败、恢复和继续执行。它说明 coding agent 的下一阶段不只是“给基础模型套更好的 harness”,还可能是 model 与 harness/environment/verifier 一起训练

核心要点:

  • 训练环境就是实际 Agent runtime。 T1 是一个 122B MoE 模型,rollout 直接运行在真实 shell + cloud sandbox 中,单个任务最多包含 300+ 次 tool call;reward 来自任务自己的可执行 verifier,而不是只根据最终文本答案评分。
  • 长时程任务需要更密集的执行反馈。 论文没有只使用任务最终 pass/fail,而是使用 Test-Count Reward,把通过的 verifier/assertion 数量作为 dense process reward。这样即使任务没有完全完成,编译成功、部分测试通过等中间进展也能形成训练信号。
  • Agent RL 还必须解决训练系统本身的一致性。 TITO 保证 rollout 与训练阶段使用完全相同的 token IDs,R3 记录并重放 MoE 在 rollout 时的 expert routing,减少 training/inference mismatch。最终 T1 在 Terminal-Bench 2.1 上从 base model 的 43.8% 提升到 64.0%,在 Long-Horizon Terminal Bench 上达到 27.9%。

核心启示:coding-agent 的 verifier 不只适合做 eval,也可以成为训练信号。未来的 Agent stack 可能是 model + sandbox + tools + verifier + RL loop 的整体共设计,而不是模型和 harness 各自独立优化。