1. DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds

推荐理由: 现在很多开源 coding model 的训练轨迹几乎都来自 OpenHands,一旦换到 Claude Code、Codex CLI、SWE-agent 这类不同 scaffold,模型表现可能明显掉下来。DCAS 把这个问题拆得很清楚:模型到底学会了软件工程能力,还是只学会了某个 agent harness 的行为习惯?这对做可替换、多后端的软件工厂非常关键。

核心要点:

  • 作者发现,使用 OpenHands 轨迹微调后的模型在 OpenHands 内表现良好,但迁移到非训练 scaffold 时明显退化;未微调的 base model 并没有同样的分化,说明问题与 scaffold-specific fine-tuning 强相关。
  • DCAS 提供一个 backend-substitution interception layer,不修改 CLI scaffold 本身,就能把任意 scaffold 与任意 backend model 组合起来做 cross-scaffold evaluation 和轨迹采集。
  • 论文将 planning 拆成显式 plan artifact 与隐式执行结构两部分;干预实验显示 planning 是高杠杆变量,而用少量 planning-aware trajectories 微调后,即使只在一个 scaffold 上训练,也能在多个未见 scaffold 上稳定获益。

2. Hardware Keystores for AI Agent Signing Workflows: A Zero-Trust MCP Enforcement Architecture

推荐理由: 当 agent 开始签 Git commit、调用生产 API 或持有 SSH/证书权限时,传统 .env、容器 secret、软件 vault 都还存在同一个根问题:原始私钥最终会进入软件可访问的内存。本文给出一个很工程化的答案——把“agent 是否值得信任”降级为次要问题,把密钥和授权边界放到硬件与确定性策略里。

核心要点:

  • 私钥通过 PKCS#11 固定在 HSM、TPM 或 smart card 内,agent、MCP server 和宿主进程只拿到 opaque handle 与签名结果,原始 key material 不进入普通进程内存。
  • 在硬件边界外再叠加五层 Zero-Trust enforcement:session identity、scope/quota、预先提交的 payload commitment、taint tracking、semantic intent validation/HITL;高风险操作必须逐层通过,而不是只依赖 LLM 自己拒绝恶意指令。
  • 在基于 AgentDojo 的 12 类 prompt-injection 场景中,三个会跟随注入的模型合计 baseline ASR 为 19.3%,完整保护栈下为 0/192;四个 benign 场景没有误拒绝。样本规模仍有限,但论文展示了一个重要方向:关键安全属性应尽量由确定性系统和硬件保证,而不是由模型对齐保证。