1. The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents
- 作者: Roy Ganz、Mor Shpigel Nacson、Adi Kalyanpur、Ron Litman / AWS Agentic AI
- 发布日期: 2026-08-25
- arXiv: https://arxiv.org/abs/2608.24358
- AlphaXiv AI Overview: https://www.alphaxiv.org/abs/2608.24358
推荐理由: 这篇把 coding agent 里一个非常实际、但一直缺少系统测量的问题量化了:长任务跑到一半,便宜模型卡住后切到强模型,或者强模型完成最难部分后切回便宜模型,究竟值不值。关键结论不是简单的“router 要更聪明”,而是 handoff interface 本身就是 context engineering:接手者看到多少前序 trajectory,会直接改变质量、成本和重新探索开销。
核心要点:
- 实验在 SWE-bench Verified 上固定 mini-swe-agent harness,只改变模型家族、切换方向、7 个 switch points 和 4 种交接方式,共覆盖 58,000 次 agent runs、约 200 万次 LLM API calls、360 亿 tokens。四种接口分别是完整传递 Raw、由前模型压缩、由后模型压缩,以及只保留 working tree、完全丢弃 trajectory 的 Traj-drop。
- 升级模型并不适合直接继承完整轨迹。 Raw LC→HC 在 Claude / GPT 两个模型家族中分别只追回强模型质量优势的 47% / 36%。Claude 组合里,Raw handoff 平均成本甚至达到
$1.61,高于直接从头跑强模型的$0.72;丢掉低能力模型 trajectory、只保留代码修改后,GPT 的 quality recovery 反而从 36% 提升到 84%。低质量历史 context 会形成明显的 anchoring 和 input-cost burden。 - 降级模型恰好相反。 HC→LC 时,强模型留下的 trajectory 对便宜模型是有价值的 scaffold:GPT Raw downshift 保留了 79% 的强模型质量优势;删除 trajectory 后只剩 53%。所以 model routing 不能只决定“什么时候换模型”,还必须决定 换模型时传什么状态。更合理的 runtime 应把 repository state、trajectory、summary 和 reusable decisions 分开管理,而不是把整段 chat history 当成唯一 handoff artifact。
注:结果依赖 SWE-bench Verified、mini-swe-agent 和论文选取的模型组合,具体百分比不能直接外推到所有 coding agent;但“handoff state 应按接收模型能力定制”这个结论对多模型 Agent runtime 很有工程价值。
2. When Context Gets Root: Privilege Escalation in LLM Harnesses
- 作者: Xingbang He、Yuanwei Chen、Yi Qian、Haiyang Wei、Ligeng Chen、Zenan Fu、Linzhang Wang、Hao Wu、Bing Mao
- 发布日期: 2026-08-27
- arXiv: https://arxiv.org/abs/2608.27299
- AlphaXiv: https://www.alphaxiv.org/abs/2608.27299
推荐理由: 这是近期非常值得做 harness review 的一篇。很多 Agent 安全设计把 system / user / tool 的 instruction hierarchy 当成模型侧边界,但实际运行时,是谁负责给内容重新贴 role 标签?答案是 harness。 如果 delegation、persistent goal、scheduled task、skill 或 custom subagent 在重建 context 时丢失原始 provenance,攻击者控制的普通文件内容就可能被 harness 自己“升权”。
核心要点:
- 论文定义 Instruction Privilege Escalation(IPE):内容最初以低权限 tool output 进入 Agent,但在新的 model invocation 中被 harness 重建成 user-level,甚至 system-effective 指令。例如主 Agent 从 README 读到一段内容后把任务 delegate 给 subagent,subagent 收到的却是真正的
usermessage;模型没有发生 role confusion,是 harness 改变了内容的权限语义。 - 作者在 6 个 coding-agent harness、13 类攻击目标上测试,覆盖 confidentiality、integrity、availability 和 remote code execution。Full Access 下六个 harness 均可实现全部 13 项目标;提供 automatic permission review 的三个 harness 中,攻击同样覆盖全部 13 项。论文还通过 persistent goals 和 scheduled tasks 复现了相同的 tool→user escalation,说明问题并不限于 multi-agent delegation。
- 更关键的问题是 provenance 必须成为一等数据,而不能只保存最终 role。Permission reviewer 即使正确判断某个 action 高风险,也可能因为 reconstructed transcript 显示“user explicitly approved”而放行。对 Agent runtime 的直接启示是:context compaction、delegation、memory、scheduled tasks 和 skill loading 都应该保留
origin → transformations → current privilege的不可伪造链路,权限判断依据原始来源,而不是只相信当前 prompt surface。
注:论文展示的是攻击面和机制,不应把“13/13 objectives”理解为每一次攻击尝试都 100% 成功;作者报告的 escalated tool-to-user mean success rate 为 97.3%,不同 harness 的单次成功率仍有差异。真正重要的是其揭示的架构缺陷:context reconstruction 可以破坏原本正确的 instruction hierarchy。