1. How Basis builds long-horizon accounting agents with Cursor
- 作者/来源: Cursor Team / Basis
- 发布日期: 2026-09-04
- 原文: https://cursor.com/blog/basis
推荐理由: 这篇最值得看的不是“会计 Agent 能做多久”,而是 Basis 如何把 context 当成 production input 来管理。对于会运行数小时、跨越数百个决策的 Agent,最终答案正确并不足以证明过程可靠;团队需要明确检查 Agent 是否查了正确证据、是否保留来源、是否在信息不足时采取了正确动作。Basis 因此把 prompt、skills、instructions、tool descriptions 等 runtime context 与独立的 behavior spec 分开:前者是实现,后者是标准。
核心要点:
- Long-horizon Agent 不能只看最终 outcome。 一个税表可能最终数字正确,但 Agent 可能没有查询 primary authority、没有保存数据来源,或者用了无法泛化的路径。Basis 的任务通常包含数百个相互依赖的决策,因此更需要对 trajectory 中的关键行为做局部、持续的验证。
- Behavior spec 是 Agent 的“可执行验收标准”,但不是 prompt。 Spec 用 Markdown 描述某种行为何时适用、应检查什么证据、应做什么决策、信息不足时怎么办,以及什么算失败。Judge 读取 spec + trajectory + tool calls / artifacts / sources / decision records,返回 true / false / NA;这样不需要为整个长任务构造昂贵的完整 ground truth,也能检查关键过程是否可靠。
- Agent 开发循环变成
spec → trajectory → judge → runtime change → rerun。 Spec 与 runtime 分离:spec 作为长期标准保持稳定,工程师根据失败 verdict 修改 context、tools、prompts 或 execution framework,再重新运行。Basis 表示其 Agent 单个 deliverable 可工作 5+ 小时;Form 1065 原本约需人工 30–40 小时,Agent 可在约 6–7 小时完成。
核心启示:AI-native product 的“代码”不只包括传统程序,还包括自然语言 context。既然 context 会直接改变生产行为,它就应该像代码一样被 review、version、test,并由独立 spec 验证。
2. HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
- 作者/来源: Yuhao Wu、Jingyuan Zhang、Jiajun Shi 等
- 发布日期: 2026-09-01
- arXiv: https://arxiv.org/abs/2609.01437
- AlphaXiv: https://www.alphaxiv.org/abs/2609.01437
推荐理由: 过去大量 benchmark 都是在固定 harness 下评模型能力,但真正的 coding agent 能力很大程度取决于 model 外部的 loop、tools、context management 和 execution logic。HarnessDev 把评测单位从“模型完成了多少 task”改成 模型能不能造出并持续改进一个 runnable harness。这直接回答了 self-improving agent 更根本的问题:未来 harness engineering 是否也可以被 Agent 自己自动化。
核心要点:
- Benchmark 分为 Creation 和 Evolution 两阶段。 Creation 中,模型只从 minimal seed 和少量开发案例开始,自己构造完整执行系统;Evolution 中,再根据下游执行反馈持续修改自己的 harness。最终不仅评 held-out task success,还评 execution-token cost,因此同时观察能力和 runtime efficiency。
- 自动生成 harness 目前还不能普遍替代成熟人工 harness。 实验覆盖 6 个 creator LLM、4 个领域、5 个 downstream benchmark,共 2,207 个独立 evaluation instances。生成的 harness 在 coding、search / research 上仍明显落后于成熟人工实现,但在 writing 和 ML experimentation 上可以达到或超过所选 reference;不同 harness 的执行 token 成本差异也很大。
- Harness evolution 能提升,但目前不稳定且强依赖 runtime model。 Evolution 阶段确实能产生性能收益,但提升不能稳定迁移到 held-out task;固定 harness、替换执行模型后,收益也会明显变化。这说明 harness 不是一个与模型完全独立的“通用程序”,而更像与特定模型共同优化的 runtime policy。
核心启示:下一阶段的 Agent scaling 可能不只是训练更强模型,而是让模型参与构造和优化自己的 harness;但在真正 self-evolving 之前,仍需要解决泛化、回归保护、成本约束和跨模型迁移。