1. OpenCodeReview: Determinism over Non-Determinism for Cost-Effective Agent-Based Code Review
- 作者/来源: Zhengfeng Li、Lei Zhang、Xianwei Wu、Zhengqi Zhuang、Yingjie Xu、Boge Wang、Shaofei Zhu、Chuan Wang、Guoping Rong
- 发布日期: 2026-08-10
- arXiv: https://arxiv.org/abs/2608.09290
- AlphaXiv Blog/Overview: https://www.alphaxiv.org/abs/2608.09290
- 代码: https://github.com/alibaba/open-code-review
推荐理由: 这篇最值得看的不是“又一个 code review agent”,而是它明确提出 deterministic engineering for uncertain agents:不要默认给 agent 最大自由度,而是在高价值边界主动注入确定性。对于 coding agent / agent harness,这比单纯继续扩展 bash、MCP 和上下文窗口更接近可生产的工程思路。
核心要点:
- OpenCodeReview 在三个位置收紧自由度:Rule-Guided Dispatch 确定性决定审查文件和规则;Grounded File Review 只暴露为 code review 设计的有界工具,并按文件并行 SubAgent;避免自由探索导致 context pollution 和 token snowball。
- 最后的 Independent Reflection 不是让 reviewer 自我反思,而是让一个只看到 diff 的独立 reflector 做 falsification-only 过滤。这个信息不对称设计的目的,是减少“同一个上下文、同一个偏差”造成的自我强化 hallucination。
- 在 AACR-Bench 的 200 个真实 PR、10 种语言、1,505 条专家验证评论上,跨 6 个 LLM backend,最佳 SEM-F1 相比同模型 Claude Code 达到 2.17×(25.10% vs. 11.57%),同时 token 消耗降低 5–15×。结论很直接:agent 系统的竞争力不只来自更强模型,也来自更小、更确定的 action space。
2. SiriusDeliver: Automating Data Warehouse Delivery at Tencent
- 作者/来源: Haining Xie、Xiaokai Zhou、Jiaming Yang、Siqi Shen、Ziwei Wang、Yifeng Zheng、Tengyue Xu、Yipeng Shi、Zefang Zong、Yang Li、Peng Chen、Jie Jiang、Debiao He、Xiao Yan、Jiawei Jiang / Tencent
- 发布日期: 2026-08-10
- arXiv: https://arxiv.org/abs/2608.09185
- AlphaXiv Blog/Overview: https://www.alphaxiv.org/abs/2608.09185
推荐理由: 这是很少见的 production-scale agentic workflow 案例。论文不把“生成 SQL”当作最终目标,而是把 context retrieval、依赖解析、workflow 配置、artifact 验证、平台提交、失败修复和经验沉淀做成一个完整交付闭环。它更接近 software factory,而不是一个会写代码的聊天框。
核心要点:
- SiriusDeliver 的核心不是单一 planner,而是三层闭环:hierarchical delivery agent 编排 scenario/context/artifact/platform skills;artifact lifecycle control 在提交前后验证和修复产物;trace-driven skill evolution 从成功与失败轨迹中持续更新可复用 skill。
- 两个月生产部署覆盖 6 个业务团队、4 类 warehouse task,服务 3,600 MAU、18,240 次 delivery session,达到 87.2% end-to-end success rate 和 73.5% autonomous submission rate。离线实验中,相比最强 skill-augmented baseline,成功率从 71.5% 提升到 86.0%,同时 token 消耗下降 30%。
- 一个月 A/B test 中,median delivery time 从 228 分钟降到 23 分钟,工程师净投入从 95 分钟降到 11 分钟,首次可执行 artifact 从 44 分钟降到 2.6 分钟,人工介入率从 100% 降到 21%,而最终成功率仍基本持平(97.6% vs. 98.1%)。最重要的启示是:AI-native 软件交付的杠杆点往往不在代码生成,而在跨系统 orchestration、artifact assurance 和可持续的 skill evolution。