1. Industrial Practice of LLM-Based Test Case Carving and Assertion Generation

  • 作者/来源: Haozhen You、Zhen Dong、Jingjing Wang、Qiang Li、Xin Peng / arXiv、ISSTA 2026
  • 发布日期: 2026-07-27
  • 原文: https://arxiv.org/abs/2607.24000

推荐理由: 这是一个经过九个月生产部署验证的 AI-native 测试工程案例。它没有让 LLM 独立猜测测试逻辑,而是把真实流量、语义生成和确定性校验组合成可落地的工作流。

核心要点:

  • NL2Test 以自然语言业务场景和真实执行流量为输入,自动提取最小可重放请求序列、恢复跨请求数据依赖,并生成与业务意图一致的断言。
  • 系统让 LLM 负责语义理解和受约束的代码生成,同时用确定性算法完成请求过滤、值一致性确认和断言路径校验,降低幻觉与不稳定字段带来的错误。
  • 在 51 个工业场景中,精确匹配率为 82.4%,允许少量修改时 98.0% 可用;九个月内生成 3,196 个测试用例,代码采纳率达到 85.4%。

2. Evaluating the Impact of Explainable AI on Trust in AI-Assisted Code Review

  • 作者/来源: Zhenhan Gao、Marvin Muñoz Barón、Umm-e Habiba、Daniel Graziotin、Stefan Wagner / arXiv
  • 发布日期: 2026-07-27
  • 原文: https://arxiv.org/abs/2607.24601

推荐理由: AI 代码审查的关键问题不只是准确率,还包括人类是否会正确地信任、质疑和采纳建议。这篇研究用真实代码变更和受控实验分析了不同解释深度对开发者决策的影响。

核心要点:

  • 研究让 34 名参与者分别体验三种代码审查界面:完整解释加审查建议、仅审查建议、无解释,并比较信任、采纳率、判断理由和耗时。
  • 完整解释获得最高主观信任度(3.99/5),但仅提供审查建议的中等解释组获得最高采纳率(89.22%);更充分的解释可能促使开发者更主动地质疑 AI。
  • 无解释组的信任和采纳率最低,而解释深度没有显著增加审查时间,说明可解释性可以改善人机协作,而不一定牺牲效率。