1. Automated agent evaluation with Amazon Bedrock AgentCore and GitHub Actions

推荐理由: 这篇把 Agent 的 evaluation 从上线后的观察工具,推进成真正的 PR-time quality gate。对 AI-native 软件工程来说,这一步非常关键:prompt、model、tool schema 或 MCP 配置都可能让 Agent 行为回归,而传统单元测试并不一定能捕获这种变化。AWS 给出了一套完整参考实现,把 Agent、MCP、OAuth、trace、evaluation 和 GitHub Actions 串成一条可执行的 CI/CD 流水线。

核心要点:

  • Agent 行为可以像代码一样在 CI 中做 regression gate。 Pipeline 在 PR 上部署 dev Agent 和 MCP server,用代表性 prompts 执行真实任务,再对 trace 做 GoalSuccessRate、Correctness、ToolSelectionAccuracy、ToolParameterAccuracy 等评价;低于阈值就直接让 PR fail,而不是等用户上线后发现质量下降。
  • Evaluation 应与 runtime 解耦。 AgentCore Evaluate API 可以直接评分 OpenTelemetry spans,因此既可以评 live session,也可以对保存下来的 traces 做 deterministic-ish regression;这意味着团队可以把一批 golden trajectories 当成 Agent 的测试资产,而不必每次都重新访问生产依赖。
  • CI 本身也是 Agent security boundary。 文章用 GitHub OIDC 获取短期 AWS 凭证,并区分 machine-to-machine token 与真实用户 token;MCP 工具的 JWT validation、claim extraction 和 tool-level role check 分层处理。Agent evaluation 因此不只是“打分”,而是同时验证 tool selection、参数和权限边界。

核心启示:AI-native CI 不应只运行代码测试,还应该运行 Agent trajectory regression。Prompt、skills、tool schema、model 和 harness 都应该进入同一个 change → execute → evaluate → gate 循环。

2. Scanning the Harness: An Empirical Study of Supply-Chain Defects in AI Coding-Agent Configurations

推荐理由: 这篇把 coding-agent harness 明确当成一层新的 software supply chain。过去我们会审 npm / PyPI / Docker 依赖,但现在开发者同样会从 marketplace 或 GitHub 安装 skills、MCP servers、hooks、subagents 和 instruction files;这些东西最终可能以开发者权限执行,却普遍没有 lockfile、install-time validation 或清晰的权限语义。

核心要点:

  • Harness 已经具备传统依赖链的风险,却缺少传统依赖治理。 论文分析 3,171 个公开 GitHub 仓库,其中 2,660 个是组合多类 harness component 的真实 setups。研究发现 16.0% 的 setups 存在确认的 security defect,16.7% 存在至少一种确认缺陷;作者还专门用独立实现和两阶段复核过滤 scanner false positives。
  • 最常见问题非常“普通”,而不是高级攻击。 9.8% 的 setups 使用未固定版本的 MCP package,例如 npx -y @scope/server;3.1% 存在看似受限、实际允许 arbitrary execution 的 permission grant;3.8% 安装了会预先批准 shell 的 skill。也就是说,很多风险来自 dependency hygiene 和 permission semantics,而不是 prompt injection 本身。
  • Agent harness 需要自己的 lint / lock / policy layer。 论文中的 harness-eval 用确定性静态规则检查 Claude Code、Cursor、Copilot、Gemini CLI、OpenCode、Codex 等配置,并可输出 SARIF。真正值得借鉴的是:AGENTS.md + skills + MCP + hooks + permissions 不应该继续被当作文档碎片,而应该像代码和 IaC 一样进入静态检查、版本固定和 CI gate。

核心启示:当 harness 决定 Agent 能读什么、调用什么、以什么权限执行时,它本身就是可执行基础设施。AI-native 团队未来很可能需要类似 package manager + static analyzer + policy engine 的 harness governance。