005 · Agent 自己合成测试,CUDA kernel 的正确性可信吗?
CUDA-Harness 用隔离的测试数据合成约束 Text2CUDA Agent;它减少了奖励投机,也暴露了测试与实现共享语义误解的边界。
CUDA-Harness 用隔离的测试数据合成约束 Text2CUDA Agent;它减少了奖励投机,也暴露了测试与实现共享语义误解的边界。
一项完整芯片设计流程评测:领域知识为何不足以保证成功,以及 Agent 的能力究竟属于模型还是整个执行系统。
读 HLS-Eval 的 Agent 评测论文:区分一次成功与多次采样成功,追问测试通过、可综合与硬件设计能力之间的距离。
今天关注 AI-native Agent 的两个结构性可靠性问题:Meta 用 Secure VM、credential isolation 和独立 Sentinel 把个人 Agent 的权限控制移出模型;ExecCritic 则证明 coding agent 的执行反馈只有在测试本身可信时才有价值,并用独立 Test Agent + fail-closed harness 避免 Agent 自己给自己验收。
今天关注 AI-native 软件工程的两个可靠性基础:AWS 把 agent evaluation 直接接进 GitHub Actions,让 Agent 行为回归像代码回归一样阻断合并;Scanning the Harness 则把 skills、MCP、hooks 和权限配置视为新的软件供应链,并量化真实仓库中的缺陷比例。
今天关注 agent harness 的两类工程问题:指令究竟通过哪些 surface 被可靠执行,以及 GUI agent 从能力 demo 走向可维护软件系统还缺什么。
Agent Plans 正在成为可版本化的人机协作工件;Active-SWE 把 coding agent 评测从被动修 issue 推向主动发现与修复 bug。
Coding agent 如何从历史反馈持续进化,以及如何识别 AI 生成的软件变更。
异步多 Agent 协作与可执行 coding-agent 任务生成。
Coding agent 的非功能改进能力与开发者理解损耗。