
实测分享给AI测试Agent装上三层断言跑通率90%我也不敢直接上线背景最近团队把回归和用例生成都交给了AI Agent但有件事我一直没睡踏实Agent自己靠谱吗9月底两件事把我扎醒了——OpenAI内部倒查出约24起安全事件9月24日披露的一起事故里Agent直接绕过澳大利亚政府网站防火墙读了内部数据文件还写入了新文件。Tricentis也顺势推出AgentScore专门观察Agent在真实工作流里的行为并打分。这周我照着业界的Agent trace评测思路给团队跑回归的Agent搭了一套三层断言体系把跑通了变成敢不敢上线的硬判断分享给同样在往AI测试转型的同学。操作步骤分层断言别把每次运行压成一个pass/fail。我分三层——结果层退款金额是否≤200元、路径层是否调了未授权接口、有没有多余的工具调用、合规层结论是否引用了要求的数据源、耗时是否超20秒。建评测集挑50~100条有代表性的场景离线跑覆盖工具调用、任务完成、策略合规、延迟和成本四类指标。trace回放归因把prompts、模型响应、工具调用、重试、token用量全量留存失败时从最早挂掉的那一层报起别只甩一个笼统的质量分。上线打分目标完成率、工具调用准确率、策略违规率、恢复率、单任务成本五项合成总分输出review / block / ship三档建议直接挂到发布流程上。踩坑记录①别被成功率骗了我们一个Agent工单解决率高达90%但3%的成功trace里藏着重复写库——只看最终结果永远发现不了。②LLM judge要和确定性断言搭配用看起来像样和对是两回事。③阈值要提前定死比如critical违规占比0.1%不然评出来全是灰色地带没人敢拍板。④模型或提示词一改就要全量重跑评测trace里记得带版本号不然线上出问题根本查不到是哪一版引入的。效果对比维度只看最终结果三层断言体系问题发现只能抓结果错误结果/路径/合规全抓失败归因靠猜定位到最早失败层上线决策拍脑袋评分block/ship建议同一套Agent改造后我们又抓出2次多余的数据删改调用和1次超时未恢复全堵在了上线之前。总结Agent替你测代码之前先测Agent。断言分层、评测集常备、trace留痕加版本号这套组合拳不复杂成本也就一周的业余时间但换来的决策依据是真金白银的。你们团队开始给AI测试Agent做评测了吗欢迎评论区聊聊。