ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

受控实验如何量化AI Agent效果?Better Harness Studio对比视图与verdict报告深度解析

2026/10/7 15:13:07 拓冰建站 浏览量
受控实验如何量化AI Agent效果?Better Harness Studio对比视图与verdict报告深度解析 受控实验如何量化AI Agent效果Better Harness Studio对比视图与verdict报告深度解析【免费下载链接】better-harnessAn open-source Harness Engineering platform for coding agents—define harnesses as code, run controlled experiments, inspect evidence, and compare outcomes. Turn task evidence into actionable team and organization insights.项目地址: https://gitcode.com/gh_mirrors/be/better-harness在 AI 编码 Agent 越来越普及的今天这个 Harness 到底比那个好多少往往只能靠感觉。Better Harness 是一个开源的 Agent 工作流改进平台其中Better Harness Studio 对比视图Compare View搭配verdict裁决报告正是为这个问题而生的它把 baseline 与 candidate 两套 Agent 配置放进完全相同的沙箱任务里做受控实验最终用一份可复核、可追溯的 verdict.json 给出量化结论——是 accept、reject还是证据不足。本文将带你从零看懂这套机制。为什么受控实验是量化 AI Agent 效果的关键 直接问 Agent你改得好不好答案是主观的跑一次任务对比代码又无法排除随机波动。Better Harness 采用软件工程中最可靠的做法只改变一个变量treatment axis其余条件全部冻结。一次对比实验会固定以下要素冻结项说明任务夹具fixture相同的合成 Git 仓库与任务 prompt以哈希锁定沙箱环境每次试验独立隔离网络默认拒绝环境变量走白名单运行时画像除被测变量外模型与运行配置保持一致评分器grader用确定性的检查项给结果打分0–100唯一的变量只有两种可选harnessAgent 的工作流/能力组合或runtime-profile运行时配置。这套设计定义在 aggregate.ts 中其核心理念写在源码注释里一次对比只允许移动一个变量。读懂 verdict 报告5 种状态与默认判定阈值 ✅实验结束后Better Harness 生成一份harness-compare-result.v1格式的 verdict 报告。它的核心是一个status 字段共 5 种取值见 verdict.tsaccept接受candidate 在配对试验中显著胜出且成本在护栏内need_more_work继续改进有提升但未跨过阈值或成本超标reject拒绝candidate 出现回归——通过率下降、配对胜负落后或平均分倒退insufficient_evidence证据不足跑完了、没变差但样本太少只能算冒烟测试infrastructure_error基础设施错误沙箱/执行层出了问题本次实验无效判定的及格线由默认策略给出见 aggregate.ts至少5 个配对试验硬性下限 2 个· 基础设施错误率 ≤20%· 单次成本比 ≤1.25×· 平均得分增益 ≥5 分一个容易被忽视的细节判定顺序是先查基础设施健康 → 再查证据量 → 再看回归 → 最后才谈提升。这意味着哪怕 candidate 分数再高只要试验大面积因环境问题失败报告也会直接判 infrastructure_error——坏掉的实验测不出任何东西。Better Harness Studio 对比视图长什么样 verdict 报告生成后Better Harness Studio 会通过 CompareView.tsx 把它渲染成可视化对比视图自上而下分三个区块决策摘要Decision Summary最醒目的位置显示 verdict 状态与判定理由旁边三个指标一眼看清证据强度——Evidence配对数是否达到最低要求达到则绿色否则警告Quality Delta平均得分差值 胜负/平局分布如 candidate 胜 3 / baseline 胜 1 / 平 1Cost Guardrail成本比是否落在护栏内如 0.92×上限 1.25×变体聚合表Variant Aggregatesbaseline 与 candidate 两行并排对比通过数、通过率、平均分、基础设施错误数、总成本、单次试验成本与积分消耗试验明细表Trials逐行列出每一次试验的变体、索引、harness、运行时画像、结果分类、耗时与变更文件让你能下钻到单条证据数据如何进入视图compare-model.ts 中的parseVerdict会先对整份报告做重算校验所有汇总数字通过率、成本、配对胜负都会从原始试验行重新计算一遍任何一个字段对不上就拒绝渲染。这是对抗手工编辑过的 verdict.json的关键防线——行是证据聚合只是它们的摘要。若尚未运行实验视图会显示空状态并给出一条可执行的提示先用harness-compare run experiment.json --out dir生成证据再以--evidence dir启动 Studio。CLI 用法详见 cli.ts。新手快速上手3 步跑通第一次对比实验 第 1 步准备实验清单。参照示例 experiment.json声明 baseline/candidate 两个 harness 部署、任务夹具与试验次数。第 2 步执行对比。在 harness 包 中运行harness-compare run experiment.json --out ./evidence。命令会为每个 harness/每次试验创建独立仓库、执行 Agent、评分并写出补丁、脱敏轨迹、沙箱回执与 verdict。第 3 步在 Studio 中查看对比视图。用--evidence ./evidence指向证据目录即可在可视化界面核对决策摘要、变体聚合与逐条试验明细。整套机制的设计背景还写在 Harness README 的 Compare and checkpoint execution 一节。小提示verdict 中的reason字段不是营销文案而是由试验行 策略计算出来的字符串。改动手工编辑过的报告会在 verdict.ts 的重算环节被直接拒收。为什么这套 verdict 设计值得信任 很多工具敢给你结论Better Harness 更在意结论可证伪配对比较而非独立汇总同一试验索引下的 baseline 与 candidate 组成一对消除夹具与执行顺序带来的系统偏差summarizeMatchedPairs成本分口径报告每尝试一次 / 每完成一次 / 每通过一次三种成本因为完成数不同时总成本对比毫无意义单对试验永远不能 accept一对胜利与噪声无法区分所以 2 配对是硬性下限沙箱回执随行每条试验都携带环境策略、网络策略、文件系统范围回执证据链完整可审计如果 verdict 结论需要下钻到Agent 到底做了什么Better Harness 的 Inspector 视图可以把一次会话中的提示词、工具调用与文件变更放在同一条时间线上核对与对比实验证据形成互补。进阶从两变体对比走向多车道受控实验 当前的harness-compare.v1是冻结夹具 双变体路径而团队下一步方向已由 ADR 文档明确harness-checkpoint-experiment-compare.md 定义了harness-experiment.v1清单支持同一检查点派生多条实验车道——一条回放历史轨迹另两条用不同 harness 或模型并行执行逐对对比contrast各自出 verdict。几个关键约束保持不变对比轴由运行器推导而非作者声明多轴差异只能描述、不能归因每车道仍受至少 2 个配对的证据下限约束。这保证了可视化扩展不会稀释 verdict 的统计门槛。把单次 verdict 放进趋势里看 单次对比回答这次改动行不行而 Better Harness 更擅长回答一段时间内 Agent 工作流是否在变好。平台的历史视图会跟踪 Agent Work Loop 的五个维度随报告次数移动形成趋势线下图为静态末帧受控实验的 verdict 正是这条趋势线上最可信的一类数据点——它不是感觉更好了而是配对证据 成本护栏下的量化结论。小结受控实验 冻结一切、只动一个变量这是量化 AI Agent 效果的地基verdict 报告 5 种状态 可重算的判定理由证据不足就明说绝不硬给结论Studio 对比视图 决策摘要、变体聚合、试验明细三层结构让结论与证据同屏可核对想继续深挖建议按顺序阅读compare-model.ts视图数据模型→ verdict.ts校验与判定→ ADR 文档多车道演进设计【免费下载链接】better-harnessAn open-source Harness Engineering platform for coding agents—define harnesses as code, run controlled experiments, inspect evidence, and compare outcomes. Turn task evidence into actionable team and organization insights.项目地址: https://gitcode.com/gh_mirrors/be/better-harness创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考