
九臂同模基准实录Maka 在 Terminal-Bench 2.1 全 89 任务上与八个编码 Agent Harness 的横向对比【免费下载链接】makaApache Maka (Incubating) is a high-performance agent workspace that keeps a complete record of everything it did.项目地址: https://gitcode.com/GitHub_Trending/mak/maka本文解析 Apache Maka 仓库中 docs/eval/terminal-bench-2.1-deepseek-v4-flash-nine-arm.md 记录的九臂编码 Agent Harness 对比实验九个完整的 Agent 系统Codex、Maka、Pi、DeepSeek Harness、ZCode、Reasonix、OpenCode、Kimi Code、Claude Code围绕同一个 DeepSeek V4 Flash 模型在 Terminal-Bench 2.1 全 89 个任务上执行端到端 pass1 评测。读者可以从中掌握这套同模对照实验的冻结契约、排行榜口径、成本归一化方法、结果核算与缺陷修复流程以及如何正确解读这类基准数据而不被单次运行的噪声误导。实验背景为什么是同模 Harness 对比而非模型对比Terminal-Bench 是面向终端/命令行代理Agent的任务套件要求代理在真实容器环境中完成诸如编译旧代码、修复 Git 仓库、逆向 ELF、破解 7z 哈希、搭建 QEMU 虚拟机等 89 个明确任务。本报告的关键实验设计是九个 Harness 共享同一个模型deepseek-v4-flash、同一个推理力度max、同一个官方任务验证器、同一套任务原生超时契约唯一移动的变量是 Harness 本身——包括它们各自的系统提示词、工具 Schema、上下文管理、进程生命周期与执行循环。因此报告明确声明这是完整 Harness 系统之间的对比不是单一组件消融实验ablation。原八臂队列Codex、Maka、Pi、Reasonix、OpenCode、Kimi Code、ZCode、Claude Code同时同批次运行DeepSeek HarnessDSH则在相同契约下作为后续对齐运行加入形成第九臂。BenchmarkTerminal-Bench 2.1revisiond49e28f1e4ddd13d289e85a5f312a66750951932显式 89 个任务Modeldeepseek-v4-flash每臂相同Reasoning effortmax开启 provider thinkingMetric官方任务验证器给出的端到端 pass1Per-task 结果terminal-bench-2.1-deepseek-v4-flash-nine-arm.csv总览与排行榜Maka 以 77.5% 居第二报告的核心结论TL;DR如下Codex 领先73/8982.0%Maka 第二69/8977.5%Pi 66/8974.2%DSH 65/8973.0%。九个 Harness全部通过同样的 28 个任务五个任务在所有 Harness 上全部失败extract-moves-from-video、filter-js-from-html、gcode-to-text、make-doom-for-mips、torch-pipeline-parallelism。经济性方面Pi 的单次通过成本最低$0.019739DSH 与 Maka 几乎并列$0.026230 与 $0.026307。原始八臂作为同一队列运行DSH 在相同基准、模型、推理、工具出口、权限、验证器与任务原生超时契约下单独运行因此九臂排名是描述性的descriptive而非配对因果比较paired causal comparison。排行榜采用记录即权威的投影口径报告将所选尝试记录到的 token、缓存与成本数值视为权威不对未观测到的 provider 用量做任何外推。RankHarnessPassedPass1TokensAverage/taskCache rateCost1Codex73/8982.0%259.62M2.92M98.6%$2.1052Maka69/8977.5%185.71M2.09M98.8%$1.8153Pi66/8974.2%131.40M1.48M98.5%$1.3034DSH65/8973.0%182.84M2.05M98.6%$1.7055ZCode63/8970.8%223.46M2.51M98.9%$2.2876Reasonix60/8967.4%216.17M2.43M99.0%$1.9357OpenCode58/8965.2%166.44M1.87M98.6%$1.7458Kimi Code53/8959.6%193.75M2.18M98.2%$2.1629Claude Code49/8955.1%247.60M2.78M98.9%$2.633Codex 与 Claude Code 之间的 26.9 个百分点差距对应 24 个任务在这套固定套件上每个任务约值 1.12 个百分点。Maka 以 77.5% 的通过率位列第二同时总 token 消耗185.71M与总成本$1.815均低于第一名 Codex259.62M / $2.105——这一高分低价的组合是后续成本归一化分析的重点。结果一致性28 全过、5 全挂、56 混合报告对 89 个任务的结果一致性做了归并这是评估套件难度分布的直接证据Agreement classTasksAll nine pass28All nine fail5Mixed outcome56其中全部通过的 28 个任务是九种 Harness 的基础能力共识例如break-filter-js-from-html、cobol-modernization、constraints-scheduling、fix-code-vulnerability、fix-git、polyglot-rust-c、vulnerable-secret等而全部失败的 5 个任务如make-doom-for-mips、torch-pipeline-parallelism说明当前模型能力在这些高难度任务上存在共同天花板。逐任务 CSV 是该计数的权威投影——它包含恰好 89 个唯一任务 ID并复现了排行榜中每个 Harness 的总数可通过 docs/eval/terminal-bench-2.1-deepseek-v4-flash-nine-arm.csv 交叉核验。结果归一化经济性每次成功通过的成本报告强调单次通过成本cost per pass是比总成本更公平的经济分母因为它把开销除以真正拿到分数的成功次数。该指标包含成功与失败所选单元格的记录成本即失败尝试的花费也算入分母。HarnessRecorded costPassedCost/passPi$1.30366$0.019739DSH$1.70565$0.026230Maka$1.81569$0.026307Codex$2.10573$0.028832OpenCode$1.74558$0.030084Reasonix$1.93560$0.032252ZCode$2.28763$0.036303Kimi Code$2.16253$0.040798Claude Code$2.63349$0.053741报告的措辞非常克制这些是每个单元格仅选一次尝试得到的描述性点估计descriptive point estimates不是账单发票也不构成统计意义上的成本等价声明。成本如何被计量源码中的 metering 机制这套成本数字来自仓库packages/eval中的计量基础设施。成本计算的核心实现在 packages/eval/src/provider-metering.tsderiveMeteringprovider-metering.ts只在代理已结算settled、有已准入请求、且 usage 请求数等于准入请求数时才判定用量完整usageComplete并仅在完整用量的前提下计算成本部分 token 数只能作为下界记录绝不折算成成本数字进入结果内核。deepSeekCostUsd从冻结的 DeepSeek 定价表DEEPSEEK_V4_FLASH_COST见 provider-metering.ts当前代码为 2026-08-17 发布的 off-peak 归一化版本按 cache hit / cache miss / output 三档计价——DeepSeek 只区分缓存命中与缓存未命中两类输入且写缓存不计费因此cacheWrite在 DeepSeek 上按 miss 价处理。该文件注释明确Eval 对所有臂统一从这张表计费而不是采信各框架自己转述的价格因此报告成本差异只能来自 Agent 实际消耗的差异。这正是缓存感知的 API 等价成本估计的机制来源——报告中所有成本数字都标注不是账单发票。冻结执行契约保证公平的前提条件为了让九个 Harness 的比较可复现、可审计报告冻结了以下执行契约Frozen execution contractDimensionValueBenchmarkTerminal-Bench 2.1; 89 explicit tasks at revisiond49e28f1e4ddd13d289e85a5f312a66750951932Modeldeepseek-v4-flashon every armReasoningmax; provider thinking enabledRepetitions1VerifierOfficial task-native Terminal-Bench verifierDeadlineEach tasks native agent timeout ×1Max steps100,000Web toolsRemoved from the provider-visible tool surfaceShell networkingEnabled, with benchmark-contamination egress filteringPermissionsNon-interactive benchmark executionSelectionValid scored attempts; authorized infrastructure replacements and recorded metric recovery其中从 provider 可见工具面移除 Web 工具与开启带基准污染出口过滤的外壳网络两条在源码中有直接实现证据Web 工具移除packages/eval/src/provider-web-tool-surface.ts 中的removeEvalWebTools维护一个禁用名单websearch、webfetch、fetchurlL20在请求体层面过滤 provider 可见的工具 Schema并统计被移除的工具数量与剩余工具名——这保证了所有臂在评测期间都看不到联网搜索类工具防止通过外部检索绕过任务意图。出口过滤与审计packages/eval/src/tests/egress-audit.test.ts 验证了完整的出口审计链路基于 mitmproxy 的 egress proxymaka-eval-mitmproxy记录hits.jsonl审计产物以sha256:前缀纳入清单缺失预期的审计日志会被判定为infra_failed并从计分中排除而空审计文件与截断审计则分别视为干净试验与显式证据。环境侧packages/eval/src/harness-environment.ts 通过MAKA_EVAL_EGRESS_REQUIRED、MAKA_EVAL_EGRESS_ALLOWED_HOST、MAKA_EVAL_NETWORK_POLICY_PATH三个环境变量把出口策略注入每个任务容器。这与报告Shell networking enabled, with benchmark-contamination egress filtering的契约一一对应。结果状态模型同样有源码支撑packages/eval/src/result.ts 定义了completed / subject_failed / infra_failed / indeterminate四种结果状态并携带score、usage、costUsd、durationMs、failureReason、artifacts字段——报告中的有效计分尝试基础设施替换记录到的指标恢复正是建立在这一状态模型之上的核算语言。结果核算与恢复DSH 从 61 到 65 的修复全程报告最重要的方法论章节之一是结果核算outcome accounting与恢复recovery——它展示了当验证器或基础设施缺陷与Agent 真实失败混淆时评测方如何通过实机检查与受控重跑把两者分开。八臂结果由完整队列加有界的基础设施 / 用量 / 轨迹恢复运行拼装而成最终轨迹清单记录了712/712 个单元格均具备物理轨迹产物、无缺失所选单元格。DSH 最初记录 61/89。实机检查发现三个 Eval 侧而非模型侧缺陷DSH 的五分钟 Bash 超时中断了软件包安装使dpkg无法用于后续验证软件包安装沿用了交互式tzdata配置路径违反了基准非交互执行契约DSH 与 Eval relay 在共享环境验证器可达之前就终止了任务创建的后台服务。修复提交28ebe0949将 Bash 生命周期延长至基准截止时间、使软件包安装非交互化、并仅在 DSH 成功退出后才保留后台子进程。此后 7 个受影响单元格被重跑4 个由失败转为通过hf-model-inference、merge-diff-arc-agi-task、polyglot-c-py、regex-log与 CSV 中这四行dshpass的记录一致3 个仍是真实的验证器失败dna-assembly、extract-moves-from-video、torch-pipeline-parallelism。修复后的 DSH 结果为65/89。这一节的价值在于基准分数只有经过基础设施缺陷 ≠ Agent 失败的显式区分后才具备可比性。这套追加式append-only恢复、旧事件保留在 WAL、裁决记录指向来源事件的原则与仓库中 packages/eval/FLEET.md 描述的评估基础设施恢复理念一致——已选择的结果不可变迟到的报告保留为证据并计入观测成本。局限性与正确解读报告在最后给出了严谨的边界条件这些是任何引用该数据的人都必须遵守的解读约束单次重复、单套固定套件所有结论只描述这一次冻结运行DSH 不是同时启动的第九臂它是配置对齐的后续运行因此九臂排名是描述性的部分持久化轨迹命中 Eval 记录上限这影响回放完整性不影响本报告采用的官方验证器得分成本直接采用记录的聚合值不做投影替换恢复准入可能采样到不同的模型轨迹CSV 冻结了本报告使用的最终所选结果。完整性验证Integrity报告附带一组可独立复核的完整性指纹CSV 行数89唯一任务 ID89重算通过总数73, 69, 66, 65, 63, 60, 58, 53, 49全九臂通过28全九臂失败5CSV SHA-256c27c3bcbfc3ebe8e21cc250dc409f02f49ae055032eaf2f19fd6349986e94e6aDSH 修复提交28ebe0949DSH 修复验证Eval Node 36/36Python relay/policy/artifact 33/33lint、format、Eval typecheck 全部通过与姊妹报告的关联本九臂报告是仓库中 四臂报告Codex / Maka / Claude Code / Reasonix的扩展后者对 Codex 与 Maka 的差距做了精确 McNemar 配对检验p 0.359未达显著并测量出约 19% 的跨运行任务结果翻转率——这是判断任何差几个任务结论是否可信的噪声地板。九臂报告则把视角拉宽到九个 Harness 系统在相同模型与契约下确认了排序结构与成本结构。两者结合使用可以得出一个审慎的结论在这套固定套件上Maka 以第二的成绩77.5%与接近最低的单次通过成本$0.026307位居第一梯队但单次运行的数据不足以支撑任何超越本次冻结运行的因果声明。【免费下载链接】makaApache Maka (Incubating) is a high-performance agent workspace that keeps a complete record of everything it did.项目地址: https://gitcode.com/GitHub_Trending/mak/maka创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考