ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

浏览器Agent在WebVoyager拿下94%?Magnitude评测方法论与复现全解析

2026/9/15 17:57:51 拓冰建站 浏览量
浏览器Agent在WebVoyager拿下94%?Magnitude评测方法论与复现全解析 浏览器Agent在WebVoyager拿下94%Magnitude评测方法论与复现全解析【免费下载链接】browser-agentOpen-source, vision-first browser agent项目地址: https://gitcode.com/GitHub_Trending/magnit/browser-agentMagnitude是一款开源的、视觉优先Vision-first的浏览器 Agent它让 LLM 直接看屏幕并用自然语言控制浏览器——导航、点击、输入、提取数据一气呵成。它目前在业界权威基准WebVoyager上拿下了94% 的成功率位居第一。这个分数是怎么测出来的评分标准是什么普通开发者该如何复现本文将带你完整拆解它的评测方法论和复现步骤。▲ Magnitude 浏览器 Agent 实战演示终端中下发自然语言指令浏览器中自动完成操作一、WebVoyager 基准94% 到底测的是什么WebVoyager是一个真实世界网页任务基准与玩具网站式评测不同它的任务全部来自真实站点。本仓库内置的任务集包含642 条原始任务覆盖15 个真实网站例如网站类别任务数典型任务示例Wolfram Alpha46用 Wolfram 计算数学问题Cambridge Dictionary43查单词释义ArXiv42检索论文ESPN / BBC News41 / 34查询体育与新闻内容Booking40搜索酒店、比较评分Amazon / Google Flights38 / 39查价格、比航班每条任务就是一句自然语言指令如在 Apple 官网查询 iPhone 14 Pro Max 的以旧换新价值Agent 必须真正在浏览器里完成它。Magnitude 的 94% 意味着590 条打补丁后的任务中约 554 条被判为 SUCCESS。任务原始数据见 originalTasks.jsonl打补丁后的实际评测集见 patchedTasks.jsonl。二、方法论拆解94% 分数的四大支柱支柱 1视觉优先架构拒绝画框子大多数浏览器 Agent 的做法是给页面元素画编号框再让 LLM 选框。这在现代复杂页面上很难泛化。Magnitude 的做法完全不同视觉接地的 LLM 直接指定像素坐标点击不依赖 DOM 结构未来可扩展到桌面应用、虚拟机等任何看得见的场景这套架构的核心实现位于 browserAgent.ts评测中使用的规划提示词让模型安全地多规划几步动作定义在 planner.baml。支柱 2自定义 answer 动作 双保险超时评测执行器 wv-runner.ts 为每个任务注册了一个特殊的answer动作源码位置Agent 认为任务完成时直接给出最终答案并结束。同时有三层时间保护单任务20 分钟超时超时逻辑进程级25 分钟硬超时超时直接杀掉进程进程管理浏览器崩溃断网、页面关闭等自动重试最多 3 次崩溃恢复另外Agent 的提示词里还特意注入了当前真实日期日期注入避免模型用训练数据里的过期认知去判断未来日期。支柱 3LLM 裁判评分而非简单的 URL 匹配这是最容易被忽略、却最影响公平性的设计。Magnitude 采用的是WebVoyager 官方原版评估提示词EVALUATION_PROMPT由 LLM 裁判结合三样东西给出 SUCCESS / NOT SUCCESS 判定原始任务指令结果截图视觉证据Agent 的最终文本回答提示词中还内置了严格的防钻空子规则例如如果文本回答与截图矛盾以截图为准如果回答中包含截图没有提及的内容才采信回答。多子任务如找到车库并总结评论缺一项即判失败。这种证据链优先的裁判方式比单纯比对最终 URL 或文本相似度要严格得多分数也更硬。支柱 4任务补丁机制让过时任务保鲜WebVoyager 发布于 2024 年很多任务带有时效性搜索 2024 年 1 月 1 日巴厘岛的酒店—— 日期已过去任务不可能完成查询搭载 M3 Max 芯片的 MacBook Pro 价格—— 芯片已换代Magnitude 团队为此建立了一套透明、可审计的补丁流程patches.json 中每条修改都写明理由如将 Booking 任务的 2024 年日期更新到 2026 年使任务可行、M3 Max 更新为 M4 Max 以保持高端当代产品的考察意图patch_tasks.py 应用补丁并逐条校验原文匹配防止误改无法修复的任务如已下架商品会被移除590 条 642 - 移除 保留补丁原则只有两条保持任务考察意图不变、只更新失效的具体值。这使得分数在时间推移后依然可复现也是其 94% 被社区认可的关键。三、复现指南三步跑通 WebVoyager 评测 第 1 步克隆仓库git clone https://gitcode.com/GitHub_Trending/magnit/browser-agent第 2 步配置模型Magnitude 要求一个大尺寸的视觉接地模型。推荐Claude Sonnet 4评测代码默认使用claude-sonnet-4-20250514、温度 0.5模型配置。评测入口 wv.ts 也内置了裁判模型的配置。第 3 步运行评测与统计评测框架是标准的 CLI命令定义常用玩法bun wv.ts run Booking --workers 4 # 并发跑 Booking 类 40 条任务 bun wv.ts run Booking--5 # 只跑单条任务调试神器 bun wv.ts run Amazon --failed # 只跑失败/未完成的用于 passN bun wv.ts eval Booking # 对已跑完的任务做 LLM 裁判评分 bun wv.ts stats -v # 按类别输出成功率/成本/动作数每条任务会落盘两个文件到 results/任务ID.json完整记忆快照 Token 用量 成本 动作数任务ID.eval.json裁判的推理过程与 SUCCESS 判定评分落盘跑完后stats命令会输出类似下面的分类汇总统计实现 Evaluation Statistics by Category Category | Success Rate | Avg Cost | Avg Actions -----------------|-------------------|------------|------------ Amazon | 36/38 (94.7%) | $0.34 | 8.2 Booking | 38/40 (95.0%) | $0.41 | 11.5 ... TOTAL | 554/590 (93.9%) | $0.35 | 9.8想逐条回看 Agent 的截图和推理仓库里还提供了一个可视化页面 viewer.html可直接打开 results 目录下的产物做人工复核。四、为什么这套方法论值得借鉴对任何想评测或宣传浏览器 Agent 的团队Magnitude 的 evals/webvoyager/ 目录给出了四个可以直接抄作业的做法裁判要有证据链截图 回答 指令三方交叉验证规则写死在提示词里时效性任务要保鲜补丁文件里逐条写明修改理由可审计、可复现基础设施要健壮进程隔离每任务一个子进程、崩溃重试、双层超时590 条任务才能无人值守跑完结果要全量落盘记忆快照、Token 成本、动作数、耗时全部持久化stats一跑就有分类报表五、写在最后94% 不只是一个分数更是一套可复现的工程流程视觉优先的架构保证了看得懂answer 动作与日期注入保证了做得完LLM 裁判保证了评得严任务补丁保证了测得久。如果你想让自己的项目跑在 WebVoyager 上上面的三条命令加上一个强视觉模型就已经起步了。更多使用细节可参考仓库文档目录 docs/例如 query.mdxagent.query 用法与 browser-interaction.mdx浏览器交互机制。【免费下载链接】browser-agentOpen-source, vision-first browser agent项目地址: https://gitcode.com/GitHub_Trending/magnit/browser-agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考