ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

解密Prompt系列30. LLM Agent之互联网冲浪智能体

2026/8/27 13:28:58 拓冰建站 浏览量
解密Prompt系列30. LLM Agent之互联网冲浪智能体 前言这一章我们介绍能自主浏览操作网页的WebAgent们和相关的评估数据集包含初级任务MiniWoB高级任务MIND2WEB可交互任务WEBARENA多模态WebVoyager多轮对话WebLINX和复杂任务AutoWebGLM。MiniWoB数据集Reinforcement Learning on Web Interfaces using Workflow-Guided Explorationhttps://miniwob.farama.org/这两年webagent的论文里几乎都能看到这个评测集的影子但这篇论文其实是2018年就发表了。所以这里我们只介绍下数据集的信息~MiniWoB是基于gymnasium的模拟web环境它在OpenAI的MiniWoB数据集上补充了更多复杂交互可变页面等网页交互行为最终得到的100个网页交互的评测集。一些组件的Demo示例如下MiniWoB数据集的局限性非实际web页面而而是模拟web页面页面被极大程度简化成了单独的交互组件复杂程度低指令是低级指令直接描述如何和网页交互例如下图的指令选择下拉列表中的United Arab Emirates并点击提交。而高级任务指令应该是选择United Arab EmiratesMIND2WEBMIND2WEB: Towards a Generalist Agent for the Webhttps://osu-nlp-group.github.io/Mind2Web/数据集MIND2WEB数据集在MiniWoB数据集上做了以下几点改良真实网页而非模拟组件如下是美联航的首页高级任务指令而非低级指令例如Search for all alternative concerts taking place in New York网页数据全面包含了HTML代码DOM文件和HAR日志snapshot截图和TRACE多领域任务5大类31个小类总共137个网站,并基于种子人工构造了2350个指令样本5大类分别包括旅游信息娱乐购物通用服务类让我们来具体看一个样本任务指令Check for pickup restaurant available in Boston, NY on March 18, 5pm with just one guestLabel是完成该指令的行为序列每一步行为由(Target Element, Operation)构成这里支持三种最常用的OPCLICK, TYPE,SELECT行为序列如下MIND2WEB采用了4个评估指标Element Accuracy:评估操作元素例如Botton的正确率Operation F1评估对元素的操作准召这里是token-level的F1计算因为有键入数据等操作Step Success Rate: 单步操作正确需要Element和Operation同时正确Task Success Rate任务正确需要每一步都正确Mind2WEB数据集主要局限性是只有数据采集时的网页静态页面HTML没有后续行为的动态交互数据MindActMINDAct框架因为是单一文本模态因此使用HTML代码和DOM文件来作为网页的观测数据框架比较简单由两个部分组成元素排序生成候选基于候选的多项选择生成行为Candidate Ranking候选生成部分是一个二分类的打分模型。输入是任务指令历点史ActionDOM元素输出是每个DOM元素的候选概率。这里DOM元素的文本表征除了元素本身的信息还从DOM文件树里面获取了parent和child节点的信息拼接作为每个节元素的表征。如下这里论文是通过随机负样本采样训练了DeBERTa模型作为排序模型测试集Top50召回在85%。Action Prediction基于上面元素排序返回的Top-K候选Element会先对整个HTML进行裁剪只保留候选元素前后的HTML文档。这样可以有效降低大模型的输入长度和复杂度但对上面排序模型的召回要求较高。之后会基于Top-K 候选裁剪HTML和历史的Action选择下一步的的Action和Value。于是基于复杂HTML直接生成Action和Value的复杂任务被简化成了多项选择的QA任务。这里论文是微调了Flan-T5来完成多项选择任务也同时对比了直接使用GPT3.5和GPT4。WEBARENA数据集WEBARENA: A REALISTIC WEB ENVIRONMENT FOR BUILDING AUTONOMOUS AGENShttps://webarena.dev/针对Mind2WEB只和静态网站状态交互的问题WEBARENA通过构建仿真网站构建了真实动态并且可复现的网络环境来和智能体进行交互。论文选择了电商论坛githubCMS等四类网站类型并使用网站真实数据来构建模拟环境。并且对比Mind2WEB的3种常见交互支持更多的交互操作并且因为是动态页面因此支持多tab切换的操作支持的opeeration类型如下数据集构成High Level 任务指令包含数据查询网站导航内容创建等3个主要任务意图812个测试样本人工chatgpt构建从241个任务模板中创建出来模板例如create a {{site1}} account identical to my {{site2}} one网页数据HTML DOM screenshot Accessibility Tree(DOM的有效子集评估指标上相比Mind2WEBWEBARENA同样使用task success rate作为评估指标把token-level的F1计算进行了优化加入了operation是否正确的检测方案。核心就是部分操作需要键入内容而这部分内容不能直接和标注做精准匹配因此WEBARENA分成了需要精准匹配的答案(exact match),只要包括核心信息即可must include和基于大模型做语义相似判断的(fuzzy match)这三类评估类型对不同的样本进行评估。WebVoyagerWebVoyager: Building an End-to-end Web Agent with Large Multimodal Modelshttps://github.com/MinorJerry/WebVoyager?tabreadme-ov-file数据集同样是动态网页交互WebVoyager没有采用模拟网页数据而是使用Selenium直接操控web浏览器行为和真实网页进行交互。于是同时满足了动态交互和真实网络环境的要求。论文选取了15个有代表性的网站Allrecipes, Amazon, Apple,ArXiv, BBC News, Booking, Cambridge Dictionary,Coursera, ESPN, GitHub, Google Flights,Google Map, Google Search, Huggingface, and Wolfram Alpha。指令样本是基于Mind2Web的数据集作为种子然后基于GPT4使用Self-Instruct来生成新的任务指令最后使用人工校验和筛选。最终得到了每个网站40的指令总共643个评估任务。评估指标和webARENA保持一致都是采用任务成功率作为评估指标。Agent这里简单说下agent实现WebVoyager和前面数据集的主要差异是加入了多模态模型GPT4—V的尝试。不再使用accessibility Tree的文本输入而是直接和网页的snapshot进行交互。这里论文采用了set-of-Mark Prompting的技术来解决GPT4-V模型visual grounding的问题模型对图片中细粒度物体的区分度有限当输出是图片中局部物体例如按钮时准确率不高的问题。SOM是先用SAM等分割模型对图片进行分割这里主要是识别出图片上可交互的按钮和区域使用bounding box进行圈选并使用序号对区域进行标记。通过标记来帮助GPT4-V更精准的识别可交互区域。这里论文使用了GPT-4V-ACTJS DOM auto-labeler来识别网页中的所有可交互元素并进行标记来作为GPT4-V的输入如下然后基于上面的标记图片输入和以下ReACT的prompt指令让GPT4V生成每一步的交互操作。基于模型推理结果会直接操作网页并获取新的网页snapshot作为下一步的输入。WebLINXWebLINX: Real-World Website Navigation with Multi-Turn Dialoguehttps://github.com/McGill-NLP/WebLINX对比前面的MIND2WEB,WebArena和webVoyagerwebLLINX加入了和用户的多轮对话交互也就是从自主智能体向可交互智能体的转变。虽然放弃了自主但有了人类的监督可能可以达到更高的任务完成度。WebLINX的数据集包括8大类50个小类总共155个真实网页总共构建了2337个指令样本。因为是对话式交互所以指令类型会和以上的几个数据集存在明显的差异不再是任务型指令而是步骤操作型的指令如下图agent部分论文更多是对比了文本模态vs多模态微调vsprompt的效果实现细节不太多这里就不细说了AutoWebGLMAutoWebGLM: Bootstrap And Reinforce A Large Language Model-basedWeb Navigating Agenthttps://github.com/THUDM/AutoWebGLMAutoWebGLM是智谱最近才发布的webagent论文包括比较全面的微调数据集构建和微调方案并发布了新的评测集。论文提出AutowebGLM的数据集有三个主要优点更高质量的web交互训练数据人标很难构架大规模训练数据这里使用模型标注并通过技巧提高模型标注准确率统一10类交互行为其实和WEBARENA基本一致HTML简化裁剪方案构建可交互元素树数据集AutoWebGLM的微调数据集包含由易到难的三种任务web recognitionsingle-step taskmulti-step task。这里也是纯HTML文本模态的数据集。除了以下全新的三类样本论文还合并了MiniWoB和Mind2Web的训练集。web Recognition网页识别样本构建是直接从HTML中提取可交互元素然后基于元素构建简化的HTML输入。然后Input是网页元素功能的相关提问输出是GPT的回答例如Search Bar是用来干什么的模型回答“它是用来帮助用户搜索产品的”。这部分样本用来帮助模型理解HTML。Single-step taskSimple简单任务是单步操作的网页交互。这里论文的构建比较巧妙考虑到之前的论文已经论证了即便是GPT4在webagent这个任务上的执行准确率也有限那直接使用GPT4来构建样本肯定是不可行的。因此论文采用了反向标注既基于HTML中抽取出的可交互元素例如“scroll_page(‘down’)”让GPT4来方向生成对应的意图和用户指令例如我需要向下滑网页浏览更多。这样可以得到准确率更高的样本模型生成意图和指令的prompt如下Multi-Step taskComplex复杂任务涉及和网页的多步交互。这里论文使用了Evol-Instruct来构建复杂任务指令(不熟悉的同学看这里解密Prompt系列17.LLM对齐方案再升级),每个网页模型生成50个指令再人工筛选20个。考虑模型生成准确率不高这里得多步交互论文使用人工执行并用浏览器插件捕捉用户交互行为的方案。这里为了在行为链路之外同时获得模型COT思考链路用来提高后面的模型训练效果。论文使用以下prompt让大模型基于人工完整的行为链路生成每一步的执行意图。最终的AutoWebBench评测集只使用了多步任务的子集也就是复杂指令来评测模型效果。微调基于以上的训练数据论文采用了多阶段训练微调ChatGLM3SFT第一步是指令微调使用以上训练集采用Curriculum Leanring的训练策略既模仿人类学习由易到难的训练样本进行逐步训练。先使用网页识别和单步任务训练再使用多步任务数据训练。RL第二步是强化学习用来降低SFT部分模型学习的过度模仿和幻觉。这里论文采用了Self-Sampling来构建DPO需要的正负样本对既使用正确答案作为正样本使用模型预测错误的作为负样本使用DPO和SFT的混合loss进行进一步的训练。RFT: 第三步是基于MiniWoB和WebARENA虚拟环境使用以上训练好的DPO模型构建了额外的训练样本。这里采用拒绝采样既使用模型尝试N次选取成功规则标注或环境自带识别的执行路径作为训练样本进行训练。相当于是把Rejection-Sampling的效果再训练进模型中。效果上在AutoWebBench上微调后的6B模型可以显著超过GPT4和更大的LLAMA2基座模型拥有更高的任务单步执行成功率。同时论文做了消融实验来验证以上多阶段微调和三种训练样本的效果。实验显示由易到难的训练数据对模型有较大提升RFT在进一步训练的miniWob和WebArena上有显著提升但RL-DPO的效果不太明显。最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。四、AI大模型商业化落地方案五、面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】