ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

wigolo 10大工具速览:search、fetch、crawl、extract一站式网络工具集清单

2026/8/29 11:59:25 拓冰建站 浏览量
wigolo 10大工具速览:search、fetch、crawl、extract一站式网络工具集清单 wigolo 10大工具速览search、fetch、crawl、extract一站式网络工具集清单【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolowigolo 是一个本地优先的 AI Agent 网络工具集无需 API 密钥、不经过云端、每次查询成本为 $0。它把 search多引擎搜索、fetch网页抓取、crawl站点爬虫、extract结构化数据提取等 10 大工具打包成一套 MCP 服务器直接接入 Claude Code、Cursor、Codex、Gemini CLI 等编码代理让你的 AI 助手拥有看遍全网的能力。为什么 AI Agent 需要这样一套网络工具写代码时AI 代理经常需要上网办事查官方文档、读 API 参考、跟踪版本变更。传统做法是给代理接一个按量计费的云搜索 API——要注册账号、要 API key、查询越多账单越高数据还会经过第三方。wigolo 的思路是把昂贵部分搬到你自己的硬件上重排模型和向量嵌入全部在本地运行搜索走公共引擎直连适配器所有缓存都存在~/.wigolo/目录里。结果就是查询无限量数据不出本机。10大工具一览一张清单看懂 wigolo工具一句话说明search多引擎网页搜索18 个直连引擎适配器 排序融合 本地 ML 重排返回带评分的证据和引用fetch抓取单个 URL先走普通 HTTP遇到反爬验证或 SPA 空壳自动升级到无头浏览器支持 PDF、截图、点击/输入等页面操作️crawl多页爬虫BFS/DFS/sitemap/map 四种策略遵守 robots.txt按域名限速自动去重extract从页面提取结构化数据表格、元数据、JSON-LD、品牌信息、自定义 JSON Schemacache查询本地已见内容的持久缓存支持关键词 语义混合检索、统计、变更检测find_similar找相似页面本地向量索引 关键词 实时网络三路融合排序research深度研究拆解问题 → 并行子查询 → 交叉验证来源 → 生成带引用的报告agent自主采集循环规划 → 搜索 → 抓取 → 提取 → 综合全程步骤留痕diff对比页面新旧版本输出 git 风格补丁或结构化差异⏱️watch注册页面变更监控任务定期复查并可推送到 webhook所有工具在任何接入方式MCP、REST、SDK、命令行下参数名完全一致完整参数表见 docs/tools.md。核心四件套详解search多引擎搜索 可解释评分search是 wigolo 的主力工具。它把查询并行分发给多个搜索引擎用倒数排名融合RRF合并结果再由本地运行的 ML 重排模型精排。对新手最友好的两点返回证据而非裸链接每条结果附带逐字摘录、精确到字节偏移的来源位置、引用 ID代理可以直接引用而不会张冠李戴评分可解释每个结果都有evidence_score拆解词法、语义、时效、引擎共识等分量弱结果还会被打分器主动标记为垃圾。传一个查询数组还能并行搜多个变体一次调用获得更宽的覆盖面。fetch会自动升级的网页抓取器抓取网页最大的坑是 JS 渲染和反爬验证。fetch采用分级路由先用最便宜的普通 HTTP观测到挑战页或 SPA 空壳等真实信号后才升级到无头浏览器并按域名记住学习结果哪个站点需要什么级别而不是靠域名猜。它还支持只取某个标题下的章节、PDF 解析、复用已登录会话以及actions参数执行点击、输入、滚动、截图等浏览器操作。遇到挡不过去的墙它会返回明确标注的blocked_by_challenge失败而不是把验证壳当内容骗你。crawl礼貌而克制的站点爬虫crawl把整个文档站点灌进本地缓存供后续cache和find_similar反复查询。四种策略按需选择bfs广度优先默认、dfs深度优先、sitemapsitemap 驱动最适合文档站、map只发现 URL 不抓内容最快。默认遵守 robots.txt、按域名限速、用 ETag 增量复核——定位是文档索引器而非批量采集器。extract不用 LLM 的结构化数据提取extract提供六种模式structured表格、键值对、JSON-LD 全都要、tables只取表格、metadata标题/描述/OG 标签、schema按你给的 JSON Schema 匹配页面字段、selectorCSS 选择器、brandlogo、配色、字体。全部纯确定性代码不需要 LLM即使配置了 LLM其补全的字段也会与原文核对幻觉值一律返回null。其余六大工具缓存、相似、研究、自主与监控cache所有被 search/fetch/crawl 触达的页面都会落盘。cache工具让你对本地已见内容做秒级关键词/语义检索——重复提问零成本这是 wigolo 本地记忆的核心。find_similar给一个 URL 或概念融合本地嵌入索引、关键词和实时网络三路信号找相似页面先crawl预热缓存后效果最好。research把一个研究问题拆成子查询并行搜索交叉验证来源后输出结构化简报含逐条论断的来源、跨源印证、信息缺口。agent给它一句自然语言目标它自主规划查询、并行抓取、按时间预算执行并综合成结果每一步都有日志。diff对比缓存版本与实时页面的变化支持行/词/章节三种粒度。watch注册定时复查任务页面变了就产出 diff 并可推送 webhookwebhook 目标有 SSRF 防护。最快上手一条命令接入你的 AI 编码代理npx wigolo init --agentsclaude-code,cursor要求 Node ≥ 20 和约 1.5 GB 磁盘空间。init会下载浏览器引擎和本地模型、跑健康检查并一步把指定代理的 MCP 配置写好。其他接入方式任何 MCP 客户端在配置里注册npx -y wigolo即可REST APIwigolo serve启动后POST /v1/{tool}覆盖全部 10 个工具详见 docs/rest-api.mdSDKTypeScriptwigolo-sdk和 Pythonpip install wigolo都有嵌入式本地模式自动发现或拉起守护进程LangChain / CrewAI / LlamaIndex / Vercel AI SDK官方集成包 packages/ 开箱即用。命令行党也可以直接wigolo search … --json单发查询或用wigolo shell进入交互式管道。成本对比为什么是 $0/查询按量计费的云 API 成本随查询次数线性上涨而 AI 代理恰恰是爆发式提问的——一个任务里连续发几十次查询很常见。wigolo 的重排和嵌入跑在你的硬件上没有单次查询成本要回收因此没有计费器隐私同样默认拉满缓存、向量、模型、配置全部在~/.wigolo/除非你主动为research/agent配置 LLM 做综合写作否则没有任何数据离开本机。相关资料速查工具完整参数参考docs/tools.md安装与全渠道指南npm / Docker / Homebrew / 二进制docs/installation.md环境变量与配置详解docs/configuration.md工具源码入口src/tools/search.ts、fetch.ts、crawl.ts、extract.ts等 10 个文件可运行示例含 REST curl、SDK、n8n、webhookexamples/10 个工具覆盖搜索 → 抓取 → 爬取 → 提取 → 缓存 → 研究 → 监控的完整链路全部 $0/查询。跑一条npx wigolo init你的 AI 代理今天就拥有免费的本地网络层。【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考