ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

MaxKB 网页抓取实操:3 个配置把帮助中心变成能问的知识库

2026/9/12 15:52:46 拓冰建站 浏览量
MaxKB 网页抓取实操:3 个配置把帮助中心变成能问的知识库 MaxKB 网页抓取实操3 个配置把帮助中心变成能问的知识库【免费下载链接】MaxKB MaxKB is an open-source platform for building enterprise-grade agents. 强大易用的开源企业级智能体平台。项目地址: https://gitcode.com/GitHub_Trending/ma/MaxKB场景客服还在用三周前的旧答案回答问题周四下午客服主管把一条投诉拍在你桌上官网帮助中心早改成了7 天无理由退货知识库里还是三周前的旧版本。用 MaxKB 网页抓取把帮助中心抓成知识库并自动同步这类事就不用你管了。问题不在客服在链路总得有人把页面一条条搬进知识库总搬不动。下面讲怎么把这件事自动化。一条链路MaxKB 网页抓取怎么把 URL 变成答案界面上看是贴链接、等待、完事里面数据其实过了六道关一步步流动抓取按你贴的根链接请求页面解析 HTML收集页内链接逐层跟进首次完整抓取追到 3 层深度。正文提取按选择器保留每个页面上你要的节点默认取 body导航、广告位就留在外面。智能分段页面按 HTML 结构切成一条条可检索的段落而不是按字数硬切。向量化每段文本过一遍知识库配的嵌入模型变成向量。建索引向量写入索引此时语义检索已经可用。可问答应用关联这个知识库大模型回答问题前先来这里查。链路末端还挂着一个可选回路开启定时同步后系统按周期重抓同一批链接覆盖旧段落。同步任务按知识库串行排队不用担心同一站点被并发猛抓实现在 apps/knowledge/task/sync.py。 动手把一条链接变成可问答的知识配置一建库与批量粘贴 URL新建知识库时类型选网页添加文档就是贴 URL——这个字段是一个列表一次粘十几条链接、一行一条就行不用逐条点添加。URL 列表决定抓取范围每条链接对应一个文档文档名默认取该页链接的文字取不到就用 URL 本身。一个容易翻车的细节带 UTM 跟踪参数的链接和不带的链接会被当成两个文档同一页内容在库里存两遍粘贴前先清掉查询参数和 # 锚点。配置二抓取深度与选择器怎么设选择器是决定每个页面留什么的唯一过滤器。留空默认 body整页正文都进分段和向量化想更干净就写.markdown-body、#content这类多个选择器用空格分隔。深度由系统定首次完整抓取跟 3 层链接定时同步固定 2 层界面不开放调。这里有个容易翻车的细节深度 3 意味着弹窗、相关推荐里的链接入口也会被跟进去官网如果同域挂着博客整块博客会被顺带拖进知识库。不想范围失控就只贴具体栏目如/docs/的根链接别贴首页。同样的参数在知识库工作流的数据源节点里也能配配置三分段策略与首次验证网页默认走 HTML 分段先按标题、段落这类结构单元切超长段落再回退到定长切分这一步基本不用你选看效果就行。切完打开文档抽查几个段落边界是否干净、正文是否完整再到问答界面用两三个真实问题试一下命中不对就说明选择器没设对。一个容易翻车的细节界面提示同步任务发送成功只代表任务进了队列不等于抓完文档列表里每条 URL 的状态变成成功才算数失败的会单独标出别漏看。⚠️ 踩坑备忘四个最容易翻车的点❌ 上来就抓没看 robots.txt 的站点→ 对方服务器直接封你 IP合规风险全在你这边。✅ 先查目标站的 robots.txt 和服务条款只抓明确允许爬取的公开页面。❌ 为了实时把定时同步设成每 5 分钟一轮→ 对目标站是持续压力本端同步任务还按知识库排队串行上轮没跑完下轮接着堆。✅ 静态文档站每周同步一次足够更新快的站点每天一次频率跟着页面更新频率走不跟着焦虑走。❌ 指望 JS 动态渲染的页面能抓到正文→ 抓取拿到的是服务端直接返回的 HTML正文靠前端 JS 注入的页面到这里拿到的就是个空 div分段只剩导航链接。✅ 先请求一次那个 URL 看 HTML 里有没有正文没有就换静态版本、站点 API 或 RSS。❌ 改完选择器后干等下一次定时同步→ 旧段落不会自己消失新旧混在一起命中结果飘忽。✅ 参数一改手动触发一次替换同步全量刷新再交回定时同步跑。 把它接进更大的工作流网页抓取只是 MaxKB 的数据入口之一和别的入库方式、工具可以拼在同一个应用里。场景一一个客服问答入口。官网帮助中心走网页抓取内部 FAQ 的 Excel 走本地文档入库工单系统配一个 MySQL 查询工具三者挂同一个应用大模型先检索两个知识库碰到这张工单现在什么状态这类要实时数据的问题再调数据库工具现查。场景二技术问答加外部信息兜底。官方技术文档站抓取建底库知识库旁边配一个搜索工具预置的 Google Search、博查等问题超出文档范围时由大模型走搜索工具取外部信息。知识库管稳定搜索管时效。部署入口把那条帮助中心链接贴进去分段、向量化、定时同步都交给它跑。部署脚本见 installer/start-maxkb.sh项目地址以仓库 README 为准。【免费下载链接】MaxKB MaxKB is an open-source platform for building enterprise-grade agents. 强大易用的开源企业级智能体平台。项目地址: https://gitcode.com/GitHub_Trending/ma/MaxKB创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考