ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

从单条请求到 5 分钟绕过 Cloudflare 验证:Scrapling 网页抓取教程

2026/9/20 20:01:58 拓冰建站 浏览量
从单条请求到 5 分钟绕过 Cloudflare 验证:Scrapling 网页抓取教程 从单条请求到 5 分钟绕过 Cloudflare 验证Scrapling 网页抓取教程【免费下载链接】Scrapling️ An adaptive Web Scraping framework that handles everything from a single request to a full-scale crawl! Dont be shy, join here: https://discord.gg/EMgGbDceNQ项目地址: https://gitcode.com/GitHub_Trending/sc/Scrapling用 requests 抓列表页很顺手但目标站一开 TLS 指纹检测同样的请求直接返回 403换浏览器库抓 JS 渲染页又得自己写等待逻辑再碰上 Cloudflare 人机验证就彻底卡住。Scrapling 是一个 Python 网页抓取框架把普通 HTTP 请求、浏览器 JS 渲染、Cloudflare 验证绕过收进同一套抓取器和解析接口选元素、跑爬虫不用再换库。⚡ 先定方向四类抓取任务分别归谁管单次发请求并解析Fetcher 系列直接返回解析器不用再接 BeautifulSoup页面靠脚本渲染DynamicFetcher 接管浏览器加载和等待站点挂 Cloudflare 验证StealthyFetcher 自动过人机验证整站批量抓取Spider 框架负责调度、限速、断点不用的代价是请求库、浏览器库、爬虫框架三套要自己维护解析逻辑还得互相转换。三类抓取器怎么对照选见 docs/fetching/choosing.md。 五分钟装好依赖并抓回第一个网页环境要求 Python 3.10 以上。从源码安装并补全抓取器依赖git clone https://gitcode.com/GitHub_Trending/sc/Scrapling cd Scrapling pip install scrapling[fetchers] scrapling installpip install scrapling[fetchers]会带抓取器所需的依赖scrapling install下载两个浏览器抓取器要用的浏览器和系统依赖只打算用纯 HTTP 的 Fetcher 可以跳过这一步。装法细节见 README.md。跑最小示例确认环境from scrapling.fetchers import Fetcher page Fetcher.get(https://example.com) print(page.status)这里会打印 200说明环境跑通了。返回的page本身就是解析器可以直接在上面用 CSS 或 XPath 选元素不用再转给别的库。 三种典型任务从静态页到 Cloudflare 验证你遇到的情况该用的功能页面源码里就能看到内容Fetcher内容由 JavaScript 生成DynamicFetcher站点挂着 Cloudflare 人机验证StealthyFetcher几百页整站抓Spider静态页伪装 TLS 指纹的普通请求判断条件浏览器查看源码里能直接看到内容就用 Fetcher。上面最小示例里Fetcher.get拿到的就是这个层级。它底层用 curl_cffi默认模仿最新版 Chrome 的 TLS 握手传impersonatefirefox就是改用 Firefox 的握手特征去发请求被按 Chrome 特征拦截时可以换一换。请求参数全集在 docs/fetching/static.md。JS 渲染页无头浏览器加载完再返回判断条件Fetcher.get拿到的 HTML 里缺内容说明靠脚本渲染换 DynamicFetcher。from scrapling.fetchers import DynamicFetcher page DynamicFetcher.fetch(https://quotes.toscrape.com/js/, network_idleTrue) print(page.get_all_text())这个语录页的内容全靠 JS 生成用 Fetcher 抓只会拿到空壳这里应完整打印出引文。network_idleTrue表示 500 毫秒内没有网络请求才返回避免抓到加载中的半成品内容异步晚到时可以改用wait_selector.target等具体元素出现。参数说明见 docs/fetching/dynamic.md。Cloudflare 人机验证自动识别并解掉挑战判断条件DynamicFetcher抓回来的是验证页或 403目标站挂了 Cloudflare上 StealthyFetcher。from scrapling.fetchers import StealthyFetcher page StealthyFetcher.fetch(https://nopecha.com/demo/cloudflare, solve_cloudflareTrue) print(page.status)这个演示站默认挂着 Cloudflare 验证开了solve_cloudflareTrue后它会先自动解掉各类 Turnstile 挑战再返回状态码应是目标页的正常码而不是 503。它默认还会隐藏 Playwright 痕迹、给 canvas 加噪、堵 WebRTC 泄漏这些不用你逐个配置。完整反检测选项见 docs/fetching/stealthy.md。站点改版按元素特征重新定位判断条件选择器因为对方改了 class 名而集体失效开自适应模式。from scrapling.fetchers import Fetcher page Fetcher.get(https://example.com) items page.css(.product, auto_saveTrue) # 首次抓取时保存元素特征 items page.css(.product, adaptiveTrue) # 改版后按特征找回同一批元素第一次调用把元素的标签、文本、结构位置存进本地数据库之后选择器落空时adaptiveTrue会按相似度找回同一批元素。原理和存储机制见 docs/parsing/adaptive.md。️ 写爬虫最容易踩的四个坑装了包却import scrapling.fetchers报 ModuleNotFoundError。默认安装只含解析引擎不含抓取器依赖。修复pip install scrapling[fetchers]再用浏览器抓取器时补scrapling install。动态页抓回来的文本是空的。脚本还没执行完就返回了。修复加network_idleTrue或用wait_selector等关键元素出现详见 docs/fetching/dynamic.md。站点一改版CSS 选择器全部失配。修复首次选择加auto_saveTrue存特征之后用adaptiveTrue重新定位用法见 docs/parsing/adaptive.md。Cloudflare 验证页反复出现过不了。手动点验证不可靠也别用裸的 DynamicFetcher 硬碰。修复换StealthyFetcher并开solve_cloudflareTrue让它自动解挑战。 把爬虫推向生产限速、代理与断点续跑批量请求改用 Session 版本如StealthySession浏览器只启动一次后续请求复用速度差一个量级见 docs/fetching/choosing.md限速交给 AutoThrottleSpider 按各域名的响应速度自动调延时被拦截就加倍退避源码在 scrapling/spiders/throttle.py代理轮询用内置 ProxyRotator所有 Session 类型都支持实现在 scrapling/engines/toolbelt/proxy_rotation.py长任务开检查点Spider 用crawldir启动CtrlC 优雅保存进度下次传同目录从断点续抓机制见 docs/spiders/architecture.md抓取前让它自动遵守目标站的 robots.txt用 Spider 的robots_txt_obey开关检查逻辑在 scrapling/spiders/robotstxt.py从你手头最难抓的那个页面开始先用Fetcher.get看内容是否在源码里缺了就升DynamicFetcher撞上 Cloudflare 再升StealthyFetcher。单页跑稳之后把它搬进 Spider加上crawldir检查点和限速再考虑整站铺开。【免费下载链接】Scrapling️ An adaptive Web Scraping framework that handles everything from a single request to a full-scale crawl! Dont be shy, join here: https://discord.gg/EMgGbDceNQ项目地址: https://gitcode.com/GitHub_Trending/sc/Scrapling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考