ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Cloudflare 9·15新政倒计时:用IP风险画像识别AI爬虫,防止误伤Googlebot

2026/9/5 8:40:53 拓冰建站 浏览量
Cloudflare 9·15新政倒计时:用IP风险画像识别AI爬虫,防止误伤Googlebot 9月15日Cloudflare会对一批站点默认启用新的AI爬虫拦截策略范围是新增域名、新开的站点、从没动过爬虫设置的免费账号。默认动作带广告的页面屏蔽 Training训练和Agent代理两类爬虫Search搜索类放行。听着是好事但有个坑。Googlebot、Bingbot这类爬虫是混合用途既做搜索索引又给AI喂数据。按Cloudflare的规则只要你选了屏蔽Training这些混合爬虫会一起被挡你的站就从Google搜索结果里消失了。别一刀切先用风险画像区分你怎么知道请求你网站的是真Googlebot还是顶着Googlebot名义的采集机器人看IP风险画像。真Googlebot的出口IP集中在谷歌的ASN段AS15169真人概率高、代理状态干净。冒充的采集机器人IP大多来自IDC机房、代理节点或秒拨池风险画像一查就能现形。IP风险画像区分真Googlebot与伪装采集器对比图代码落地与其手动猜不如在网关层做一层校验。以IP数据云的风险画像接口为例对访问来源IP做识别import requests def _to_int(v, default0): try: return int(v) except (TypeError, ValueError): return default def check_bot(ip, api_key): url https://api.ipdatacloud.com/v2/risk params {ip: ip, key: api_key} try: resp requests.get(url, paramsparams, timeout3) resp.raise_for_status() data resp.json() except (requests.exceptions.RequestException, ValueError): return None if data.get(code) ! 200: return None info data.get(data, {}) return { ip: ip, asn: info.get(asn), # 兼容驼峰/下划线两种字段命名 is_proxy: info.get(isProxy, info.get(is_proxy)), real: _to_int(info.get(real)), risk_score: info.get(riskScore, info.get(risk_score)), } def is_googlebot(r): # 兼容 AS15169 / 15169 / 15169 三种写法 asn str(r.get(asn, )).upper().replace(AS, , 1) return asn 15169 and r.get(real, 0) 90 for ip in [66.249.64.1, 203.0.113.10]: r check_bot(ip, 你的key) if r is None: print(f{ip} - 查询失败跳过) elif is_googlebot(r): print(f{ip} - 放行真Googlebot: {r}) else: print(f{ip} - 需二次验证: {r})IP风险画像三信号识别AI爬虫决策链路示意图把ASN归属、真人概率、代理状态三个信号拼起来真爬虫和伪装的采集器就分开了。Search类爬虫放心放行Training和Agent按你9月15日之后的策略处理两不耽误。最后Cloudflare这轮默认策略是把拦不拦AI爬虫的选择权交回给站长。可要选得先认得清对方是谁。9月15日之前把风险画像的校验接到网关里你的站不会被误伤出 Google也不至于被AI爬虫白嫖。数据来源Cloudflare官方博客《AI Crawl Control》与9月15日默认策略说明Cloudflare Radar 2026年6月互联网流量报告非人类流量57.4%Search Engine Roundtable关于Googlebot/Applebot爬虫IP识别报道