前言
2026年7月1日Cloudflare官方发布新爬虫管控标准,9月15日全量生效。所有接入Cloudflare的域名,带广告页面默认拦截混合用途AI爬虫;新注册账号、新增域名自动启用AI限制规则,存量历史域名保留旧配置但需手动升级适配新标准。
大量企业站点长期无管控放任GPTBot、CCBot、ClaudeBot抓取原创内容,产生三重损失:广告曝光被分流、付费会员内容无偿用于商用模型训练、原创图文版权维权缺少技术取证依据。国内企业还要同步对齐《著作权法》《个人信息保护法》,海外站点需满足GDPR文本挖掘退出机制、美国CFAA计算机访问合规要求。
本文从政策拆解、法律合规、机器可读授权文件、Cloudflare四层防御架构、分行业落地模板、日志取证体系、伪装爬虫对抗、上线排期、风险排查完整覆盖,全部配置代码可直接复制部署,配套Mermaid流程图、多层防御架构图,全文控制约10000字,落地无信息断层。
一、Cloudflare 9月新规底层逻辑与生效边界
1.1 爬虫三分类判定标准(Cloudflare原生行为标签)
Cloudflare不再仅依靠User-Agent识别爬虫,通过请求行为、抓取频率、数据用途自动打上三类标签,规则优先级高于自定义UA拦截。
Googlebot、Bingbot、BaiduSpider、SogouSpider,仅做页面索引、展示搜索结果外链,不吸收内容进入模型权重,新规全程不拦截,不会影响自然搜索流量。
PerplexityBot、Gemini检索Bot、OAI-SearchBot,基于RAG实时调取页面生成回答,不永久存储内容训练模型,站点可手动选择放行/拦截,默认关闭。
GPTBot、CCBot、Google-Extended、ClaudeBot、AnthropicBot,批量抓取内容永久嵌入大模型权重,无反向流量回馈;混合爬虫(同一UA同时做检索+训练)访问广告页面直接阻断。
1.2 新规生效范围区分
1.3 AI厂商整改硬性要求
Cloudflare给所有AI企业设置9月15日整改期限,必须拆分两套独立爬虫UA:一套仅用于检索问答、一套专用模型训练。未拆分的混合爬虫,全球数百万Cloudflare站点同步拦截,AI厂商无法正常获取网页训练素材。不愿拆分爬虫的企业,只能和站点运营方签署商用抓取授权协议,站点配置定向放行规则。
1.4 企业不做管控的直接后果
二、企业Web内容授权合规完整指南(国内+跨境双法规)
2.1 国内法律合规底线(直接落地判定标准)
2.1.1 《著作权法》内容边界
原创专栏、行业白皮书、案例分析、原创图片、视频脚本,完整抓取用于AI模型训练,不属于合理使用;仅摘要+跳转外链引用可认定合规。
付费专栏、会员专属文档、下载资源,无论是否公开可访问,全部禁止AI爬虫抓取;爬虫绕过登录鉴权抓取付费内容,构成侵犯信息网络传播权。
2.1.2 《个人信息保护法》强制约束
页面存在手机号、客户联系方式、企业联系人、用户留言数据,必须通过技术手段阻断AI爬虫读取;仅靠页面提示不生效,必须叠加robots拦截、接口鉴权、Cloudflare层阻断三重防护。
2.1.3 司法取证有效材料清单(诉讼必备)
法院认可以上材料作为站点明确拒绝AI商用训练的客观证据,AI厂商无视规则抓取,可同时主张版权侵权、不正当竞争双重赔偿。
2.2 海外跨境站点合规(GDPR+CFAA+欧盟TDM条例)
2.2.1 GDPR数据合规
面向欧盟地区访客的站点,爬虫抓取可识别自然人信息,必须具备合法授权基础;站点通过noai、robots声明拒绝抓取,AI厂商仍采集用户数据,违反GDPR,欧盟监管最高处罚全球营收4%。
2.2.2 欧盟TDM文本挖掘退出机制
欧盟数字单一市场法案规定,网站可通过机器可读文件声明禁止商用文本挖掘,AI训练爬虫必须遵守;未遵守的AI企业,欧盟境内禁止提供服务。
2.2.3 美国CFAA计算机访问法规
AI爬虫伪造UA、修改指纹绕过Cloudflare拦截,属于未经许可访问计算机系统,站点可提起民事诉讼,主张损失赔偿,情节严重可触发行政追责。
2.3 三类企业授权模式(按需直接套用)
模式A:全域禁止(媒体、付费知识库、资讯站首选)
所有AI训练、AI智能体爬虫全部拦截,仅放行传统搜索引擎;不开放任何商用抓取,无授权合作需求。
适用场景:付费专栏平台、新闻媒体、付费课程、行业付费数据库。
模式B:分级分区授权(企业官网、营销站、公开文档站)
公开首页、产品介绍页面允许AI检索引用(仅展示摘要+外链),白皮书、深度案例、下载专区、客户案例目录完全阻断所有AI爬虫。
适用场景:ToB企业官网、产品营销站点、开源技术文档站。
模式C:商用授权合作(行业数据平台、内容服务商)
主动开放部分内容给AI厂商训练,签订商用抓取协议,按日抓取量收取版权费用;Cloudflare配置402 Payment Required响应页面,爬虫访问未授权路径跳转商务对接页面。
适用场景:行业数据资讯平台、商用素材库、公开行业报告网站。
2.4 机器可读合规文件完整代码模板(可直接复制部署)
2.4.1 robots.txt 标准化配置(Cloudflare自动识别Content-Signal信号)
文件放置域名根目录,可搭配Cloudflare托管robots.txt同步启用,双重拦截信号。
# Cloudflare标准内容信号声明,CDN自动识别管控规则
# Content-Signal: search=allow, ai-input=deny, ai-train=deny
# 放行全球主流传统搜索引擎,保障SEO收录
User-agent: Googlebot
Allow: /
User-agent: BaiduSpider
Allow: /
User-agent: Bingbot
Allow: /
User-agent: SogouSpider
Allow: /
User-agent: YandexBot
Allow: /
# 全局拦截全部AI模型训练爬虫
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: MetaBot
Disallow: /
User-agent: AppleBot
Disallow: /
# 拦截AI问答智能体爬虫
User-agent: PerplexityBot
Disallow: /
User-agent: GeminiBot
Disallow: /
# 分区强制拦截付费、会员、隐私目录,独立于全局规则生效
Disallow: /member/
Disallow: /pay/
Disallow: /download/
Disallow: /customer-data/
Disallow: /admin/
# 站点地图推送搜索引擎
Sitemap: https://yourdomain.com/sitemap.xml
2.4.2 页面Meta标签(单页面精准管控)
<meta name="robots" content="index, follow, noai, noimageai">
<meta name="robots" content="index, follow, noai">
<meta name="robots" content="noindex, nofollow, noai, noimageai">
2.4.3 HTTP全局响应头配置(Nginx/Apache/Cloudflare统一生效)
Cloudflare路径:规则 → 转换规则 → 修改响应头,新增X-Robots-Tag字段
X-Robots-Tag: noai, noimageai
Nginx服务器原生配置代码块
server {
listen 80;
server_name yourdomain.com;
add_header X-Robots-Tag "noai, noimageai" always;
}
2.4.4 llms.txt 行业标准授权文件(根目录部署,提升法务举证权重)
llms.txt专门面向大模型爬虫,细化目录权限、商用规则、商务对接渠道,AI厂商爬虫优先读取该文件,优先级高于普通robots.txt。
完整可直接使用模板:
# llms.txt 网站AI内容使用授权规范
# 官网域名:https://yourdomain.com
# 版权所有 © 2026 企业名称,保留全部知识产权
## 基础权限总规则
Allow-Index: true
Allow-AI-Train: false
Allow-Commercial-LLM-Use: false
Citation-Required: true
Preferred-Citation: 内容来源:企业名称官网 https://yourdomain.com
## 分区权限配置
# 公开产品页面:仅允许检索引用,禁止模型训练
allow: /products/*
# 博客资讯:仅摘要引用,禁止全文抓取训练
allow-index: /blog/*
disallow-train: /blog/*
# 白皮书、付费案例:完全阻断所有AI爬虫
disallow: /whitepaper/*
disallow: /case-study/*
disallow: /download/*
# 客户隐私、后台目录永久屏蔽
disallow: /customer/*
disallow: /admin/*
## 商用合作对接渠道
商用内容抓取授权咨询邮箱:copyright@yourdomain.com
商务合作对接页面:https://yourdomain.com/license
## 违规抓取声明
任何AI厂商未经书面授权抓取本站内容用于模型训练,本站将留存全部访问日志,依法主张版权赔偿及不正当竞争损失。
Nginx强制llms.txt文本类型配置(避免AI爬虫解析异常)
location = /llms.txt {
default_type text/plain;
charset utf-8;
add_header Content-Type "text/plain; charset=utf-8";
}
location = /llms-full.txt {
default_type text/plain;
charset utf-8;
}
三、Cloudflare四层分层反爬技术架构
3.1 多层防御整体架构图
#mermaid-svg-EEVZtr9vniltj1aC{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-EEVZtr9vniltj1aC .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-EEVZtr9vniltj1aC .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-EEVZtr9vniltj1aC .error-icon{fill:#552222;}#mermaid-svg-EEVZtr9vniltj1aC .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-EEVZtr9vniltj1aC .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-EEVZtr9vniltj1aC .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-EEVZtr9vniltj1aC .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-EEVZtr9vniltj1aC .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-EEVZtr9vniltj1aC .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-EEVZtr9vniltj1aC .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-EEVZtr9vniltj1aC .marker{fill:#333333;stroke:#333333;}#mermaid-svg-EEVZtr9vniltj1aC .marker.cross{stroke:#333333;}#mermaid-svg-EEVZtr9vniltj1aC svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-EEVZtr9vniltj1aC p{margin:0;}#mermaid-svg-EEVZtr9vniltj1aC .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-EEVZtr9vniltj1aC .cluster-label text{fill:#333;}#mermaid-svg-EEVZtr9vniltj1aC .cluster-label span{color:#333;}#mermaid-svg-EEVZtr9vniltj1aC .cluster-label span p{background-color:transparent;}#mermaid-svg-EEVZtr9vniltj1aC .label text,#mermaid-svg-EEVZtr9vniltj1aC span{fill:#333;color:#333;}#mermaid-svg-EEVZtr9vniltj1aC .node rect,#mermaid-svg-EEVZtr9vniltj1aC .node circle,#mermaid-svg-EEVZtr9vniltj1aC .node ellipse,#mermaid-svg-EEVZtr9vniltj1aC .node polygon,#mermaid-svg-EEVZtr9vniltj1aC .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-EEVZtr9vniltj1aC .rough-node .label text,#mermaid-svg-EEVZtr9vniltj1aC .node .label text,#mermaid-svg-EEVZtr9vniltj1aC .image-shape .label,#mermaid-svg-EEVZtr9vniltj1aC .icon-shape .label{text-anchor:middle;}#mermaid-svg-EEVZtr9vniltj1aC .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-EEVZtr9vniltj1aC .rough-node .label,#mermaid-svg-EEVZtr9vniltj1aC .node .label,#mermaid-svg-EEVZtr9vniltj1aC .image-shape .label,#mermaid-svg-EEVZtr9vniltj1aC .icon-shape .label{text-align:center;}#mermaid-svg-EEVZtr9vniltj1aC .node.clickable{cursor:pointer;}#mermaid-svg-EEVZtr9vniltj1aC .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-EEVZtr9vniltj1aC .arrowheadPath{fill:#333333;}#mermaid-svg-EEVZtr9vniltj1aC .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-EEVZtr9vniltj1aC .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-EEVZtr9vniltj1aC .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-EEVZtr9vniltj1aC .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-EEVZtr9vniltj1aC .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-EEVZtr9vniltj1aC .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-EEVZtr9vniltj1aC .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-EEVZtr9vniltj1aC .cluster text{fill:#333;}#mermaid-svg-EEVZtr9vniltj1aC .cluster span{color:#333;}#mermaid-svg-EEVZtr9vniltj1aC div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-EEVZtr9vniltj1aC .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-EEVZtr9vniltj1aC rect.text{fill:none;stroke-width:0;}#mermaid-svg-EEVZtr9vniltj1aC .icon-shape,#mermaid-svg-EEVZtr9vniltj1aC .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-EEVZtr9vniltj1aC .icon-shape p,#mermaid-svg-EEVZtr9vniltj1aC .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-EEVZtr9vniltj1aC .icon-shape .label rect,#mermaid-svg-EEVZtr9vniltj1aC .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-EEVZtr9vniltj1aC .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-EEVZtr9vniltj1aC .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-EEVZtr9vniltj1aC :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}
拦截已知AI爬虫UA、混合爬虫
拦截伪装UA、无头浏览器指纹、高频AI特征
低分数自动化流量拦截、单IP限流
外网访问流量
第一层:AI Crawl Control 一键管控层
第二层:WAF自定义规则层
第三层:Bot Score智能评分+速率限制层
第四层:站点原生辅助防护层
服务器鉴权、noai标签、llms.txt、图片水印
托管robots.txt自动写入AI禁止指令
广告页面自动检测拦截开关
AI爬虫UA匹配阻断规则
JA3/TLS指纹无头爬虫拦截
402商用授权响应自定义规则
Bot Score阈值拦截<30分自动化流量
单IP分钟请求速率限制
高频违规IP自动黑名单
付费接口登录校验
动态接口Token校验
全站noai响应头
3.2 第一层:AI Crawl Control基础一键拦截(免费版全可用)
操作路径:Cloudflare控制台 → 安全 → Bots → AI Crawl Control
3.2.1 核心开关配置项
- Block only pages with ads(推荐默认):仅带广告页面拦截AI混合爬虫,纯静态官网正常放行检索类Bot;
- Block all pages:全站全部页面拦截所有AI训练爬虫;
- Do not block AI bots:关闭自动拦截,完全依靠自定义WAF规则管控。
3.2.2 基础配置落地步骤
3.3 第二层:WAF自定义精细化规则(Pro/企业版,拦截伪装爬虫)
3.3.1 规则1:显性AI爬虫UA直接阻断(复制表达式部署)
规则匹配表达式:
(http.user_agent contains "GPTBot") or
(http.user_agent contains "CCBot") or
(http.user_agent contains "Google-Extended") or
(http.user_agent contains "ClaudeBot") or
(http.user_agent contains "PerplexityBot") or
(http.user_agent contains "GeminiBot")
执行动作:阻止(Block),返回403状态码;规则优先级调至WAF列表首位,优先执行AI爬虫拦截。
3.3.2 规则2:Bot Score低分值自动化流量拦截(识别伪装无头爬虫)
爬虫评分逻辑:Cloudflare全球流量模型打分1-99分,分数越低自动化爬虫概率越高,30分以下判定为恶意机器人。
匹配表达式:
cf.bot_management.score lt 30 and not cf.bot_management.verified_bot
执行动作:托管质询(Managed Challenge),真人自动放行,无头AI爬虫无法通过JS验证。
3.3.3 规则3:企业商用授权402响应页面(Enterprise套餐专属)
针对需要开放商用合作的站点,未授权AI爬虫访问返回402 Payment Required,页面展示商务对接邮箱、授权申请通道。
匹配表达式:
cf.bot_management.category eq "training"
执行动作:自定义响应,状态码402,自定义HTML页面写入商用授权联系信息。
3.3.4 规则4:付费目录独立强化拦截
匹配表达式:
(http.uri contains "/pay/") or (http.uri contains "/member/") or (http.uri contains "/download/") and cf.bot_management.category ne "search"
执行动作:直接阻止,无质询,全部非搜索引擎爬虫直接拦截付费路径。
3.4 第三层:速率限制+IP黑名单防御(防批量暴力抓取)
路径:安全 → 速率限制(Rate Limiting)
3.4.1 通用爬虫限流模板
3.4.2 高频抓取AI机房IP自动拉黑
开启Cloudflare威胁情报自动黑名单,系统聚合全球违规AI爬虫机房IP段,自动加入站点黑名单,无需手动维护IP列表。
3.5 第四层:网站原生辅助防护(叠加CDN,双重保障,无套餐限制)
四、分行业落地完整配置方案(直接复制整套规则)
4.1 媒体/付费资讯平台(全域全拦截方案)
业务特征:依靠广告、付费阅读盈利,原创内容为核心资产,完全不开放AI训练抓取。
4.2 ToB企业营销官网(分级分区管控,保留AEO流量)
业务特征:需要AI检索引擎引用产品信息获取曝光,深度案例、白皮书禁止训练抓取。
4.3 开源技术文档社区(适度开放非商用引用)
业务特征:希望AI引用技术文档提升品牌曝光,禁止商用大模型训练。
五、伪装AI爬虫识别与对抗实战(无头浏览器绕过拦截解决方案)
5.1 主流伪装爬虫识别指纹清单
恶意爬虫使用Playwright、Puppeteer、CloakBrowser篡改UA、浏览器指纹绕过基础拦截,识别特征分为四类:
5.2 Cloudflare对抗伪装爬虫完整规则
5.3 服务端辅助识别脚本(Nginx日志爬虫检测脚本,可定时执行)
#!/bin/bash
# Nginx日志AI爬虫IP统计脚本,输出高频抓取IP
LOG_PATH="/www/wwwlogs/yourdomain.log"
# 匹配主流AI爬虫UA标识
grep -E "GPTBot|CCBot|ClaudeBot|PerplexityBot" $LOG_PATH | awk '{print $1}' | sort | uniq -c | sort -nr | head -30
# 输出访问量前30的爬虫IP,可直接复制至Cloudflare黑名单
使用方式:保存为ai_bot_scan.sh,定时每日凌晨执行,导出当日爬虫IP报表。
六、落地执行时间线(2026企业落地排期)
6.1 前置筹备阶段(即日起-8月31日)
6.2 灰度测试阶段(9月1日-9月14日)
6.3 全量上线阶段(9月15日新规生效当日)
6.4 长期运维机制(9月16日后常态化操作)
七、上线风险排查清单(规避误拦截、流量损失、合规漏洞)
八、行业前瞻性预判(2026-2027AI内容授权趋势)
Cloudflare本次新规会推动全网形成授权抓取行业标准,未来三个变化会快速落地:



