如果你的网站在Cloudflare背后运行——全球大约20%的网站都是如此——那么有件重要的事在2026年9月15日生效,但绝大多数小企业主至今还没听说过。
2026年7月1日,Cloudflare宣布淘汰沿用多年的单一"屏蔽AI机器人"总开关,改为三类独立控制:搜索型爬虫(Search)、代理型爬虫(Agent)和训练型爬虫(Training)。新默认规则于9月15日正式执行。对大多数站点而言,这是一次平滑过渡。但对于一类特定站点——部署在Cloudflare上、带有广告变现、且曾启用旧版"屏蔽AI机器人"开关的网站——这次更新暗藏严重风险:在新规则下屏蔽训练类爬虫,可能同时屏蔽Googlebot、Applebot和Bingbot。(Cloudflare官方博客,2026年7月1日)
三类爬虫各是什么
Cloudflare的新分类体系将机器人流量分成三类:
- 搜索爬虫(Search):抓取你的网站以便它出现在搜索结果中。Googlebot、Bingbot、Applebot历来属于这一类——但后文会说明一个重要例外。
- 训练爬虫(Training):批量抓取内容用于训练AI大语言模型,如CCBot等。内容被用于数据集建设,不会实时回馈给用户。
- 代理爬虫(Agent):在用户实际提问时实时抓取内容,驱动ChatGPT、Perplexity等AI助手的即时回答。这类爬虫是你被AI引用的直接通道。
三类开关可以独立设置。理论上,你可以允许搜索和代理,同时屏蔽训练——只让谷歌收录你、只让AI助手引用你,但不让训练数据爬虫批量抓你的内容。听起来很合理,但问题就卡在这里。
多用途爬虫的致命陷阱
Googlebot、Applebot和Bingbot并不是单一用途的爬虫。它们既为搜索索引抓取内容,也为各自的AI相关业务获取数据——这让它们在Cloudflare的新分类中落入"混合用途(multi-purpose)"区间。
根据9月15日起生效的规则,任何具有多重用途的爬虫,将按最严格的适用规则执行。具体后果是:在启用了广告变现的页面上,如果你屏蔽了Training类爬虫,谷歌和必应的混合爬虫也可能被连带屏蔽——即便你明确允许了Search类爬虫。(Search Engine Journal,2026年7月)
直接后果:原本想保留谷歌收录、只屏蔽AI训练爬虫的站长,可能在不知情的情况下让Googlebot完全无法抓取自己的网页。这不是理论推演,而是Cloudflare新政策在广告变现页面上的明确记录行为。
谁最容易中招
如果以下任何一条符合你的情况,你就处于风险区:
- 网站部署在Cloudflare(无论是免费还是付费套餐)
- 网站上有广告变现(展示广告、联盟营销链接或赞助内容)
- 2025年曾启用过旧版"屏蔽AI机器人"一键开关
- 9月15日之后在Cloudflare上注册的新域名
最危险的群体,是当年配置好Cloudflare之后从未再回头检查安全设置的小企业主。新默认规则是自动应用的,不需要你主动选择。
GEO维度:代理爬虫是你被AI引用的管道
除了搜索收录,还有另一个对专注AI可见度的企业至关重要的影响。代理爬虫——驱动ChatGPT实时搜索、Perplexity回答、谷歌AI Mode的爬虫——在新体系中自成一类。如果你屏蔽了代理爬虫,相当于切断了AI工具在用户提问时发现和引用你企业的通道。
考虑到AI引荐流量的转化质量——Previsible 2026年研究显示ChatGPT访客转化率约15.9%,而谷歌自然搜索仅约1.76%——无意中屏蔽代理爬虫并不是中性选择,而是在主动关闭当前转化价值最高的流量入口。
9月15日前必须完成的三件事
- 检查Cloudflare设置。登录Cloudflare控制台,进入Security → Bots,找到AI爬虫控制区域,查看当前各类开关状态,对照新的三类体系逐一核实。如果你2025年曾启用旧版"屏蔽AI机器人"开关,这是9月15日变更后风险最高的配置,必须优先检查。
- 为每类爬虫做出明确选择。对大多数专注搜索排名和AI引用的小企业,推荐配置是:允许Search、允许Agent、屏蔽Training。这样Googlebot可以正常抓取,AI助手的引用通道保持畅通,同时可以阻止批量训练爬虫。确保9月15日后你的Cloudflare设置与这一意图一致。
- 检查robots.txt中的AI爬虫权限。Cloudflare并不是爬虫访问的唯一控制点。如果你的robots.txt屏蔽了GPTBot、PerplexityBot、ClaudeBot或Google-Extended,无论Cloudflare怎么配置,这些爬虫都进不来。核实你的robots.txt对主要AI爬虫是明确允许的——或者至少没有屏蔽。
更大的背景
Cloudflare的这次调整,折射出互联网正在发生的一场更大转变:把所有机器人当成一回事的时代正在结束。搜索爬虫、训练爬虫和代理爬虫,在使用你内容的方式、以及回馈给你的价值上,存在本质差异。为每类爬虫设定清晰、主动的策略——而不是依赖一刀切的总开关——正在成为真实的运营要求,而不只是大型出版商才需要关心的技术细节。
对于在纽约竞争激烈的本地市场里经营的小企业,操作清单并不复杂:确保谷歌能找到你,确保AI助手能引用你,同时确保你的设置没有在无意中把两者一起挡在门外。
