很多企业主把 robots.txt 当作"铁律":写了"允许 GPTBot",就以为自己在 ChatGPT 里能被看到;写了"禁止",就以为万事大吉。但2026年7月的一项大规模实测数据显示,这个假设在相当一部分网站上根本不成立——你的 robots.txt 写的是一回事,你的 CDN 或防火墙实际做的是另一回事,而这个"说一套、做一套"的缺口,不管方向如何都可能悄悄让你在 AI 搜索里"消失"。
HasData 的"AI 爬虫拦截指数"(2026年7月发布)没有只看网站声明的政策,而是实测了 10,894 个网站(Tranco 榜单前9,746个网站 + 1,148家新闻媒体)的真实爬虫响应情况。核心发现是:39.5% 的网站在 robots.txt 里写了"禁止 GPTBot",但实际上这条规则从未被真正执行——网站声明了要挡,GPTBot 却照样爬了进去,原因通常是网站前端的 CDN 或 Web 应用防火墙(WAF)根本没有按 robots.txt 的政策去配置。
反过来的情况同样常见
这个缺口是双向的。有些网站主特意在 robots.txt 里"允许"AI 爬虫——希望能被 ChatGPT、Perplexity 或谷歌的 AI 功能引用——结果却在网络边缘被悄悄拒之门外。CDN 的机器人管理规则、WAF 的验证页面,或托管后台里一个笼统的"屏蔽 AI 机器人"开关,都是在 robots.txt 被读取之前就先生效的。只要其中任何一层把某个 AI 爬虫判定为可疑流量,爬虫拿到的就是403错误或验证码页面——你在 robots.txt 里给的"许可"根本没被看到。HasData 的数据显示,不同 CDN 服务商的实际执行方式并不一致:Fastly 倾向于直接硬性拦截被标记的机器人,Cloudflare 会弹出验证挑战页面,而 CloudFront 大多直接放行——同样一条声明的政策,落到三家不同的基础设施上,会得到三种完全不同的真实结果。
"屏蔽"也未必能达到你想要的效果
这份报告还测试了另一个常见假设——"屏蔽 AI 爬虫就能避免被引用"。研究团队在谷歌 AI 模式(AI Mode)里跑了10个测试查询,得到52个被引用的域名,其中恰好也在10,894个样本站点内;结果这52个里有27个(51.9%)在 robots.txt 里至少屏蔽了一种 AI 爬虫——引用比例大约是样本整体屏蔽率的三倍。换句话说,在 robots.txt 里写"禁止",并不能可靠地把你挡在谷歌 AI 模式的引用名单之外,因为 AI 模式依赖的是谷歌自家的索引和抓取系统,这套系统怎么处理你的网站,和你对 OpenAI、Anthropic 或 Perplexity 爬虫的态度,其实是两回事。
这一点也呼应了我们上个月在Cloudflare 9月15日爬虫新政那篇文章里提到的问题:按 HasData 的估算,那一项政策改动本身就会影响约8.5%的全网站点,而当时的风险点正是 Googlebot 这类"综合型"爬虫,也可能被笼统的"屏蔽训练类爬虫"规则一并误伤。这次的新数据说明,这不只是 Cloudflare 一家的问题,而是 CDN/WAF 这一层在各家服务商身上都普遍存在的结构性盲区。
怎么真正查清楚,而不是靠猜
- 去看访问日志,而不只是 robots.txt 文件本身。在服务器或 CDN 日志里搜索真实的爬虫 User-Agent 字符串——GPTBot、ClaudeBot、PerplexityBot、Google-Extended、OAI-SearchBot——并核对每一条请求实际拿到的 HTTP 状态码。一串403或跳转验证码的记录,比 robots.txt 文件更能说明真相。
- 用爬虫的身份主动发一次真实请求。从外部服务器(不是自己公司内网)发一个带 AI 爬虫 User-Agent 的请求,看实际返回的状态码和内容。如果收到的是验证页面或直接被拦截,答案就已经很清楚了,不用管 robots.txt 里写了什么。
- 直接查看 CDN 的机器人管理后台——比如 Cloudflare 的 AI Crawl Control、Fastly 的机器人规则,或 WAF 的托管规则集——而不要以为 robots.txt 是唯一起作用的开关。真正的决策往往就是在这些后台里做出的。
- 如果用的是 Cloudflare,趁政策默认值改变之前重新核对一遍设置——新注册和免费版账户的默认值正在越来越多地转向"默认屏蔽"而非"默认允许",一个你从没动过的设置也可能在不知不觉中变了。
- 每次更换 CDN、主机商或安全插件之后都重新测一遍。一条新的 WAF 规则或"机器人防护"开关,足以在完全不碰 robots.txt 文件的情况下,悄悄抹掉你几个月的 GEO 投入。
对双语网站来说,这个问题的杀伤力是双倍的:同一套 WAF 规则或 CDN 配置,英文页面和中文页面用的是同一层基础设施——一条配置错误的规则,就可能让你花心思建设的中英双语 GEO 内容,在两种语言上同时对 AI 爬虫"隐形"。
