SEO指南

你的 robots.txt 說「可以」,你的 CDN 可能說「不行」

2026年7月一項針對10,894個網站的實測研究發現,39.5%的robots.txt「禁止AI爬蟲」規則從未被真正執行,而宣告「允許」的網站也可能被CDN或防火牆悄悄以403攔截——你的robots.txt和你的基礎設施實際的做法,很可能是兩回事。

很多企業主把 robots.txt 當作「鐵律」:寫了「允許 GPTBot」,就以為自己在 ChatGPT 裡能被看到;寫了「禁止」,就以為萬事大吉。但2026年7月的一項大規模實測資料顯示,這個假設在不少網站上根本不成立——你的 robots.txt 寫的是一回事,你的 CDN 或防火牆實際做的是另一回事,而這個「說一套、做一套」的落差,不管方向如何都可能悄悄讓你在 AI 搜尋裡「消失」。

HasData 的「AI 爬蟲攔截指數」(2026年7月發布)不只看網站聲明的政策,而是實測了 10,894 個網站(Tranco 排行榜前9,746個網站 + 1,148家新聞媒體)的真實爬蟲回應情況。核心發現是:39.5% 的網站在 robots.txt 裡寫了「禁止 GPTBot」,但實際上這條規則從未被真正執行——網站聲明要擋,GPTBot 卻照樣爬了進去,原因通常是網站前端的 CDN 或 Web 應用防火牆(WAF)根本沒有依 robots.txt 的政策去設定。

反過來的情況同樣常見

這個落差是雙向的。有些網站經營者特意在 robots.txt 裡「允許」AI 爬蟲——希望能被 ChatGPT、Perplexity 或 Google 的 AI 功能引用——結果卻在網路邊界被悄悄拒之門外。CDN 的機器人管理規則、WAF 的驗證頁面,或代管後台裡一個籠統的「封鎖 AI 機器人」開關,都是在 robots.txt 被讀取之前就先生效的。只要其中任何一層把某個 AI 爬蟲判定為可疑流量,爬蟲拿到的就是403錯誤或驗證碼頁面——你在 robots.txt 裡給的「許可」根本沒被看到。HasData 的資料顯示,不同 CDN 服務商的實際執行方式並不一致:Fastly 傾向直接硬性攔截被標記的機器人,Cloudflare 會跳出驗證挑戰頁面,而 CloudFront 大多直接放行——同樣一條聲明的政策,落到三家不同的基礎設施上,會得到三種完全不同的真實結果。

「封鎖」也未必能達到你想要的效果

這份報告還測試了另一個常見假設——「封鎖 AI 爬蟲就能避免被引用」。研究團隊在 Google AI Mode 裡跑了10個測試查詢,得到52個被引用的網域,其中恰好也在10,894個樣本網站內;結果這52個裡有27個(51.9%)在 robots.txt 裡至少封鎖了一種 AI 爬蟲——引用比例大約是樣本整體封鎖率的三倍。換句話說,在 robots.txt 裡寫「禁止」,並不能可靠地把你擋在 Google AI Mode 的引用名單之外,因為 AI Mode 依賴的是 Google 自家的索引和爬取系統,這套系統怎麼處理你的網站,跟你對 OpenAI、Anthropic 或 Perplexity 爬蟲的態度,其實是兩回事。

這一點也呼應了我們上個月在Cloudflare 9月15日爬蟲新政那篇文章裡提到的問題:按 HasData 的估算,那項政策改動本身就會影響全網約8.5%的網站,當時的風險點正是 Googlebot 這類「綜合型」爬蟲,也可能被籠統的「封鎖訓練類爬蟲」規則一併誤傷。這次的新資料說明,這不只是 Cloudflare 一家的問題,而是 CDN/WAF 這一層在各家服務商身上都普遍存在的結構性盲點。

怎麼真正查清楚,而不是靠猜

  • 去看存取紀錄,而不只是 robots.txt 檔案本身。在伺服器或 CDN 紀錄裡搜尋真實的爬蟲 User-Agent 字串——GPTBot、ClaudeBot、PerplexityBot、Google-Extended、OAI-SearchBot——並核對每一筆請求實際拿到的 HTTP 狀態碼。一連串403或跳轉驗證碼的紀錄,比 robots.txt 檔案更能說明真相。
  • 用爬蟲的身分主動發一次真實請求。從外部伺服器(不是自己公司內網)發一個帶 AI 爬蟲 User-Agent 的請求,看實際回傳的狀態碼和內容。如果收到的是驗證頁面或直接被攔截,答案就已經很清楚了,不用管 robots.txt 裡寫了什麼。
  • 直接查看 CDN 的機器人管理後台——比如 Cloudflare 的 AI Crawl Control、Fastly 的機器人規則,或 WAF 的代管規則集——而不要以為 robots.txt 是唯一發揮作用的開關。真正的決策往往就是在這些後台裡做出的。
  • 如果用的是 Cloudflare,趁政策預設值改變之前重新核對一遍設定——新註冊和免費版帳號的預設值正越來越多轉向「預設封鎖」而非「預設允許」,一個你從沒動過的設定也可能在不知不覺間變了。
  • 每次更換 CDN、主機商或安全外掛之後都重新測一遍。一條新的 WAF 規則或「機器人防護」開關,就足以在完全不碰 robots.txt 檔案的情況下,悄悄抹掉你幾個月的 GEO 投入。

對雙語網站來說,這個問題的殺傷力是雙倍的:同一套 WAF 規則或 CDN 設定,英文頁面和中文頁面用的是同一層基礎設施——一條設定錯誤的規則,就可能讓你花心思建設的中英雙語 GEO 內容,在兩種語言上同時對 AI 爬蟲「隱形」。

參考來源