SEO 가이드

당신의 robots.txt는 '가능'이라고 말하지만, CDN은 '불가능'이라고 말할 수 있다

2026년 7월 10,894개 사이트를 조사한 연구에 따르면 robots.txt에서 선언한 GPTBot 차단 규칙의 39.5%가 실제로는 적용되지 않았다. 반대로 크롤러를 허용한다고 선언한 사이트도 CDN이나 방화벽에 의해 조용히 차단되는 경우가 있다.

많은 중소기업은 robots.txt 파일을 절대적인 기준으로 여긴다. "GPTBot을 허용했으니 ChatGPT에서 보일 것이다"라고 믿는 식이다. 하지만 2026년 7월 연구에 따르면 상당수 사이트에서 이 가정은 틀렸다.

HasData의 AI Crawler Block Index는 10,894개 도메인(Tranco 상위 9,746개 사이트 + 뉴스 매체 1,148개)의 실제 크롤러 동작을 측정했다. 핵심 발견: robots.txt에 선언된 GPTBot "Disallow" 규칙 중 39.5%가 실제로 전혀 적용되지 않았다. 사이트는 차단을 선언했지만, 앞단의 CDN이나 방화벽이 그 정책에 맞게 설정되지 않아 GPTBot이 그대로 크롤링한 것이다.

반대 방향 문제도 흔하다

robots.txt에서 AI 크롤러를 명시적으로 허용한 사이트도 네트워크 경계에서 조용히 거부당할 수 있다. CDN의 봇 관리 규칙, WAF 검증 페이지, 호스팅 대시보드의 포괄적인 "AI 봇 차단" 스위치는 모두 robots.txt가 읽히기 전에 작동한다. HasData에 따르면 제공업체별로 실제 집행 방식이 다르다: Fastly는 즉시 차단하는 경향이 있고, Cloudflare는 검증 페이지를 띄우며, CloudFront는 대체로 트래픽을 통과시킨다 — 동일한 선언된 정책이 인프라에 따라 완전히 다른 결과를 낳는다.

차단해도 원하는 효과를 얻지 못할 수 있다

연구팀은 Google AI Mode에서 10개의 테스트 쿼리를 실행해 인용된 52개 도메인을 확인했는데, 그중 27개(51.9%)가 robots.txt에서 최소 하나의 AI 크롤러를 차단하고 있었다 — 전체 표본 차단율의 약 3배다. robots.txt에서 차단을 선언해도 Google AI Mode의 인용에서 안정적으로 제외되지는 않는다는 뜻이다.

추측이 아니라 실제로 확인하는 방법

  • 접속 로그를 확인하라. GPTBot, ClaudeBot, PerplexityBot, Google-Extended 등 실제 사용자 에이전트와 그들이 받은 HTTP 상태 코드를 확인한다.
  • 실제 요청을 보내보라. 외부 서버에서 AI 크롤러의 사용자 에이전트로 요청을 보내 실제 응답을 확인한다.
  • CDN의 봇 관리 대시보드를 직접 확인하라 — Cloudflare AI Crawl Control, Fastly 봇 규칙, WAF 관리 규칙 등.
  • CDN, 호스팅, 보안 플러그인을 변경할 때마다 다시 테스트하라.

출처