Muchas pequeñas empresas tratan su archivo robots.txt como la verdad absoluta: "permití GPTBot, así que soy visible en ChatGPT". Una investigación de julio de 2026 demuestra que esa suposición falla en una parte importante de los sitios.
El AI Crawler Block Index de HasData midió el comportamiento real de los rastreadores en 10,894 dominios (9,746 sitios del ranking Tranco más 1,148 medios de noticias). Hallazgo principal: el 39.5% de las reglas "Disallow" para GPTBot en robots.txt nunca se aplican realmente — el sitio declara el bloqueo, pero GPTBot lo rastrea igual, porque el CDN o firewall frente al sitio nunca se configuró para coincidir con esa política.
El problema también ocurre al revés
Sitios que sí permiten explícitamente a los rastreadores de IA pueden ser rechazados igualmente en el borde de la red: una regla de gestión de bots del CDN, una página de verificación del firewall, o un interruptor genérico de "bloquear bots de IA" actúan antes de que se lea el robots.txt. HasData encontró que la aplicación varía según el proveedor: Fastly tiende a bloquear directamente, Cloudflare presenta un desafío de verificación, y CloudFront suele dejar pasar el tráfico — tres resultados distintos para la misma política declarada.
Bloquear tampoco garantiza lo que crees
El estudio también probó si bloquear evita ser citado. En 10 consultas de prueba en Google AI Mode, HasData encontró 52 dominios citados que también estaban en su muestra; 27 de esos 52 (51.9%) bloqueaban al menos un rastreador de IA en su robots.txt — una tasa de bloqueo casi tres veces mayor que la de la muestra general. Bloquear no te garantiza quedar fuera de las citas de AI Mode, porque este sistema depende del propio índice de Google.
Cómo comprobarlo de verdad
- Revisa tus registros de acceso, no solo el robots.txt: busca los user-agents reales (GPTBot, ClaudeBot, PerplexityBot, Google-Extended) y el código de estado que recibieron.
- Envía una solicitud real desde un servidor externo usando el user-agent de un rastreador de IA y observa la respuesta real.
- Revisa el panel de gestión de bots de tu CDN directamente — Cloudflare AI Crawl Control, reglas de Fastly, o tu WAF — no asumas que robots.txt es el único control.
- Vuelve a probar después de cualquier cambio de CDN, hosting o plugin de seguridad.
