Bloqueo de rastreadores de IA
Silktide comprueba si las solicitudes que se identifican como los principales rastreadores de IA realmente llegan a tu sitio web. Un sitio puede dar la bienvenida a estos rastreadores sobre el papel mientras un firewall o producto de seguridad los rechaza en la puerta.
Tu puede decir que los son bienvenidos mientras tu firewall los rechaza. Los y los productos de seguridad incluyen interruptores de un clic "bloquear bots de IA" —algunos activados por defecto— que rechazan cualquier solicitud que se identifique como GPTBot, ClaudeBot, PerplexityBot o similar, independientemente de lo que declare robots.txt. Con frecuencia, los propietarios del sitio no saben que esto está activado: para ti el sitio funciona perfectamente, mientras que para cada asistente de IA no existe.
Por qué es importante
Los asistentes de IA solo pueden citar y recomendar el contenido que sus rastreadores pueden recuperar. Un bloqueo a nivel de firewall es invisible en el uso normal: tu sitio carga bien en todos los navegadores, tus métricas parecen correctas, pero los motores de respuesta fallan silenciosamente al leerte y citan a la competencia en su lugar. Como nada falla de forma visible, este es uno de los problemas de visibilidad más difíciles de detectar sin comprobarlo directamente.
El control independiente de Silktide Acceso de rastreadores de IA cubre lo que declara tu robots.txt. Este control cubre lo que realmente ocurre a nivel de red. Ambos suelen discrepar y, cuando lo hacen, gana el firewall.
Cómo solucionarlo
- Revisa el panel de tu CDN o de seguridad para ver si hay bloqueo de bots de IA. En Cloudflare, busca en Seguridad "AI bots" o "Bot Fight Mode"; otros proveedores como Akamai, Imperva y DataDome tienen interruptores equivalentes. A veces vienen activados por defecto.
- Si el bloqueo es involuntario, desactiva el interruptor o añade los rastreadores específicos que quieras permitir a tu lista de permitidos (allowlist).
- Si tienes reglas propias de firewall o servidor que hacen coincidir agentes de usuario de bots, elimina las entradas de los rastreadores de IA que quieras admitir.
- Si bloqueas deliberadamente los rastreadores de IA, el hallazgo: es una decisión legítima.
Cómo lo comprueba Silktide
- Solicita tu página de inicio con una identidad de navegador normal. Si esa solicitud es rechazada o se presenta un desafío, el control no es aplicable: no se puede atribuir nada a discriminación contra rastreadores.
- Vuelve a solicitar la página de inicio identificándose como cada rastreador de IA principal (GPTBot, ClaudeBot, PerplexityBot y CCBot), usando las cadenas de User-Agent que publican sus operadores. Todas las solicitudes proceden del mismo lugar, por lo que cualquier diferencia en la respuesta se debe a la identidad del rastreador.
- Se considera que un rastreador está bloqueado cuando su solicitud recibe un estado de rechazo
directo (por ejemplo
403 Forbidden,429 Too Many Requestso503), una página de desafío o que un rastreador no puede resolver, o ninguna respuesta en absoluto mientras la solicitud del navegador sí tuvo éxito. - Se advierte cuando se rechaza a cualquier rastreador, indicando cuáles.
Todas las solicitudes apuntan solo a la página de inicio y se ejecutan una vez por prueba.
Solución de problemas
Verificamos los rastreadores por su red, no solo por su nombre
Algunos sitios solo admiten solicitudes que provienen de direcciones de red verificadas del operador del rastreador. La prueba de Silktide envía la identidad publicada del rastreador desde su propia red, por lo que ese sitio puede rechazar la prueba mientras admite al rastreador real. Esta configuración es mucho menos común que el bloqueo general por identidad; si has confirmado que la utilizas, aprueba el hallazgo.
El control pasa, pero los asistentes siguen sin encontrar mi contenido
Entrar por la puerta es necesario pero no suficiente. Comprueba que tu robots.txt permite los rastreadores de IA (Acceso de rastreadores de IA) y que tu contenido no requiere para mostrarse (Contenido sin JavaScript).