Política de acceso de rastreadores de IA
Una política de acceso de rastreadores de IA es una configuración deliberada de (y a veces del cortafuegos) que indica qué sistemas de IA pueden obtener tus páginas públicas y con qué propósito. Es situacional porque la «respuesta correcta» depende de si te importa más ser citado en respuestas de asistentes de IA, mantener el contenido fuera del entrenamiento de modelos o ambas cosas. Lo que no es situacional es tratar una plantilla pegada de «bloquear toda la IA» como si fuera un endurecimiento de seguridad neutral. Esa elección tiene consecuencias de marketing.
En toda esta página, supongamos que Fernwood quiere aparecer citado en las respuestas de ChatGPT y Claude sobre la gestión de gastos, pero su equipo legal prefiere no contribuir páginas nuevas a los corpus de entrenamiento de modelos fundacionales.
Esta técnica trata sobre el acceso. Una vez que se permite la entrada a un rastreador, aún debe recibir HTML real; consulta Contenido legible sin JavaScript. Un mapa curado opcional se trata por separado en llms.txt.
Por qué es situacional
Los productos de IA ya no usan un único «bot de IA». Los principales proveedores dividen sus rastreadores por función:
| Función | Bots típicos | Qué implica bloquearlos |
|---|---|---|
| Entrenamiento de modelos | OpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (control de entrenamiento/fundamentación de Gemini; no es Googlebot) | Indica que el contenido no debe usarse para entrenar (o, en el caso de Google-Extended, para entrenar Gemini/impulsar ciertas funciones de IA). No te saca por sí solo de la Búsqueda clásica de Google. |
| Indexación para búsqueda/respuestas | OpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBot | Reduce o elimina la elegibilidad para aparecer citado en las respuestas de búsqueda de ese producto. |
| Recuperación activada por el usuario | OpenAI ChatGPT-User, Anthropic Claude-User, agentes similares de «el usuario pidió esta URL» | Controla las recuperaciones en vivo cuando una persona dirige el asistente a una página. Las reglas del proveedor difieren sobre si estos agentes respetan el robots.txt: comprueba la documentación actual del proveedor antes de asumir que un Disallow funciona. |
La documentación de los rastreadores de OpenAI declara explícitamente su independencia: un webmaster puede permitir que OAI-SearchBot aparezca en las funciones de búsqueda de ChatGPT mientras deshabilita GPTBot para que el contenido rastreado no se use para entrenar modelos generativos fundacionales. Anthropic documenta la misma división triple para ClaudeBot (entrenamiento), Claude-SearchBot (calidad de búsqueda) y Claude-User (recuperación dirigida por el usuario).
Así que la pregunta de política no es «¿IA: activada o desactivada?». Son tres decisiones separadas que deben ajustarse a la tolerancia al riesgo y a los objetivos de AEO de Fernwood.
Normalmente permite los rastreadores de búsqueda/respuestas cuando:
- Quieres que los asistentes de IA citen la documentación, investigación y páginas comparativas de Fernwood.
- Los competidores ya aparecen en esas respuestas y tú no.
- La comprobación Acceso de rastreadores de IA de Silktide muestra una advertencia porque una plantilla bloqueó todo por accidente.
A menudo bloquea o limita los rastreadores de entrenamiento cuando:
- La política legal o de marca prohíbe contribuir contenido del sitio al entrenamiento de modelos de terceros.
- Publicas investigación propietaria, lógica de precios o material cercano a contenido restringido que debe mantenerse fuera de los corpus de entrenamiento incluso si aún quieres citas en vivo.
Bloquea ampliamente cuando:
- El sitio no es público, es de pruebas, o no hay motivo de marketing para estar en respuestas de asistentes de IA (intranet, interfaz de aplicación pura, portal de socios).
- Has tomado una decisión de producto consciente para no aparecer en respuestas de IA en absoluto, y estás dispuesto a perder ese canal.
Cómo decidir (hoja de trabajo de Fernwood)
Sigue estos pasos en orden. Escribe las respuestas; el archivo robots.txt no es más que la codificación de la hoja de trabajo.
- ¿Queremos ser citados en respuestas de IA? Si no, desautoriza los principales bots de búsqueda/respuestas y aprueba la advertencia de Silktide. Si sí, continúa.
- ¿Qué asistentes de IA importan? ChatGPT, Claude, Perplexity, las funciones de Google AI y otros tienen cada uno sus propios agentes. Prioriza los que tus compradores realmente usan.
- ¿Es obligatorio excluirse del entrenamiento? Si Legal dice que sí, desautoriza los agentes de entrenamiento (
GPTBot,ClaudeBot,Google-Extended,CCBoty homólogos) manteniendo permitidos los agentes de búsqueda cuando el proveedor admita la separación. - ¿Hay rutas que deban permanecer privadas en cualquier caso?
\/app\/,\/internal\/, URL de previsualización de borradores: desautorízalas para*(y confirma que la autenticación sigue protegiéndolas; robots.txt no es control de acceso). - ¿Se puede realmente obtener el HTML? Un robots.txt permisivo con un cascarón vacío de SPA sigue fallando en AEO; soluciona el renderizado a continuación.
Implementar la política en robots.txt
El robots.txt se encuentra en https:\/\/fernwood.example\/robots.txt. Las reglas son por grupo de user-agent. Los grupos más específicos anulan la regla general para ese agente. Prefiere agentes con nombre en lugar de confiar en que User-agent: * exprese tu política de IA: las plantillas que ponen Disallow: \/ bajo * también perjudican a Googlebot y a los demás.
Patrón A: visible en respuestas, fuera del entrenamiento (común en sitios orientados a AEO)
# OpenAI: permitir citas en búsqueda de ChatGPT; no usar para entrenamiento de modelos fundacionales
User-agent: OAI-SearchBot
Allow: \/
User-agent: GPTBot
Disallow: \/
# Anthropic: permitir indexación para búsqueda; bloquear rastreo de entrenamiento
User-agent: Claude-SearchBot
Allow: \/
User-agent: ClaudeBot
Disallow: \/
# Google: Googlebot (Búsqueda) es distinto; Google-Extended controla el entrenamiento de Gemini\/funciones de IA
User-agent: Google-Extended
Disallow: \/
# Mantener cerradas a todos las rutas privadas de la aplicación
User-agent: *
Disallow: \/app\/
Disallow: \/internal\/
OpenAI señala que los cambios en robots.txt para la búsqueda pueden tardar del orden de ~24 horas en surtir efecto. Vuelve a comprobar tras la publicación.
Patrón B: totalmente abierto (alcance máximo en motores de respuesta)
Omite reglas de Disallow específicas para IA. Asegúrate de que nada bajo User-agent: * prohíba accidentalmente todo el sitio. Sigue protegiendo las rutas privadas.
Patrón C: totalmente cerrado a productos de IA
User-agent: GPTBot
Disallow: \/
User-agent: OAI-SearchBot
Disallow: \/
User-agent: ClaudeBot
Disallow: \/
User-agent: Claude-SearchBot
Disallow: \/
User-agent: Claude-User
Disallow: \/
User-agent: PerplexityBot
Disallow: \/
User-agent: Google-Extended
Disallow: \/
User-agent: CCBot
Disallow: \/
Úsalo solo como una decisión consciente. Luego la advertencia de rastreadores de IA de Silktide para que el hallazgo deje de contar en contra del sitio.
Verifica quién realmente accede a tu sitio
Las cadenas User-Agent son triviales de suplantar. Prefiere las listas de IP publicadas por los proveedores cuando necesites certeza:
- OpenAI publica IPs de rastreadores en JSON (enlazado desde la documentación de bots de OpenAI).
- Anthropic publica IPs de rastreadores en claude.com/crawling/bots.json.
El bloqueo solo por IP, sin una señal en robots.txt, es frágil: Anthropic indica que los bloqueos por IP pueden interferir con la capacidad del bot para leer tu robots.txt y completar correctamente un opt‑out.
Lo que robots.txt no soluciona
- Falsos positivos del cortafuegos/gestión de bots. Un cortafuegos de aplicaciones web (WAF), la capa de filtrado que servicios como Cloudflare ponen delante de un sitio, que desafía o devuelve respuestas 403 a clientes «no navegador» puede bloquear GPTBot incluso cuando robots.txt lo permite. Silktide lo prueba por separado como la comprobación Rastreadores de IA bloqueados en la práctica.
- Cáscaras vacías de JavaScript. Permitir la entrada del rastreador a un
<div id="root"></div>no ayuda a nadie. Combina esta técnica con Contenido legible sin JavaScript. - Un impulso mágico de posicionamiento. Permitir rastreadores hace que la citación sea posible. Las páginas citables, las fechas, la identidad y la evidencia siguen determinando si te eligen; consulta Estructura de página orientada a la respuesta y Marcado de identidad de la organización.
llms.txtcomo sustituto. Un archivo índice no puede anular unDisallow. Consulta llms.txt.
Cómo ayuda Silktide
- Acceso de rastreadores de IA analiza robots.txt frente a una lista de user-agents de IA conocidos y avisa cuando la raíz del sitio está desautorizada; es una advertencia que puedes aprobar cuando el bloqueo sea intencional.
- Rastreadores de IA bloqueados en la práctica realiza solicitudes como esos rastreadores para detectar bloqueos del cortafuegos y en el edge que robots.txt no puede explicar.
- Contenido sin JavaScript detecta el modo de fallo «permitido pero vacío».
Relacionado
- Acceso de rastreadores de IA: la comprobación de Silktide que esta técnica amplía
- Contenido legible sin JavaScript
- llms.txt: índice curado opcional una vez resuelto el acceso
- Documentación de rastreadores de OpenAI
- Documentación de rastreadores de Anthropic
- Resumen de rastreadores de Google (incluido Google-Extended)
- Especificación de robots.txt (RFC 9309)