Robots.txt
Los sitios web deberían proporcionar un archivo , que indica a los rastreadores de los motores de búsqueda qué partes del sitio pueden visitar. Silktide comprueba que tu sitio web sirva uno.
Un archivo se ubica en la raíz del sitio; para example.com debe estar en example.com/robots.txt. Para permitir a los rastreadores acceder a todo, el archivo puede ser tan sencillo como:
# Permitir que todos los rastreadores accedan a todo
User-agent: *
Disallow:
Por qué es importante
Los rastreadores solicitan robots.txt antes que nada, y su ausencia te deja sin la forma estándar de dirigirlos, lejos de las páginas de resultados de búsqueda, de filtros facetados u otras URL que desperdician presupuesto de rastreo. También es donde indicas la ubicación de tu con una línea Sitemap:.
Incluso para un sitio que quiere que se rastree todo, un robots.txt explícito deja clara esa intención en lugar de dejar que los rastreadores la infieran a partir de una respuesta de error.
Cómo solucionarlo
- Crea un archivo de texto plano llamado
robots.txty colócalo en la carpeta raíz de tu sitio web, para que se sirva enhttps://example.com/robots.txt. - Empieza de forma permisiva (el ejemplo anterior) y añade reglas
Disallowsolo para las áreas que los rastreadores deban omitir. - Añade una línea
Sitemap:que apunte a tu mapa del sitio XML:
User-agent: *
Disallow: /search/
Sitemap: https://example.com/sitemap.xml
- Confirma que el archivo se cargue en un navegador y devuelva una respuesta normal en lugar de una página de error. Muchos sistemas de gestión de contenidos pueden generarlo y servirlo por ti.
Cómo lo comprueba Silktide
- Tomar la URL de inicio de cada de tu sitio web.
- Solicitar
/robots.txten la raíz de ese host. - Se aprueba si la solicitud devuelve el estado HTTP 200 (OK); se marca la sección si el archivo falta, devuelve un error o no se puede descargar.
Solución de problemas
Tengo un robots.txt pero la comprobación falla
El archivo debe servirse con estado HTTP 200. Algunos servidores devuelven una página de error blando (soft), una página que parece un error pero lleva un estado de redirección o de error, o bloquean por completo las solicitudes automatizadas. Prueba la URL directamente y comprueba el código de estado, idealmente con las herramientas de desarrollo de tu navegador o desde otra red.
¿Mantendrá robots.txt las páginas fuera de los resultados de búsqueda?
No de forma fiable. Disallow detiene el rastreo, pero una página aún puede indexarse desde enlaces en otros lugares. Para mantener una página fuera de los resultados, usa en su lugar; consulta Página configurada como noindex.