Passer au contenu
SilktideAide

Robots.txt

Les sites Web devraient fournir un fichier robots.txt, qui indique aux robots d’exploration des moteurs de recherche quelles parties du site ils peuvent visiter. Silktide vérifie que votre site en diffuse un.

Un fichier se trouve à la racine du site — pour « example.com », il doit être à « example.com/robots.txt ». Pour autoriser les robots partout, le fichier peut être aussi simple que :

# Autoriser tous les robots à accéder à tout
User-agent: *
Disallow:

Pourquoi c’est important

Les robots demandent robots.txt avant toute autre chose, et son absence vous prive de la méthode standard pour les orienter — loin des pages de résultats de recherche, des filtres à facettes, ou d’autres URL qui gaspillent le budget d’exploration. C’est aussi là que vous déclarez l’emplacement de votre avec une ligne « Sitemap: ».

Même pour un site qui souhaite que tout soit exploré, un robots.txt explicite énonce clairement cette intention au lieu de laisser les robots l’inférer à partir d’une réponse d’erreur.

Comment le corriger

  1. Créez un fichier texte brut nommé « robots.txt » et placez-le dans le dossier racine de votre site Web, afin qu’il soit diffusé à « https://example.com/robots.txt ».
  2. Commencez de façon permissive (voir l’exemple ci-dessus) et n’ajoutez des règles « Disallow » que pour les zones que les robots doivent éviter.
  3. Ajoutez une ligne « Sitemap: » pointant vers votre plan du site XML :
User-agent: *
Disallow: /search/

Sitemap: https://example.com/sitemap.xml
  1. Confirmez que le fichier se charge dans un navigateur et renvoie une réponse normale plutôt qu’une page d’erreur. De nombreux systèmes de gestion de contenu peuvent le générer et le diffuser pour vous.

Comment Silktide teste ceci

  1. Prendre l’URL d’accueil de chaque de votre site Web.
  2. Demander « /robots.txt » à la racine de cet hôte.
  3. Réussite si la requête renvoie le statut HTTP 200 (OK); signaler la section si le fichier est manquant, renvoie une erreur ou ne peut pas être téléchargé.

Dépannage

J’ai un robots.txt mais la vérification échoue

Le fichier doit être diffusé avec le statut HTTP 200. Certains serveurs renvoient une « fausse » page d’erreur (« soft error ») — une page qui ressemble à une erreur mais comporte une redirection ou un code d’erreur — ou bloquent entièrement les requêtes automatisées. Testez directement l’URL et vérifiez le code d’état, idéalement avec les outils de développement de votre navigateur ou à partir d’un autre réseau.

Le fichier robots.txt empêchera-t-il les pages d’apparaître dans les résultats de recherche ?

Pas de façon fiable. « Disallow » empêche l’exploration, mais une page peut quand même être indexée à partir de liens ailleurs. Pour empêcher qu’une page apparaisse dans les résultats, utilisez plutôt — voir Page définie sur noindex.

En savoir plus

Dernière mise à jour

Cette page vous a-t-elle été utile?

Robots.txt | Aide de Silktide