Robots.txt
Les sites web doivent fournir un fichier robots.txt, qui indique aux robots des moteurs de recherche quelles parties du site ils peuvent visiter. Silktide vérifie que votre site en délivre un.
Un se trouve à la racine du site — pour example.com, il doit être à l’adresse example.com/robots.txt. Pour autoriser les robots partout, le fichier peut être aussi simple que :
# Autoriser tous les robots à accéder à tout
User-agent: *
Disallow:
Pourquoi c’est important
Les robots demandent robots.txt avant toute autre chose, et son absence vous prive du moyen standard de les orienter — loin des pages de résultats de recherche, des filtres à facettes ou d’autres URL qui gaspillent le budget de crawl. C’est aussi là que vous déclarez l’emplacement de votre avec une ligne Sitemap:.
Même pour un site qui souhaite que tout soit exploré, un robots.txt explicite indique clairement cette intention au lieu de laisser les robots l’inférer à partir d’une réponse d’erreur.
Comment corriger
- Créez un fichier texte nommé
robots.txtet placez-le dans le dossier racine de votre site web, afin qu’il soit servi àhttps://example.com/robots.txt. - Commencez de manière permissive (l’exemple ci‑dessus) et ajoutez des règles
Disallowuniquement pour les zones que les robots doivent ignorer. - Ajoutez une ligne
Sitemap:pointant vers votre sitemap XML :
User-agent: *
Disallow: /search/
Sitemap: https://example.com/sitemap.xml
- Confirmez que le fichier se charge dans un navigateur et renvoie une réponse normale plutôt qu’une page d’erreur. De nombreux systèmes de gestion de contenu peuvent le générer et le servir pour vous.
Comment Silktide teste cela
- Prendre l’URL d’accueil de chaque de votre site web.
- Demander
/robots.txtà la racine de cet hôte. - Réussite si la requête renvoie le statut HTTP 200 (OK) ; signaler la section si le fichier est manquant, renvoie une erreur ou ne peut pas être téléchargé.
Dépannage
J’ai un robots.txt mais la vérification échoue
Le fichier doit être servi avec le statut HTTP 200. Certains serveurs renvoient une « erreur souple » — une page qui ressemble à une erreur mais implique une redirection ou un statut d’erreur — ou bloquent totalement les requêtes automatisées. Testez l’URL directement et vérifiez le code d’état, idéalement avec les outils de développement de votre navigateur ou depuis un autre réseau.
Le fichier robots.txt empêchera‑t‑il les pages d’apparaître dans les résultats de recherche ?
Pas de manière fiable. Disallow empêche l’exploration, mais une page peut quand même être indexée à partir de liens ailleurs. Pour exclure une page des résultats, utilisez plutôt — voir Page définie sur noindex.