Vai al contenuto
SilktideAiuto

Robots.txt

I siti web dovrebbero fornire un file robots.txt, che indica ai crawler dei motori di ricerca quali parti del sito possono visitare. Silktide controlla che il tuo sito web ne fornisca uno.

Un file si trova nella directory principale del sito: per example.com deve essere disponibile all'indirizzo example.com/robots.txt. Per consentire ai crawler di accedere ovunque, il file può essere semplice come questo:

# Consenti a tutti i crawler di accedere a ogni contenuto
User-agent: *
Disallow:

Perché è importante

I crawler richiedono robots.txt prima di qualsiasi altra cosa e la sua assenza ti lascia senza il metodo standard per indirizzarli lontano dalle pagine dei risultati di ricerca, dai filtri a faccette o da altri URL che sprecano il budget di scansione. È anche il punto in cui dichiari la posizione della tua tramite una riga Sitemap:.

Anche per un sito che vuole essere sottoposto interamente a scansione, un robots.txt esplicito comunica chiaramente questa intenzione, invece di lasciare che i crawler la deducano da una risposta di errore.

Come risolvere il problema

  1. Crea un file di testo semplice denominato robots.txt e inseriscilo nella directory principale del tuo sito web, in modo che venga fornito all'indirizzo https://example.com/robots.txt.
  2. Inizia con una configurazione permissiva, come quella dell'esempio precedente, e aggiungi regole Disallow solo per le aree che i crawler devono saltare.
  3. Aggiungi una riga Sitemap: che punti alla tua mappa del sito XML:
User-agent: *
Disallow: /search/

Sitemap: https://example.com/sitemap.xml
  1. Verifica che il file venga caricato in un browser e restituisca normalmente una risposta, anziché una pagina di errore. Molti sistemi di gestione dei contenuti possono generarlo e fornirlo automaticamente.

Come esegue il controllo Silktide

  1. Prende l'URL principale di ogni del tuo sito web.
  2. Richiede /robots.txt nella directory principale dell'host.
  3. Supera il controllo se la richiesta restituisce lo stato HTTP 200 (OK); segnala la sezione se il file manca, restituisce un errore o non può essere scaricato.

Risoluzione dei problemi

Ho un robots.txt, ma il controllo non va a buon fine

Il file deve essere fornito con lo stato HTTP 200. Alcuni server restituiscono una pagina di errore “soft”, ovvero una pagina che sembra un errore ma presenta uno stato di reindirizzamento o di errore, oppure bloccano completamente le richieste automatizzate. Prova direttamente l'URL e controlla il codice di stato, idealmente utilizzando gli strumenti per sviluppatori del browser o da una rete diversa.

robots.txt impedirà alle pagine di comparire nei risultati di ricerca?

Non in modo affidabile. Disallow impedisce la scansione, ma una pagina può comunque essere indicizzata tramite link presenti altrove. Per impedire che una pagina compaia nei risultati, usa invece : consulta Pagina impostata su noindex.

Per saperne di più

Ultimo aggiornamento

Questa pagina è stata utile?