Robots.txt
Websites bør have en robots.txt-fil, som fortæller søgemaskinecrawlere, hvilke dele af sitet de må besøge. Silktide tjekker, at dit website leverer en.
En -fil ligger i sitets rodmappe – for example.com skal den ligge på example.com/robots.txt. Hvis du vil tillade crawlere overalt, kan filen være så enkel som:
# Tillad alle crawlere adgang til alt
User-agent: *
Disallow:
Hvorfor det er vigtigt
Crawlere anmoder om robots.txt før noget andet, og hvis den mangler, har du ikke den almindelige måde at styre dem på – væk fra søgeresultatsider, facetterede filtre eller andre URL'er, der spilder crawlbudgettet. Det er også her, du angiver placeringen af dit med en Sitemap:-linje.
Selv for et site, hvor alt skal crawles, angiver en eksplicit robots.txt tydeligt denne hensigt i stedet for at lade crawlere udlede den fra et fejlsvar.
Sådan retter du det
- Opret en ren tekstfil med navnet
robots.txt, og placer den i rodmappen på dit website, så den leveres påhttps://example.com/robots.txt. - Start med en tilladende opsætning (eksemplet ovenfor), og tilføj kun
Disallow-regler for områder, som crawlere skal springe over. - Tilføj en
Sitemap:-linje, der peger på dit XML-sitemap:
User-agent: *
Disallow: /search/
Sitemap: https://example.com/sitemap.xml
- Bekræft, at filen indlæses i en browser og returneres normalt frem for en fejlside. Mange indholdsstyringssystemer kan oprette og levere den for dig.
Sådan tester Silktide dette
- Tag start-URL'en for hver på dit website.
- Anmod om
/robots.txti roden af den host. - Bestå, hvis anmodningen returnerer HTTP-status 200 (OK); markér sektionen, hvis filen mangler, returnerer en fejl eller ikke kan downloades.
Fejlfinding
Jeg har en robots.txt, men tjekket fejler
Filen skal leveres med HTTP-status 200. Nogle servere returnerer en "blød" fejlside – en side, der ligner en fejl, men har en omdirigerings- eller fejlstatus – eller blokerer automatiserede anmodninger helt. Test URL'en direkte, og kontrollér statuskoden, helst med browserens udviklerværktøjer eller fra et andet netværk.
Holder robots.txt sider ude af søgeresultater?
Ikke pålideligt. Disallow stopper crawling, men en side kan stadig blive indekseret via links andre steder. Hvis du vil holde en side ude af resultaterne, skal du i stedet bruge – se Side er sat til noindex.