Robots.txt och noindex löser två olika problem. Robots.txt används främst för att styra vilka URL:er sökmotorers crawlers får hämta. noindex används när en sida får vara åtkomlig men inte ska visas i Googles sökresultat. Blandar du ihop dem kan resultatet bli motsatsen till det du tänkt dig.
Robots.txt styr crawling
Google beskriver robots.txt som ett sätt att tala om vilka URL:er en crawler får begära. Det kan vara användbart för att minska onödig crawling av exempelvis stora filterytor, interna sökresultat eller andra URL-mönster som inte behöver hämtas hela tiden.
Det viktiga är att robots.txt inte är ett säkert sätt att hålla en vanlig webbsida borta från Googles index. En blockerad URL kan fortfarande bli känd genom länkar från andra sidor och i vissa fall visas som en URL utan normal beskrivning.
Noindex styr indexering
Vill du att en sida inte ska visas i Google Search är noindex den tydligare instruktionen. Den kan anges som en robots-meta-tagg i sidans HTML eller som en X-Robots-Tag i HTTP-svaret. När Googlebot crawlar sidan och ser instruktionen kan sidan tas bort från sökresultatet.
Här finns en viktig detalj: sidan måste vara möjlig för Googlebot att crawla för att boten ska kunna läsa noindex-instruktionen. Om samma URL samtidigt blockeras i robots.txt kan Google inte hämta sidan och därmed inte se taggen.
När passar robots.txt bäst?
- När du vill styra crawlertrafik till mindre viktiga eller mycket stora URL-ytor.
- När parametrar eller facetter skapar många URL-varianter som inte behöver crawlas.
- När resurser eller kataloger inte behöver hämtas av en viss crawler.
Robots.txt ska däremot inte användas för hemligt eller känsligt innehåll. Filen är publik och rätt åtkomstskydd är inloggning eller annan autentisering.
När passar noindex bäst?
- Interna tack-sidor eller kampanjsidor som får vara publikt åtkomliga men inte ska ranka.
- Test- eller hjälpsidor som av tekniska skäl måste vara nåbara.
- PDF-filer eller andra resurser där
X-Robots-Tag: noindexär lämpligare än en HTML-meta-tagg.
Undvik den vanligaste kombinationsfällan
En vanlig miss är att först lägga Disallow i robots.txt och sedan lägga noindex på samma sida. Om crawlern inte får öppna sidan kan den inte läsa noindex. Vill du få en redan indexerad webbsida borttagen bör den normalt vara crawlbar tills Google har sett noindex-signalen.
Praktisk kontrollista
- Bestäm först om målet är att stoppa crawling, indexering eller båda.
- Kontrollera robots.txt så att viktiga URL:er inte blockeras av misstag.
- Använd noindex när sidan inte ska visas i sökresultatet.
- Testa den live URL:en i Search Console efter ändringen.
- Följ upp i Page Indexing-rapporten i stället för att anta att effekten är omedelbar.
Källor
Google Search Central: Block Search indexing with noindex
>Google Search Central: Introduction to robots.txt




Kommentarer
Skriv sakligt och respektfullt. Alla kommentarer granskas innan de visas.
Det finns inga publicerade kommentarer ännu.