Syftet med en robots.txt-fil och dess funktion
En robots.txt-fil är en textfil som placeras på en webbplats rotkatalog för att ge instruktioner till webbkrälare, såsom Googlebot, om vilka delar av webbplatsen de får besöka och indexera. Genom att definiera specifika regler kan webbplatsägare styra trafiken från sökrobotar och förhindra att känsliga eller oviktiga kataloger belastar servern i onödan.
Detta verktyg, Robots.txt-generator & testverktyg, gör det möjligt att bygga en robots.txt-fil genom att lägga till anpassade regler för olika krälare och därefter testa specifika sökvägar för att verifiera om en sökrobot tillåts eller blockeras av de skapade reglerna. Verktyget startar med en standardinställning som innehåller User-agent: * och Disallow: /admin.
Hantering av User-agent och styrning av sökrobotar
En central del i robots.txt är direktivet User-agent, vilket anger vilken specifik sökrobot som en grupp av regler gäller för. Om reglerna ska gälla universellt för alla krälare används tecknet *.
När du konfigurerar dina regler i verktyget måste du observera följande tekniska villkor för att undvika valideringsfel:
- Ett user-agent-namn får inte innehålla några blanksteg. Om ett ogiltigt namn anges visar verktyget felmeddelandet: "Ange ett user-agent-namn utan blanksteg, eller använd * för alla sökrobotar.".
- Om samma user-agent namnges i flera olika grupper flaggas detta med meddelandet: "Google slår samman grupper som anger samma user-agent.".
Interaktion mellan Allow- och Disallow-regler
Regler för sökvägar styr om en sökrobot har tillträde eller inte via direktiven Allow (Tillåt) och Disallow (Blockera). För att reglerna ska vara giltiga krävs att vissa syntaxkrav uppfylls:
- Varje regelsökväg måste inledas med tecknet
/och får inte innehålla några blanksteg. Vid avvikelser visas felmeddelandet: "Regelsökvägar måste börja med / och får inte innehålla blanksteg.". - Specialtecknet
$kan användas för att markera slutet på en sökväg, men det får endast placeras i slutet av regelsökvägen. Annars visas felmeddelandet: "Använd endast $ i slutet av en regelsökväg.". - Om exakt samma regel upprepas för samma user-agent flaggas detta som: "Denna regel är upprepad för samma user-agent.".
- Om en
Allow-regel och enDisallow-regel definieras för exakt samma sökväg, uppstår en konflikt som verktyget flaggar med: "Allow och Disallow använder samma sökväg. Google tillämpar Allow när båda är lika specifika.".
Webbplatskartor i robots.txt
Att inkludera en webbplatskarta (sitemap) i din robots.txt-fil hjälper sökrobotar att snabbt hitta och indexera alla relevanta sidor på din webbplats. I verktyget kan du lägga till en eller flera webbplatskartor under sektionen för sitemaps.
För att en webbplatskarta ska accepteras måste dess URL anges som en fullständig adress som börjar med antingen http:// eller https://. Om adressen är ofullständig eller felaktigt formaterad visar verktyget felmeddelandet: "Webbplatskartans URL kräver en fullständig http://- eller https://-adress.".
Googles matchningsordning för regler
När en sökrobot som Googlebot tolkar reglerna i en robots.txt-fil, tillämpas specifika prioriteringar för att avgöra om en sökväg är tillåten eller blockerad:
- Längsta matchningen vinner: Google följer en matchningsordning där den mest specifika regeln (den regel med flest tecken som matchar den aktuella URL-sökvägen) har företräde.
- Lika specifika regler: Om en matchande
Allow-regel och enDisallow-regel är exakt lika långa och därmed lika specifika, vinnerAllow.
När du testar en sökväg mot en sökrobot i verktyget kan resultatet presenteras på tre sätt:
- Tillåten —
{rule}: Visar att sökvägen är godkänd och anger vilken specifik regel som tillåter den. - Blockerad —
{rule}: Visar att sökvägen är spärrad och anger den regel som blockerar den. - Ingen matchande regel. Google tillåter denna sökväg som standard.: Visas när ingen av de definierade reglerna matchar den testade sökvägen.
Begränsningar med robots.txt vid indexering
Det är viktigt att förstå att robots.txt inte är en metod för att säkert dölja eller ta bort innehåll från sökmotorernas sökresultat. En blockerad sida kan fortfarande visas i sökresultaten om andra externa eller interna sidor länkar till den.
Robots.txt-filer har följande begränsningar:
- Verktyget kontrollerar inte och kan inte hantera direktiv som
noindex. - Det hanterar inte åtkomstkontroll (autentisering) eller faktisk borttagning av sidor från webbservern.
- Om den genererade robots.txt-filen blir extremt omfattande och överskrider 100 000 tecken, kan verktyget inte validera den och visar felmeddelandet: "Denna robots.txt är för stor för att granskas här.".
Integritet och lokal databehandling
När du använder detta verktyg för att generera och testa dina robots.txt-regler sker all databehandling lokalt. Dina sökregler skapas och kontrolleras direkt i din webbläsare, vilket innebär att ingenting laddas upp till BroBroGo.
Vanliga frågor
Vad kan denna generator lägga till i robots.txt? Lägg till en user-agent-grupp, tillåtna (Allow) och blockerade (Disallow) sökvägar samt en eller flera webbplatskartor (sitemaps). Förhandsgranskningen är redo att kopieras direkt till en robots.txt-fil.
Hur väljer sökvägskontrollen vilken regel som gäller? Den följer Googles matchningsordning: den längsta matchande sökvägen vinner. Om matchande Allow- och Disallow-regler är lika specifika vinner Allow.
Tar Disallow bort en sida från Google Sök? Nej. En blockerad sida kan fortfarande visas i sökresultat om andra sidor länkar till den. Använd noindex, åtkomstkontroll eller ta bort sidan helt om du vill hålla den borta från sökresultaten.