Formålet med en robots.txt-fil og dens funktion
En robots.txt-fil er en tekstfil, som placeres på et websteds rodmappe for at vejlede webcrawlere om, hvilke områder af webstedet de må besøge. Når søgemaskiner som Google sender deres crawlere (eksempelvis Googlebot) til et domæne, læser de denne fil først for at forstå de rammer, der er sat for crawling.
Dette værktøj hjælper webansvarlige, udviklere og andre, der ønsker at styre crawleres adgang, med at opbygge og validere disse regler. Ved at definere præcise instruktioner kan man forhindre crawlere i at belaste serveren unødigt eller tilgå specifikke områder, som ikke er beregnet til offentlig crawling. Værktøjet lader dig opbygge en robots.txt-fil trin for trin og derefter teste specifikke URL-stier mod reglerne for at se, om en bestemt crawler vil blive tilladt eller blokeret.
Forståelse af User-agent og styring af crawlere
Reglerne i en robots.txt-fil er organiseret i grupper, der hver især henvender sig til specifikke crawlere. Dette styres via direktivet User-agent.
- Specifikke crawlere: Du kan målrette regler mod en enkelt crawler ved at angive dens præcise navn, som for eksempel Googlebot. Navnet må ikke indeholde mellemrum. Hvis der indtastes et ugyldigt navn, viser værktøjet fejlen: "Indtast ét user-agent-navn uden mellemrum, eller brug * for alle crawlere.".
- Globale regler: Hvis du vil have reglerne til at gælde for alle crawlere, bruges symbolet
*. Værktøjet starter som standard med en opsætning, der indeholderUser-agent: *ogDisallow: /admin.
Hvis den samme user-agent optræder i flere forskellige grupper i filen, vil værktøjet markere dette med advarslen: "Google kombinerer grupper, der navngiver den samme user-agent.".
Regler for Allow og Disallow samt syntaks
Inden for hver user-agent-gruppe defineres adgangen til webstedets stier ved hjælp af to primære instruktioner: Allow (Tillad) og Disallow (Bloker). For at reglerne skal fungere korrekt, skal de overholde en række syntaksregler:
- Stistruktur: Alle regelstier skal starte med tegnet
/og må ikke indeholde mellemrum. Hvis dette ikke overholdes, udløses fejlen: "Regelstier skal starte med / og må ikke indeholde mellemrum.". - Brug af dollartegn ($): Tegnet
$kan bruges til at markere slutningen på en sti. Det må udelukkende placeres i slutningen af regelstien. Hvis det placeres andre steder, viser værktøjet fejlen: "Brug kun $ i slutningen af en regelsti.". - Dubletter: Hvis du ved en fejl opretter den nøjagtig samme regel flere gange under den samme user-agent, flages det med beskeden: "Denne regel er gentaget for den samme user-agent.".
- Konflikter på samme sti: Hvis en
Allow-regel og enDisallow-regel bruger præcis den samme sti, opstår der en konflikt. Værktøjet markerer dette med advarslen: "Allow og Disallow bruger samme sti. Google anvender Allow, når begge er lige specifikke.".
Sitemaps i robots.txt
Et sitemap er en fil, der hjælper søgemaskiner med at finde og indeksere siderne på dit websted. Det er god praksis at inkludere linket til dit sitemap direkte i din robots.txt-fil, så crawlere nemt kan lokalisere det.
Når du tilføjer et sitemap i dette værktøj, skal URL-adressen være fuldstændig. Det betyder, at den skal starte med enten http:// eller https://. Hvis adressen er ufuldstændig eller forkert formateret, vil værktøjet vise fejlen: "Sitemap-URL'er skal have en fuld http://- eller https://-adresse.".
Googles prioriteringsrækkefølge og stitjek
Når en crawler som Googlebot læser en robots.txt-fil med mange regler, evalueres stierne ud fra en fastlagt prioriteringsrækkefølge. Værktøjets indbyggede stitjekker simulerer denne logik baseret på følgende principper:
- Længste sti vinder: Google prioriterer den regel, der er mest specifik. Det vil sige, at den regel, hvis sti har flest tegn (er længst) og matcher URL'en, vinder.
- Lige specifikke regler: Hvis en matchende
Allow-regel og enDisallow-regel er præcis lige lange og dermed lige specifikke, harAllowforret.
Når du tester en URL-sti i værktøjet, vil resultatet blive vist med en af følgende statusmeddelelser:
- Tilladt —
{rule}: Viser, at stien er åben for crawling, og angiver den specifikke regel, der tillader det. - Blokeret —
{rule}: Viser, at stien er spærret, og angiver den regel, der blokerer adgangen. - Ingen matchende regel. Google tillader denne sti som standard.: Vises, hvis ingen af reglerne i filen matcher den indtastede sti.
Bemærk, at hvis den genererede robots.txt-fil bliver ekstremt omfattende og overstiger 100.000 tegn, vil værktøjet stoppe valideringen og vise beskeden: "Denne robots.txt er for stor til at kunne gennemgås her.".
Begrænsninger ved robots.txt i forhold til indeksering
Det er en udbredt misforståelse, at en blokering i robots.txt garanterer, at en side ikke vises i søgemaskinerne. En robots.txt-fil styrer udelukkende crawling (om crawleren må hente siden), ikke indeksering (om siden må vises i søgeresultaterne).
Hvis andre eksterne eller interne websider linker til en sti, der er blokeret med en Disallow-regel, kan Google stadig indeksere og vise siden i søgeresultaterne. Hvis målet er helt at forhindre, at en side optræder i søgeresultater, skal man i stedet benytte andre metoder:
- Implementering af et
noindex-direktiv i HTML-kodens meta-tags. - Etablering af reel adgangskontrol (for eksempel passwordbeskyttelse på serverniveau).
- At slette siden helt fra webserveren.
Værktøjet foretager ikke kontrol af noindex-tags, adgangskontrol eller om siderne faktisk eksisterer.
Behandling af data og privatliv
Når du arbejder med dine crawl-regler og tester stier, sker hele processen lokalt. Dine crawl-regler oprettes og tjekkes i din browser. Der uploades intet til BroBroGo, hvilket betyder, at dine data forbliver på din egen enhed under hele arbejdet.
Ofte stillede spørgsmål (FAQ)
Hvad kan denne generator tilføje til robots.txt?
Tilføj en user-agent-gruppe, Allow- og Disallow-stier samt en eller flere sitemap-URL'er. Forhåndsvisningen er klar til at blive kopieret over i en robots.txt-fil.
Hvordan vælger stitjekkeren en regel?
Den følger Googles prioriteringsrækkefølge: Den længste matchende sti vinder. Hvis matchende Allow- og Disallow-regler er lige specifikke, vinder Allow.
Fjerner Disallow en side fra Google Søgning?
Nej. En blokeret side kan stadig vises i søgeresultaterne, hvis andre sider linker til den. Brug noindex, adgangskontrol eller slet siden helt, hvis du vil holde den helt ude af søgninger.
Hvad sker der, hvis jeg har den samme regel flere gange?
Værktøjet vil opdage dubletten og markere den med beskeden: "Denne regel er gentaget for den samme user-agent.". Det anbefales at rydde op i reglerne for at holde filen overskuelig og undgå unødig kompleksitet.