Robots.txt Generator & Validator

Bouw crawl-regels en controleer tot welke paden Googlebot toegang heeft.

Crawl-regels

Begin met de crawler die deze regels moet volgen.

Sitemaps

Gegenereerde robots.txt

0
robots.txt
Gereed. Het voorbeeld blokkeert /admin voor alle crawlers.

Regelcontrole

    Test een pad

    Je crawl-regels worden in je browser gemaakt en gecontroleerd. Er wordt niets geüpload naar BroBroGo.

    Veelgestelde vragen

    Wat kan deze generator toevoegen aan robots.txt?

    Voeg een user-agent-groep, Allow- en Disallow-paden en een of meer sitemap-URL's toe. De weergave is direct klaar om te kopiëren naar een robots.txt-bestand.

    Hoe kiest de pad-controlefunctie een regel?

    Het volgt de matching-volgorde van Google: het langste overeenkomende pad wint. Als de regels voor Allow en Disallow even specifiek zijn, wint Allow.

    Verwijdert Disallow een pagina uit Google Zoeken?

    Nee. Een uitgesloten pagina kan nog steeds in de zoekresultaten verschijnen als andere pagina's ernaar linken. Gebruik noindex, toegangsbeheer of verwijder de pagina als je deze absoluut buiten de zoekresultaten wilt houden.

    De werking en het doel van een robots.txt-bestand

    Een robots.txt-bestand is een tekstbestand dat in de hoofdmap van een website wordt geplaatst om webcrawlers, zoals Googlebot, te instrueren welke delen van de site zij wel of niet mogen bezoeken. Met de Robots.txt Generator & Validator kunt u deze crawl-regels nauwkeurig opbouwen en direct controleren of specifieke paden toegankelijk zijn voor verschillende crawlers.

    Het bestand werkt op basis van vrijwillige medewerking van zoekmachines. Hoewel betrouwbare crawlers zich aan de instructies houden, is het belangrijk te begrijpen dat een robots.txt-bestand geen beveiligingsmiddel is. De tool controleert dan ook niet op noindex-tags, toegangsbeheer (zoals wachtwoordbeveiliging) of de daadwerkelijke verwijdering van pagina's.

    User-agent directives en crawler-gedrag

    Crawl-regels worden altijd gegroepeerd per crawler, aangeduid met de User-agent. U kunt specifieke crawlers targeten door hun exacte naam op te geven, of de asterisk * gebruiken als wildcard om de regels op alle crawlers toe te passen.

    Bij het configureren van user-agents gelden strikte syntactische regels:

    • Geen spaties: Een user-agent-naam mag geen spaties bevatten. Als dit wel gebeurt, toont de validator de foutmelding: "Voer één user-agent-naam in zonder spaties, of gebruik * voor alle crawlers."
    • Standaardinstelling: De generator start automatisch met een vooraf ingestelde basisconfiguratie: User-agent: * in combinatie met Disallow: /admin.
    • Groepering: Als dezelfde user-agent in meerdere afzonderlijke groepen wordt genoemd, activeert de validator de waarschuwing: "Google combineert groepen die dezelfde user-agent noemen."

    Interactie tussen Allow- en Disallow-regels

    Binnen een user-agent-groep bepalen de instructies Allow (Toestaan) en Disallow (Uitsluiten) de toegang tot specifieke mappen of bestanden.

    Pad-specificaties en restricties

    Elk regelpad moet verplicht beginnen met een schuine streep / en mag geen spaties bevatten. Indien een pad niet aan deze eisen voldoet, geeft de tool de foutmelding: "Regelpaden moeten beginnen met / en mogen geen spaties bevatten."

    Het dollarteken $ kan worden gebruikt om het einde van een pad te markeren (bijvoorbeeld om specifieke bestandsextensies te blokkeren). Dit teken is echter aan restricties gebonden: "Gebruik $ alleen aan het einde van een regelpad."

    Conflicten en herhalingen

    De validator controleert de ingevoerde regels continu op logische fouten en redundantie:

    • Dubbele regels: Als exact dezelfde regel meerdere keren voor een user-agent wordt gedefinieerd, meldt de tool: "Deze regel is herhaald voor dezelfde user-agent."
    • Gelijke paden: Wanneer een Allow- en een Disallow-regel naar exact hetzelfde pad verwijzen, toont de validator de waarschuwing: "Allow en Disallow gebruiken hetzelfde pad. Google past Allow toe als beide even specifiek zijn."

    Prioriteitsbepaling volgens de regels van Google

    Wanneer een crawler een website bezoekt, evalueert deze de robots.txt-regels om te bepalen of een specifiek URL-pad toegankelijk is. De validator simuleert dit proces exact volgens de matching-volgorde die Google hanteert:

    1. Langste match wint: De prioriteit van een regel wordt bepaald door de lengte van het overeenkomende pad. Het meest specifieke (langste) pad dat overeenkomt met de opgevraagde URL heeft altijd voorrang, ongeacht of dit een Allow of Disallow is.
    2. Gelijke lengte: Als een overeenkomende Allow-regel en een Disallow-regel exact evenveel tekens bevatten, wint de Allow-regel.

    Bij het testen van een URL-pad via de ingebouwde tester geeft de tool een van de volgende resultaten weer:

    • Toegestaan — {rule}: Het geteste pad is toegankelijk op basis van de genoemde regel.
    • Geblokkeerd — {rule}: De toegang tot het pad is beperkt door de genoemde regel.
    • Geen overeenkomende regel. Google staat dit pad standaard toe.: Er is geen specifieke regel gevonden die op het pad van toepassing is, waardoor de crawler vrije toegang heeft.

    Sitemaps in robots.txt

    Het opnemen van sitemaps in het robots.txt-bestand helpt zoekmachines om de structuur van uw website sneller te begrijpen en efficiënter te indexeren. Sitemaps staan los van specifieke user-agent-groepen en gelden voor de gehele site.

    De validator stelt strenge eisen aan de invoer van sitemaps:

    • De sitemap moet worden opgegeven als een volledige URL, beginnend met het protocol.
    • Indien de URL incompleet is, verschijnt de foutmelding: "Sitemap-URL's vereisen een volledig http:// of https:// adres."

    Technische limieten en privacy

    Bij het genereren en valideren van grote robots.txt-bestanden moet rekening worden gehouden met de bestandsgrootte. Als het gegenereerde bestand de grens van 100.000 tekens overschrijdt, stopt de controle en verschijnt de melding: "Deze robots.txt is te groot om hier te controleren."

    Lokale verwerking

    Wat betreft gegevensverwerking werkt de tool volledig lokaal. Je crawl-regels worden in je browser gemaakt en gecontroleerd. Er wordt niets geüpload naar BroBroGo. Dit zorgt ervoor dat u configuraties kunt ontwerpen en testen zonder dat uw websitestructuur of conceptregels met externe servers worden gedeeld.


    Veelgestelde vragen

    Wat kan deze generator toevoegen aan robots.txt?

    Voeg een user-agent-groep, Allow- en Disallow-paden en een of meer sitemap-URL's toe. De weergave is direct klaar om te kopiëren naar een robots.txt-bestand.

    Hoe kiest de pad-controlefunctie een regel?

    Het volgt de matching-volgorde van Google: het langste overeenkomende pad wint. Als de regels voor Allow en Disallow even specifiek zijn, wint Allow.

    Verwijdert Disallow een pagina uit Google Zoeken?

    Nee. Een uitgesloten pagina kan nog steeds in de zoekresultaten verschijnen als andere pagina's ernaar linken. Gebruik noindex, toegangsbeheer of verwijder de pagina als je deze absoluut buiten de zoekresultaten wilt houden.

    Wat gebeurt er als ik een regel herhaal voor dezelfde crawler?

    De validator herkent deze redundantie en markeert dit met de melding: "Deze regel is herhaald voor dezelfde user-agent." Het is raadzaam om dubbele regels te verwijderen om het bestand overzichtelijk en compact te houden.