Robots.txt generaator ja valideerija

Koostage roomamisreegleid ja kontrollige, millistele teekondadele on Googlebotil juurdepääs.

Roomamisreeglid

Alustage otsingurobotist, mis peaks neid reegleid järgima.

Saidikaardid

Loodud robots.txt

0
robots.txt
Valmis. Näidis blokeerib teekonna /admin kõigi otsingurobotite jaoks.

Reeglite kontroll

    Testi teekonda

    Teie roomamisreeglid luuakse ja kontrollitakse teie brauseris. BroBroGo serverisse midagi üles ei laadita.

    KKK

    Mida saab selle generaatoriga robots.txt faili lisada?

    Saate lisada otsinguroboti grupi, lubatud (Allow) ja keelatud (Disallow) teekonnad ning ühe või mitu saidikaardi (sitemap) URL-i. Eelvaade on valmis kopeerimiseks robots.txt faili.

    Kuidas teekonnakontrollija reegli valib?

    See järgib Google'i vaste järjekorda: pikim kattuv teekond võidab. Kui kattuvad Allow ja Disallow reeglid on võrdselt spetsiifilised, võidab Allow.

    Kas Disallow eemaldab lehe Google'i otsingust?

    Ei. Blokeeritud leht võib siiski otsingutulemustes ilmuda, kui teised lehed sellele viitavad. Kui soovite lehte kindlalt otsingutulemustest eemal hoida, kasutage noindex-silti, juurdepääsupiiranguid või eemaldage leht täielikult.

    Robots.txt faili eesmärk ja toimimine

    Robots.txt on tekstifail, mis asub veebisaidi juurkataloogis ja annab otsingumootorite roomajatele (näiteks Googlebot) juhiseid selle kohta, millistele lehtedele või kataloogidele nad tohivad siseneda ja millistele mitte. See fail on esmane tööriist veebisaidi roomamiskoormuse haldamiseks ja serveri ressursside säästmiseks.

    Tööriist "Robots.txt generaator ja valideerija" võimaldab luua ja kontrollida reegleid otse veebibrauseris. See aitab veebisaitide haldajatel, arendajatel ja kõigil, kes soovivad piirata otsingurobotite juurdepääsu saidi teatud osadele, koostada korrektse süntaksiga faili ning veenduda, et olulised lehed ei oleks kogemata blokeeritud.

    User-agent direktiivid ja otsingurobotite käitumine

    Robots.txt faili reeglid grupeeritakse konkreetsete otsingurobotite ehk User-agentide kaupa. Iga grupp algab reaga, mis määratleb sihtroboti, ning sellele järgnevad reeglid, mis kehtivad just sellele robotile.

    • Kõik otsingurobotid: Kasutades sümbolit * (näiteks User-agent: *), kehtestatakse reeglid universaalselt kõikidele veebisaiti külastavatele roomajatele.
    • Konkreetsed robotid: Reegleid saab suunata ka spetsiifilistele robotitele, sisestades nende täpse nime (näiteks Googlebot).

    Tööriist alustab vaikimisi reeglitega User-agent: * ja Disallow: /admin. Sisestamisel kehtib piirang, et otsinguroboti nimed ei tohi sisaldada tühikuid. Kui sisestatud nimi on vigane, kuvatakse hoiatus: "Sisestage üks otsinguroboti nimi ilma tühikuteta või kasutage sümbolit * kõigi robotite jaoks.".

    Reeglite tüübid: Allow ja Disallow

    Otsingurobotite käitumist juhitakse kahe peamise direktiiviga:

    • Disallow (Keela): Määratleb teekonnad, kuhu otsingurobotil on keelatud siseneda.
    • Allow (Luba): Määratleb teekonnad, kuhu roomamine on lubatud, mis on eriti kasulik siis, kui on vaja lubada juurdepääs mõnele alamkataloogile või failile, mis asub muidu blokeeritud kataloogis.

    Kõik reeglite teekonnad peavad algama sümboliga / ega tohi sisaldada tühikuid. Vastasel juhul kuvatakse veateade: "Reegli teekonnad peavad algama sümboliga / ega tohi sisaldada tühikuid.".

    Märgiga $ saab tähistada teekonna lõppu, et reegel ühtiks täpselt määratud lõpuga. Seda sümbolit tohib kasutada ainult reegli teekonna lõpus. Kui seda reeglit rikutakse, kuvatakse hoiatus: "Kasutage sümbolit $ ainult reegli teekonna lõpus.".

    Google'i reeglite prioriteetsus ja vaste järjekord

    Erinevad otsingumootorid võivad tõlgendada robots.txt faili reegleid veidi erinevalt. Tööriist järgib oma valideerimises ja teekondade testimises Google'i ametlikku reeglite sobitamise järjekorda:

    1. Pikima vaste eelistus: Google valib reegli, mille teekond on kõige pikem ja täpsem (longest matching path wins). Reegli kirjutamise järjekord failis ei oma tähtsust, otsustavaks saab tähemärkide arv teekonnas.
    2. Võrdse pikkuse konflikt: Kui kattuvad Allow ja Disallow reeglid on võrdselt spetsiifilised (sama pikkusega), eelistab Google alati lubavat reeglit (Allow wins).

    Kui testitava teekonnaga ei kattu ükski reegel, kuvatakse tulemus: "Kattuvat reeglit pole. Google lubab seda teekonda vaikimisi.".

    Vigade ja konfliktide tuvastamine

    Tööriist kontrollib reegleid reaalajas ja toob välja järgmised süntaksi- ning loogikavead:

    Probleem Kuvatakse hoiatus / teade Mõju ja käitumine
    Korduv reegel "Seda reeglit korratakse sama otsinguroboti jaoks." Sama reegel on kirjutatud ühe User-agent grupi alla mitu korda.
    Sama teekond lubatud ja keelatud "Lubamise (Allow) ja keelamise (Disallow) reeglid kasutavad sama teekonda. Google rakendab lubavat reeglit, kui mõlemad on võrdselt spetsiifilised." Tekib konflikt, kus sama pikkusega teekond on korraga nii lubatud kui keelatud. Google eelistab lubamist.
    Korduv User-agent "Google koondab grupid, mis nimetavad sama otsingurobotit (user-agent)." Sama robot on määratletud failis mitmes erinevas kohas. Google liidab need grupid üheks.
    Vigane sitemap "Saidikaardi URL-id vajavad täielikku http:// või https:// aadressi." Saidikaardi aadress on vigane või puudulik.
    Liiga suur fail "See robots.txt on siin ülevaatamiseks liiga suur." Faili maht ületab 100 000 tähemärki, mis on limiidiks selle tööriistaga kontrollimisel.

    Kui failis puuduvad vead, kuvatakse teade "Sünktaksi- ega reeglite konflikte ei leitud.". Vigade olemasolul näidatakse täpset arvu: "Ülevaatamist vajab {count} kirje(t).".

    Saidikaardi (Sitemap) lisamine

    Saidikaardi (Sitemap) URL-i lisamine robots.txt faili on parim praktika, mis aitab otsingumootoritel kiiremini üles leida kõik veebisaidi olulised leheküljed. Erinevalt User-agent reeglitest on sitemap sõltumatu direktiiv ja see kirjutatakse tavaliselt faili lõppu.

    Saidikaardi lisamisel tuleb alati kasutada täielikku URL-i, mis algab protokolliga http:// või https://.

    Robots.txt piirangud indekseerimise tõkestamisel

    On kriitiliselt tähtis mõista robots.txt faili piiranguid. Robots.txt reguleerib ainult roomamist (crawling), mitte indekseerimist (indexing).

    Kui leht on robots.txt failis keelatud (Disallow), ei külasta otsingurobot seda lehte otse. Kuid see leht võib siiski ilmuda Google'i otsingutulemustes, kui mõni teine veebileht või väline sait sellele lingib.

    Tööriist ei kontrolli järgmisi elemente:

    • noindex meta-silte lehe HTML-koodis.
    • Serveripoolseid juurdepääsupiiranguid (access control).
    • Lehtede täielikku eemaldamist otsingumootoritest.

    Kui soovite lehte kindlalt otsingutulemustest eemal hoida, tuleb kasutada noindex-silti, juurdepääsupiiranguid või eemaldada leht täielikult.

    Privaatsus ja andmetöötlus

    Selle tööriista kasutamisel on tagatud andmete privaatsus. Teie roomamisreeglid luuakse ja kontrollitakse teie brauseris. BroBroGo serverisse midagi üles ei laadita, mis tähendab, et sisestatud andmed ja reeglid ei lahku kunagi teie seadmest.


    Korduma kippuvad küsimused

    Mida saab selle generaatoriga robots.txt faili lisada?

    Saate lisada otsinguroboti grupi, lubatud (Allow) ja keelatud (Disallow) teekonnad ning ühe või mitu saidikaardi (sitemap) URL-i. Eelvaade on valmis kopeerimiseks robots.txt faili.

    Kuidas teekonnakontrollija reegli valib?

    See järgib Google'i vaste järjekorda: pikim kattuv teekond võidab. Kui kattuvad Allow ja Disallow reeglid on võrdselt spetsiifilised, võidab Allow.

    Kas Disallow eemaldab lehe Google'i otsingust?

    Ei. Blokeeritud leht võib siiski otsingutulemustes ilmuda, kui teised lehed sellele viitavad. Kui soovite lehte kindlalt otsingutulemustest eemal hoida, kasutage noindex-silti, juurdepääsupiiranguid või eemaldage leht täielikult.

    Mis juhtub, kui mul on sama User-agent kirjas mitmes kohas?

    Google koondab grupid, mis nimetavad sama otsingurobotit (user-agent), ning käsitleb neid ühe ühise reeglistikuna. Tööriist märgib sellise olukorra hoiatusega, et saaksite faili puhtana hoida.