Hér er farið yfir hvernig robots.txt skrár starfa, hvernig reglur þeirra eru túlkaðar af leitarvélum og hvernig þetta tól nýtist við gerð og prófun á slíkum reglum.
Tilgangur og virkni robots.txt skráa
Robots.txt er textaskrá sem vistuð er í rót léns til að leiðbeina vefskriðlum, svo sem Googlebot, um hvaða hluta vefsvæðis þeir mega heimsækja. Skráin virkar sem samskiptastaðall þar sem vefstjórar geta skilgreint aðgangsheimildir fyrir mismunandi leitarvélar.
Tólið byrjar sjálfgefið með grunnstillingunni User-agent: * og Disallow: /admin. Þetta þýðir að sjálfgefið er lokað á aðgang allra skriðla að slóðum sem byrja á /admin. Vefstjórar og forritarar nota þessar reglur til að stýra álagi á vefþjóna og koma í veg fyrir að skriðlar eyði auðlindum í að skoða óviðkomandi eða viðkvæmar slóðir.
Skriðreglur og meðhöndlun á User-agent
Í robots.txt skrá eru reglur flokkaðar eftir því hvaða skriðli (User-agent) þær eiga við um. Hægt er að skilgreina reglur fyrir ákveðna skriðla eða nota stjörnu (*) til að láta reglurnar gilda um alla skriðla sem ekki hafa sértækari leiðbeiningar.
Þegar reglur eru settar upp gilda ákveðnar takmarkanir á setningafræði:
- User-agent: Heiti skriðla mega ekki innihalda bil. Ef slegið er inn ógilt heiti birtir tólið villuboðin: "Sláðu inn eitt user-agent nafn án bila, eða notaðu * fyrir alla skriðla."
- Slóðir: Allar regluslóðir verða að byrja á
/og þær mega ekki innihalda bil. Ef þessu er ekki fylgt birtast villuboðin: "Regluslóðir verða að byrja á / og mega ekki innihalda bil." - Sérstök tákn: Tákn eins og
$er eingöngu hægt að nota í enda regluslóðar til að tilgreina að slóðin eigi að enda á ákveðnum karakter. Ef táknið er notað annars staðar birtast villuboðin: "Notaðu $ eingöngu í enda regluslóðar."
Ef sami skriðillinn er nefndur í mörgum hópum í skránni mun Google sameina þá hópa. Tólið greinir þetta og gefur til kynna ábendinguna: "Google sameinar hópa sem nefna sama user-agent."
Samspil Allow og Disallow reglna
Reglur skiptast í tvennt: Allow (Leyfa) og Disallow (Banna). Þegar vefslóðir eru prófaðar geta komið upp aðstæður þar sem bæði leyfisskráning og bannskráning eiga við um sömu slóðina.
Ef sömu slóðir eru notaðar í bæði Allow og Disallow reglum fyrir sama skriðil, flaggar tólið því með ábendingunni: "Allow og Disallow nota sömu slóð. Google beitir Allow þegar báðar reglur eru jafn sértækar." Ef regla er endurtekin nákvæmlega eins fyrir sama skriðil birtast villuboðin: "Þessi regla er endurtekin fyrir sama user-agent."
Forgangsröðun reglna samkvæmt Google
Þegar leitarvélar túlka robots.txt skrá fylgja þær ákveðnum reglum um forgang. Google notar regluna um lengsta samsvarandi slóð (e. longest matching path) til að ákveða hvaða regla gildir. Það þýðir að sú regla sem hefur flesta stafi í slóðalýsingunni og passar við viðkomandi vefslóð mun ávallt vinna, óháð því hvort hún er Allow eða Disallow.
Ef tvær reglur, önnur Allow og hin Disallow, passa jafn vel við slóðina og eru nákvæmlega jafn langar (jafn sértækar), þá hefur Allow reglunni forgang hjá Google.
Mikilvægi veftrjáa
Veftré (Sitemap) hjálpar leitarvélum að finna og skríða allar mikilvægar síður á vefsvæðinu. Það er góð venja að setja slóðina að veftrénu neðst í robots.txt skrána.
Veftrés-vefslóðir verða að vera fullgildar og innihalda samskiptasnið. Þær verða að byrja á fullu http:// eða https:// vistfangi. Ef slóðin er ófullkominn eða röng birtir tólið villuna: "Veftrés-vefslóðir þurfa fullt http:// eða https:// vistfang."
Takmarkanir á robots.txt við vísitöluútgáfu
Það er algengur misskilningur að robots.txt komi í veg fyrir að síður birtist í leitarniðurstöðum. Ef síða er útilokuð með Disallow reglu getur hún samt sem áður birst í leitarniðurstöðum ef aðrar síður á netinu tengja í hana með virkum hlekkjum.
Robots.txt stýrir eingöngu hegðun skriðla en ekki vísitölunni sjálfri. Tólið athugar ekki og getur ekki tryggt vörn gegn vísitölunni með tilliti til:
noindexmerkinga í HTML-kóða- Aðgangsstýringar (e. access control) á vefþjóni
- Fjarlægingar á síðum af vefnum
Til að tryggja að síða birtist alls ekki í leitarniðurstöðum þarf að nota aðrar aðferðir eins og lykilorðavarinn aðgang eða noindex meta-merki á sjálfri síðunni.
Vinnsla og persónuvernd
Öll vinnsla á reglum og prófun á vefslóðum fer fram beint í vafranum þínum. Engin gögn, reglur eða vefslóðir sem slegnar eru inn eru sendar til BroBroGo eða vistaðar á ytri netþjónum.
Ef stærð robots.txt skráarinnar fer yfir 100.000 stafi, mun tólið ekki geta unnið úr henni og birtir villuna: "Þessi robots.txt skrá er of stór til að hægt sé að yfirfara hana hér."
Algengar spurningar
Hverju getur þessi rafall bætt við robots.txt?
Bættu við user-agent hópi, leyfðum (Allow) og bönnuðum (Disallow) slóðum, og einni eða fleiri veftrés-vefslóðum. Forskoðunin er tilbúin til afritunar í robots.txt skrá.
Hvernig velur slóðaprófarinn reglu?
Það fylgir forgangsröðun Google: lengsta samsvarandi slóðin vinnur. Ef samsvarandi Allow og Disallow reglur eru jafn sértækar, þá vinnur Allow.
Fjarlægir Disallow síðu úr Google leit?
Nei. Lokuð síða getur samt birst í leitarniðurstöðum ef aðrar síður tengja í hana. Notaðu noindex, aðgangsstýringu eða fjarlægðu síðuna alveg ef þú vilt tryggja að hún birtist ekki í leit.