Svrha i funkcija robots.txt datoteke
Robots.txt je tekstualna datoteka smještena u korijenskom direktoriju web stranice koja služi kao uputstvo za web crawlera (poput Googlebota) o tome kojim dijelovima stranice smiju pristupiti, a koje trebaju zaobići. Ovaj fajl predstavlja prvi korak interakcije između vašeg servera i pretraživača. Pravilnim konfigurisanjem ovih pravila, administratori web stranica i programeri mogu efikasno upravljati prometom botova i spriječiti preopterećenje servera.
Alat Robots.txt generator i validator omogućava kreiranje i provjeru ovih pravila direktno u vašem web pregledniku. Proces obrade podataka je u potpunosti lokalizovan: vaša pravila indeksiranja se kreiraju i provjeravaju u vašem pregledniku, te se ništa ne šalje na BroBroGo.
Razumijevanje User-agent direktiva
Svaki automatizovani sistem koji posjećuje vašu web stranicu identifikuje se putem naziva koji se naziva User-agent. Unutar robots.txt datoteke, direktiva User-agent definiše na kojeg se crawlera odnosi određena grupa pravila.
Prilikom unosa ovih vrijednosti u generator, važno je pridržavati se tehničkih pravila:
- Kao naziv crawlera možete unijeti specifično ime bota ili koristiti znak
*koji predstavlja univerzalno pravilo za sve crawlera. - Nazivi User-agent ne smiju sadržavati razmake. Ako unesete neispravan naziv, sistem će prikazati grešku: "Unesite jedno ime user-agenta bez razmaka ili koristite * za sve crawlera.".
- Zadani početni šablon u alatu postavljen je na
User-agent: *iDisallow: /admin.
Pravila Allow i Disallow i njihova interakcija
Direktive unutar robots.txt datoteke kontrolišu pristup određenim putanjama na serveru. Pravilo Disallow zabranjuje pristup određenoj putanji, dok pravilo Allow eksplicitno dozvoljava pristup unutar prethodno blokiranog direktorija.
Prilikom definisanja ovih pravila moraju se poštovati stroga sintaksna pravila:
- Sve putanje pravila moraju početi sa
/i ne smiju sadržavati razmake. U suprotnom, validator prikazuje upozorenje: "Putanje pravila moraju početi sa / i ne smiju sadržavati razmake.". - Znak
$se koristi isključivo za označavanje kraja putanje (npr. za blokiranje specifičnih ekstenzija datoteka). Ako se postavi na bilo koje drugo mjesto, validator javlja grešku: "Koristite znak $ samo na kraju putanje pravila.".
Konflikti i dupliranja pravila
Tokom pisanja pravila mogu se javiti logički konflikti koje validator automatski prepoznaje:
- Ponavljanje pravila: Ako se isto pravilo definiše više puta unutar iste grupe, validator prikazuje poruku: "Ovo pravilo se ponavlja za isti user-agent.".
- Iste putanje za Allow i Disallow: Ako oba pravila koriste identičnu putanju, validator izdaje upozorenje: "Pravila Allow i Disallow koriste istu putanju. Google primjenjuje Allow kada su oba pravila jednako specifična.".
- Višestruke grupe za istog bota: Ako se isti crawler navede u više odvojenih grupa, validator upozorava: "Google kombinuje grupe koje imenuju isti user-agent.".
Važnost sitemap URL-ova u robots.txt datoteci
Sitemap (mapa sajta) je XML datoteka koja sadrži popis svih važnih stranica na vašem sajtu, pomažući pretraživačima da brže i efikasnije indeksiraju sadržaj. Uključivanje lokacije mape sajta unutar robots.txt datoteke je standardna praksa koja crawlerima odmah daje do znanja gdje se mapa nalazi.
Prilikom unosa sitemapa u generatoru, adresa mora biti potpuna. To znači da mora sadržavati protokol http:// ili https://. Ako unesete nepotpunu adresu, validator će prikazati grešku: "URL-ovi mapa sajta moraju sadržavati potpunu http:// ili https:// adresu.".
Kako Google određuje prioritet pravila (Matching Order)
Kada Googlebot analizira robots.txt datoteku kako bi odlučio da li smije pristupiti određenoj URL putanji, on koristi specifičan redoslijed podudaranja (matching order):
- Pravilo najduže putanje: Google uvijek daje prednost pravilu čija je putanja najduža i najpreciznija (pravilo s najvećim brojem karaktera koje se podudara s testiranim URL-om).
- Jednaka specifičnost: Ako se i
AllowiDisallowpravilo podudaraju u potpunosti i imaju identičnu dužinu karaktera, praviloAllowodnosi pobjedu.
Prilikom testiranja putanja u validatoru, alat će prikazati tačan ishod na osnovu ovih pravila:
- Ako je pristup dozvoljen, prikazuje se poruka: "Dozvoljeno —
{rule}". - Ako je pristup blokiran, prikazuje se poruka: "Blokirano —
{rule}". - Ako nijedno pravilo ne odgovara testiranoj putanji, prikazuje se poruka: "Nema podudarajućeg pravila. Google podrazumijevano dozvoljava ovu putanju.".
Ograničenja robots.txt datoteke u kontroli indeksiranja
Česta zabluda je da robots.txt služi za potpuno uklanjanje stranica iz rezultata pretrage. Robots.txt kontroliše isključivo puzanje (crawling), odnosno pristup botova serveru, a ne indeksiranje (indexing).
Ako je stranica blokirana putem pravila Disallow, Googlebot je neće posjetiti. Međutim, ako drugi sajtovi na internetu imaju linkove koji vode ka toj blokiranoj stranici, Google je i dalje može indeksirati i prikazati u rezultatima pretrage. Za potpuno isključivanje stranice iz rezultata pretrage, robots.txt nije dovoljan. U tim slučajevima moraju se koristiti druge metode koje ovaj alat ne provjerava, kao što su noindex meta oznake, autentifikacija (kontrola pristupa) ili trajno uklanjanje stranice sa servera.
Također, alat ima tehničko ograničenje veličine datoteke. Ako generisani robots.txt pređe veličinu od 100.000 karaktera, validator će prikazati poruku: "Ovaj robots.txt je prevelik za pregled ovdje.".
Često postavljana pitanja (FAQ)
Šta ovaj generator može dodati u robots.txt?
Dodajte grupu user-agent, putanje za Allow i Disallow, te jedan ili više URL-ova mapa sajta. Pregled je spreman za kopiranje u robots.txt datoteku.
Kako alat za provjeru putanje bira pravilo?
Prati se Googleov redoslijed podudaranja: najduža podudarajuća putanja pobjeđuje. Ako su podudarajuća pravila Allow i Disallow jednako specifična, pobjeđuje Allow.
Da li pravilo Disallow uklanja stranicu s Google pretrage?
Ne. Blokirana stranica se i dalje može pojaviti u rezultatima pretrage ako drugi sajtovi upućuju na nju. Koristite noindex, kontrolu pristupa ili uklonite stranicu ako želite da je potpuno isključite iz pretrage.
Gdje se obrađuju moji podaci prilikom generisanja i provjere?
Vaša pravila indeksiranja se kreiraju i provjeravaju u vašem pregledniku. Ništa se ne šalje na BroBroGo, što osigurava lokalnu obradu podataka na vašem uređaju.