Datoteka robots.txt ključan je element tehničke optimizacije za tražilice (SEO) koji upravlja ponašanjem web pretraživača (eng. crawlers) na vašem poslužitelju. Pravilnim konfiguriranjem ovih uputa sprječavate preopterećenje poslužitelja i usmjeravate robote poput Googlebota prema važnom sadržaju. Alat Robots.txt generator i validator omogućuje vam preciznu izradu i trenutnu provjeru pravila izravno u web pregledniku.
Svrha i funkcija robots.txt datoteke
Glavna svrha robots.txt datoteke je davanje uputa automatiziranim pretraživačima o tome koje dijelove web sjedišta smiju, a koje ne smiju posjećivati. Ova se datoteka postavlja u korijenski direktorij web sjedišta.
Važno je razumjeti da robots.txt nije mehanizam za potpunu sigurnost ili skrivanje privatnih podataka. Blokirana stranica i dalje se može pojaviti u rezultatima pretraživanja ako druge stranice upućuju na nju. Alat ne provjerava direktive poput noindex, sustave za kontrolu pristupa (autorizaciju) niti stvarno uklanjanje stranica s mreže. Za potpuno uklanjanje sadržaja iz rezultata pretraživanja ili zaštitu osjetljivih podataka potrebno je koristiti druge metode, poput lozinki ili meta oznaka noindex.
Upravljanje User-agent direktivama
Svaka grupa pravila u robots.txt datoteci mora započeti definiranjem ciljanog pretraživača. Direktiva User-agent određuje na kojeg se bota pravila odnose.
- Univerzalno pravilo: Korištenje znaka
*označava da se pravila odnose na sve pretraživače koji posjećuju stranicu. - Specifični pretraživači: Možete ciljati točno određene botove, kao što je Googlebot.
Pri definiranju naziva pretraživača vrijede stroga sintaktička pravila. Naziv pretraživača ne smije sadržavati razmake. Ako sustav prepozna neispravan unos, prikazat će se upozorenje: "Unesite jedan naziv user-agenta bez razmaka ili koristite * za sve pretraživače.". Također, ako se isti pretraživač navede u više različitih grupa, alat će vas upozoriti porukom "Google spaja grupe koje navode isti user-agent.".
Interakcija između Allow i Disallow pravila
Unutar svake grupe definiraju se dopuštenja i zabrane za određene putanje na poslužitelju:
- Disallow: Blokira pristup određenoj putanji. Zadana konfiguracija u alatu započinje s
User-agent: *iDisallow: /admin. - Allow: Izričito dopušta pristup podputanji unutar direktorija koji je inače blokiran.
Sve putanje pravila moraju počinjati kosom crtom (/) i ne smiju sadržavati razmake. U suprotnom, validator javlja grešku: "Putanje pravila moraju počinjati s / i ne smiju sadržavati razmake.".
Znak $ koristi se za označavanje kraja putanje (npr. za blokiranje specifičnih ekstenzija datoteka) i smije se nalaziti isključivo na samom kraju pravila. Ako se postavi na bilo koje drugo mjesto, validator ispisuje: "Koristite znak $ samo na kraju putanje pravila.".
Sukobi i ponavljanja pravila
Tijekom pisanja pravila može doći do nenamjernih preklapanja:
- Ponavljanje istog pravila: Ako za istog pretraživača napišete identičnu liniju više puta, pojavit će se upozorenje: "Ovo se pravilo ponavlja za isti user-agent.".
- Ista putanja u Allow i Disallow: Ako definirate i dopuštenje i zabranu za identičnu putanju, validator će prikazati poruku: "Allow i Disallow koriste istu putanju. Google primjenjuje Allow kada su oba pravila jednako specifična.".
Važnost URL sitemape-ova
Uključivanje adrese sitemape (karte web sjedišta) u robots.txt pomaže pretraživačima da brže i učinkovitije otkriju sve važne stranice na vašem poslužitelju.
URL sitemape-ovi moraju biti navedeni kao potpune apsolutne adrese. To znači da moraju sadržavati protokol, odnosno imati potpunu http:// ili https:// adresu. Ako unesete relativnu putanju ili nepotpun URL, validator će označiti problem uz poruku: "URL-ovi sitemapa moraju imati potpunu http:// ili https:// adresu.".
Googleov redoslijed podudaranja pravila
Kada pretraživač poput Googlebota analizira vašu robots.txt datoteku kako bi odlučio smije li pristupiti određenoj URL putanji, on primjenjuje strogo definirana pravila prioriteta:
- Najduža putanja pobjeđuje: Google slijedi redoslijed podudaranja prema duljini pravila. Pravilo s najdužim brojem znakova u podudarnoj putanji ima prednost, bez obzira na to radi li se o
AllowiliDisallowdirektivi. - Jednaka specifičnost: Ako se dogodi da se i
AllowiDisallowpravilo podudaraju s traženom putanjom i pritom imaju potpuno jednaku duljinu znakova (jednako su specifična), Google će uvijek dati prednost praviluAllow.
Ograničenja veličine i provjera pravila
Prilikom generiranja datoteke morate paziti na njezinu ukupnu veličinu. Tražilice imaju ograničenja u količini podataka koju će pročitati iz robots.txt datoteke. Ako generirani sadržaj prijeđe granicu od 100.000 znakova, alat će vas upozoriti porukom: "Ovaj robots.txt je prevelik za pregled ovdje.".
Nakon što definirate pravila, modul za testiranje omogućuje vam upisivanje specifične URL putanje i odabir pretraživača kako biste provjerili pristup. Rezultati provjere prikazuju se u sljedećim oblicima:
- Dopušteno —
{rule}: Putanja je prohodna za odabranog bota, a prikazano je i točno pravilo koje to dopušta. - Blokirano —
{rule}: Pristup putanji je onemogućen, uz navođenje pravila koje je uzrokovalo blokadu. - Nema podudarajućeg pravila. Google prema zadanim postavkama dopušta ovu putanju.: Ne postoji pravilo koje se odnosi na upisanu putanju, pa pretraživač slobodno pristupa sadržaju.
Privatnost i lokalna obrada podataka
Vaša privatnost u potpunosti je zaštićena tijekom rada s ovim alatom. Sva pravila pretraživanja stvaraju se i provjeravaju u vašem pregledniku. Podaci se obrađuju lokalno na vašem uređaju i ništa se ne šalje na BroBroGo.
Često postavljana pitanja (FAQ)
Što ovaj generator može dodati u robots.txt?
Dodajte grupu user-agenta, putanje za Allow i Disallow te jedan ili više URL-ova sitemap-a. Pretpretgled je spreman za kopiranje u robots.txt datoteku.
Kako provjera putanje odabire pravilo?
Slijedi Googleov redoslijed podudaranja: pobjeđuje najduža podudarajuća putanja. Ako su podudarajuća pravila Allow i Disallow jednako specifična, pobjeđuje Allow.
Uklanja li Disallow stranicu iz Google pretraživanja?
Ne. Blokirana stranica i dalje se može pojaviti u rezultatima pretraživanja ako druge stranice upućuju na nju. Koristite noindex, kontrolu pristupa ili uklonite stranicu ako želite da se uopće ne prikazuje u pretraživanju.