Сврха и функција robots.txt датотеке
Датотека robots.txt је текстуални документ који се поставља у корени директоријум веб-сајта како би управљао понашањем веб-паукова (цравлера). Овај алат помаже веб-администраторима и програмерима да креирају и провере правила која веб-паукови, као што је Googlebot, треба да прате приликом посете сајту. Помоћу њега можете изградити датотеку додавањем различитих правила за појединачне веб-паукове, а затим тестирати одређене путање како бисте утврдили да ли је приступ дозвољен или блокиран.
Употреба овог алата је намењена одржаваоцима веб-сајтова који желе да контролишу приступ веб-паукова, програмерима који креирају или мењају robots.txt датотеке, као и свима који желе да спрече приступ одређеним деловима сајта или осигурају да важне странице нису случајно блокиране.
Управљање директивама User-agent и правилима приступа
Свака robots.txt датотека користи директиве како би дефинисала који веб-паук мора да поштује одређена ограничења. Главни улазни подаци за креирање ових правила су:
- Кориснички агент (User-agent): Име веб-паука на ког се правило односи, или знак
*који представља универзално правило за све веб-паукове. Име корисничког агента не сме да садржи размаке. Ако се унесе неисправно име, алат приказује упозорење: „Унесите једно име корисничког агента без размака, или користите * за све веб-паукове.“. - Путања: Локација на веб-сајту која мора почињати косом цртом
/. Путање правила не смеју садржати размаке, а карактер$се може користити искључиво на самом крају путање. У случају грешке, алат исписује упозорења: „Путање правила морају почињати са / и не смеју садржати размаке.“ или „Користите $ само на крају путање правила.“.
Алат почиње са подразумеваним подешавањем где је уписано User-agent: * и Disallow: /admin. Корисник може дефинисати правила типа Дозволи (Allow) и Забрани (Disallow) за сваку групу.
Интеракција између Allow и Disallow правила и мапе сајта
Приликом писања правила често долази до преклапања директива. Алат анализира унете податке и идентификује следеће конфликте и специфичности:
- Поновљена правила: Ако се исто правило понови унутар исте групе корисничког агента, алат ће приказати упозорење: „Ово правило је поновљено за истог корисничког агента.“.
- Исте путање за Allow и Disallow: Када обе директиве користе идентичну путању, активира се упозорење: „Allow и Disallow користе исту путању. Google примењује Allow када су оба правила подједнако специфична.“.
- Вишеструке групе за истог агента: Ако се исти веб-паук наведе у неколико различитих група, алат упозорава: „Google спаја групе које именују истог корисничког агента.“.
Поред правила приступа, важан сегмент robots.txt датотеке је URL адреса мапе сајта (Sitemap). Она помаже веб-пауковима да лакше пронађу и индексирају садржај. Свака унета адреса мора бити потпуна и садржати http:// или https:// протокол. У супротном, алат пријављује грешку: „URL адресе мапа сајта захтевају потпуну http:// или https:// адресу.“.
Google-ов редослед подударања и ограничења датотеке
Када веб-паук анализира robots.txt датотеку, он примењује специфичан редослед приоритета. Приликом провере путања, овај алат прати Google-ова званична правила подударања:
- Најдужа путања побеђује: Предност увек има оно правило чија је путања најдужа и најпрецизније се подудара са тестираним URL-ом.
- Једнака специфичност: Ако се деси да су подударна правила Allow и Disallow потпуно једнаке дужине и специфичности, правило Allow има предност и приступ ће бити дозвољен.
Постоје и физичка ограничења која треба узети у обзир. Ако генерисани садржај пређе величину од 100.000 карактера, алат ће приказати упозорење: „Ова датотека robots.txt је превелика за преглед на овој страници.“.
Такође, важно је разумети лимите саме robots.txt датотеке у погледу индексирања. Директива Disallow спречава веб-паукове да пузе по страници, али то не гарантује њено уклањање из претраге. Блокирана страница се и даље може појавити у резултатима претраге ако друге странице упућују линкове ка њој. Овај алат не врши проверу за noindex ознаке, системе контроле приступа (аутентификацију) или трајно уклањање страница са сервера.
Локална обрада података и сигурност
Приватност корисника је у потпуности заштићена начином на који алат ради. Сва ваша правила за пузање се креирају и проверавају у вашем прегледачу. Ништа се не шаље на BroBroGo. То омогућава брзу валидацију без преноса података преко мреже.
Често постављана питања (FAQ)
Шта овај генератор може да дода у robots.txt?
Додајте групу корисничких агената, путање за Allow и Disallow, као и једну или више URL адреса мапа сајта. Преглед је спреман за копирање у датотеку robots.txt.
Како алат за проверу путање бира правило?
Прати се Google-ов редослед подударања: побеђује најдужа подударна путања. Ако су подударна правила Allow и Disallow подједнако специфична, предност има Allow.
Да ли Disallow уклања страницу из Google претраге?
Не. Блокирана страница се и даље може појавити у резултатима претраге ако друге странице упућују линкове ка њој. Користите noindex ознаку, контролу приступа или уклоните страницу ако желите да је потпуно искључите из претраге.