Robots.txt генератор и валидатор

Направите правила за пузање и проверите којим путањама Googlebot може да приступи.

Правила за пузање

Почните са веб-пауком који треба да прати ова правила.

Мапе сајта

Генерисани robots.txt

0
robots.txt
Спремно. Пример блокира /admin за све веб-паукове.

Провера правила

    Тестирајте путању

    Ваша правила за пузање се креирају и проверавају у вашем прегледачу. Ништа се не шаље на BroBroGo.

    Честа питања

    Шта овај генератор може да дода у robots.txt?

    Додајте групу корисничких агената, путање за Allow и Disallow, као и једну или више URL адреса мапа сајта. Преглед је спреман за копирање у датотеку robots.txt.

    Како алат за проверу путање бира правило?

    Прати се Google-ов редослед подударања: побеђује најдужа подударна путања. Ако су подударна правила Allow и Disallow подједнако специфична, предност има Allow.

    Да ли Disallow уклања страницу из Google претраге?

    Не. Блокирана страница се и даље може појавити у резултатима претраге ако друге странице упућују линкове ка њој. Користите noindex ознаку, контролу приступа или уклоните страницу ако желите да је потпуно искључите из претраге.

    Сврха и функција robots.txt датотеке

    Датотека robots.txt је текстуални документ који се поставља у корени директоријум веб-сајта како би управљао понашањем веб-паукова (цравлера). Овај алат помаже веб-администраторима и програмерима да креирају и провере правила која веб-паукови, као што је Googlebot, треба да прате приликом посете сајту. Помоћу њега можете изградити датотеку додавањем различитих правила за појединачне веб-паукове, а затим тестирати одређене путање како бисте утврдили да ли је приступ дозвољен или блокиран.

    Употреба овог алата је намењена одржаваоцима веб-сајтова који желе да контролишу приступ веб-паукова, програмерима који креирају или мењају robots.txt датотеке, као и свима који желе да спрече приступ одређеним деловима сајта или осигурају да важне странице нису случајно блокиране.

    Управљање директивама User-agent и правилима приступа

    Свака robots.txt датотека користи директиве како би дефинисала који веб-паук мора да поштује одређена ограничења. Главни улазни подаци за креирање ових правила су:

    • Кориснички агент (User-agent): Име веб-паука на ког се правило односи, или знак * који представља универзално правило за све веб-паукове. Име корисничког агента не сме да садржи размаке. Ако се унесе неисправно име, алат приказује упозорење: „Унесите једно име корисничког агента без размака, или користите * за све веб-паукове.“.
    • Путања: Локација на веб-сајту која мора почињати косом цртом /. Путање правила не смеју садржати размаке, а карактер $ се може користити искључиво на самом крају путање. У случају грешке, алат исписује упозорења: „Путање правила морају почињати са / и не смеју садржати размаке.“ или „Користите $ само на крају путање правила.“.

    Алат почиње са подразумеваним подешавањем где је уписано User-agent: * и Disallow: /admin. Корисник може дефинисати правила типа Дозволи (Allow) и Забрани (Disallow) за сваку групу.

    Интеракција између Allow и Disallow правила и мапе сајта

    Приликом писања правила често долази до преклапања директива. Алат анализира унете податке и идентификује следеће конфликте и специфичности:

    • Поновљена правила: Ако се исто правило понови унутар исте групе корисничког агента, алат ће приказати упозорење: „Ово правило је поновљено за истог корисничког агента.“.
    • Исте путање за Allow и Disallow: Када обе директиве користе идентичну путању, активира се упозорење: „Allow и Disallow користе исту путању. Google примењује Allow када су оба правила подједнако специфична.“.
    • Вишеструке групе за истог агента: Ако се исти веб-паук наведе у неколико различитих група, алат упозорава: „Google спаја групе које именују истог корисничког агента.“.

    Поред правила приступа, важан сегмент robots.txt датотеке је URL адреса мапе сајта (Sitemap). Она помаже веб-пауковима да лакше пронађу и индексирају садржај. Свака унета адреса мора бити потпуна и садржати http:// или https:// протокол. У супротном, алат пријављује грешку: „URL адресе мапа сајта захтевају потпуну http:// или https:// адресу.“.

    Google-ов редослед подударања и ограничења датотеке

    Када веб-паук анализира robots.txt датотеку, он примењује специфичан редослед приоритета. Приликом провере путања, овај алат прати Google-ова званична правила подударања:

    1. Најдужа путања побеђује: Предност увек има оно правило чија је путања најдужа и најпрецизније се подудара са тестираним URL-ом.
    2. Једнака специфичност: Ако се деси да су подударна правила Allow и Disallow потпуно једнаке дужине и специфичности, правило Allow има предност и приступ ће бити дозвољен.

    Постоје и физичка ограничења која треба узети у обзир. Ако генерисани садржај пређе величину од 100.000 карактера, алат ће приказати упозорење: „Ова датотека robots.txt је превелика за преглед на овој страници.“.

    Такође, важно је разумети лимите саме robots.txt датотеке у погледу индексирања. Директива Disallow спречава веб-паукове да пузе по страници, али то не гарантује њено уклањање из претраге. Блокирана страница се и даље може појавити у резултатима претраге ако друге странице упућују линкове ка њој. Овај алат не врши проверу за noindex ознаке, системе контроле приступа (аутентификацију) или трајно уклањање страница са сервера.

    Локална обрада података и сигурност

    Приватност корисника је у потпуности заштићена начином на који алат ради. Сва ваша правила за пузање се креирају и проверавају у вашем прегледачу. Ништа се не шаље на BroBroGo. То омогућава брзу валидацију без преноса података преко мреже.

    Често постављана питања (FAQ)

    Шта овај генератор може да дода у robots.txt?

    Додајте групу корисничких агената, путање за Allow и Disallow, као и једну или више URL адреса мапа сајта. Преглед је спреман за копирање у датотеку robots.txt.

    Како алат за проверу путање бира правило?

    Прати се Google-ов редослед подударања: побеђује најдужа подударна путања. Ако су подударна правила Allow и Disallow подједнако специфична, предност има Allow.

    Да ли Disallow уклања страницу из Google претраге?

    Не. Блокирана страница се и даље може појавити у резултатима претраге ако друге странице упућују линкове ка њој. Користите noindex ознаку, контролу приступа или уклоните страницу ако желите да је потпуно искључите из претраге.