Цел и функција на датотеката robots.txt
Датотеката robots.txt е текстуална датотека која се поставува во коренот на веб-страницата за да им укаже на роботите за пребарување (crawler) кои делови од сајтот смеат, а кои не смеат да ги посетуваат. Оваа датотека претставува прва точка на контакт кога пребарувачите како Googlebot го посетуваат вашиот домен.
Главната улога на robots.txt е управување со сообраќајот на роботите за да се спречи преоптоварување на серверот со непотребни барања. Таа е неопходна за развивачи на софтвер, администратори и сопственици на веб-страници кои сакаат да го контролираат пристапот до специфични директориуми, да заштитат ресурси или да спречат скенирање на неважни страници.
Управување со директивите за User-agent
Секоја група правила во robots.txt започнува со дефинирање на корисничкиот агент (User-agent) на кој се однесуваат ограничувањата. Корисничкиот агент го претставува името на специфичниот робот за пребарување.
- Специфични роботи: Можете да дефинирате правила за конкретни роботи, како што е Googlebot. Името на корисничкиот агент не смее да содржи празни места. Доколку внесете празно место, алатката ќе ја прикаже грешката: „Внесете едно име на user-agent без празни места, или користете * за сите роботи.“.
- Глобално правило: Знакот
*се користи како заменски симбол кој ги опфаќа сите роботи за пребарување кои немаат посебно дефинирана група правила во датотеката. - Повторување на агенти: Доколку истиот кориснички агент е именуван во повеќе различни групи во датотеката, се појавува предупредувањето: „Google ги комбинира групите што го именуваат истиот user-agent.“.
Правила за дозвола и забрана: Allow и Disallow
Интеракцијата помеѓу директивите Allow и Disallow го одредува однесувањето на роботите при пристап до патеките на вашата веб-страница.
- Disallow: Оваа директива му кажува на роботот кои патеки не смее да ги посетува. Алатката започнува со стандардно поставено правило
User-agent: *иDisallow: /admin. - Allow: Оваа директива се користи за да се дозволи пристап до одредена потпатека која се наоѓа во рамките на претходно блокиран директориум.
- Синтакса на патеките: Сите патеки на правилата мора да започнуваат со знакот
/и не смеат да содржат празни места. Во спротивно, се активира грешката: „Патеките на правилата мора да започнуваат со / и не смеат да содржат празни места.“. - Крај на патека: Знакот
$се користи за да се означи точниот крај на патеката. Овој знак може да се користи исклучиво на крајот од патеката на правилото. Доколку се постави на друга позиција, се појавува грешката: „Користете го знакот $ само на крајот од патеката на правилото.“.
Конфликти и дуплирање на правила
При креирање на правилата, може да настанат конфликти кои влијаат на правилното толкување на датотеката:
- Идентични правила: Ако едно исто правило се повтори за ист кориснички агент, алатката го означува со предупредувањето: „Ова правило се повторува за истиот user-agent.“.
- Идентични патеки со различни директиви: Кога
AllowиDisallowкористат иста патека, се појавува известувањето: „Allow и Disallow ја користат истата патека. Google применува Allow кога двете се еднакво специфични.“.
Важноста на мапите на сајтови
Вклучувањето на URL-адресата на мапата на сајтот во robots.txt им помага на пребарувачите побрзо да ги откријат и индексираат сите достапни страници на вашиот веб-сајт.
Мапата на сајтот се наведува со целосна патека. URL-адресите на мапите на сајтови мора да содржат целосна http:// или https:// адреса. Доколку внесената адреса не е целосна, алатката ќе го прикаже предупредувањето: „URL-адресите на мапите на сајтови имаат потреба од целосна http:// или https:// адреса.“.
Како Google ги толкува и совпаѓа правилата
Кога роботот на Google ја посетува страницата, тој ги анализира правилата во robots.txt според дефиниран редослед на совпаѓање:
- Најдолга патека: Google го применува правилото со најдолга совпаѓачка патека, бидејќи таа се смета за најспецифична. Должината на карактерите во патеката ја одредува нејзината специфичност.
- Еднаква специфичност: Доколку постојат две совпаѓачки правила (
AllowиDisallow) кои се со потполно еднаква должина и специфичност, правилотоAllowима предност и патот ќе биде дозволен. - Стандардно однесување: Доколку за одредена патека не постои ниту едно соодветно правило во датотеката, Google стандардно ја дозволува таа патека за скенирање.
Ограничувања на robots.txt при индексирање
Постои значајна разлика помеѓу блокирање на скенирањето (crawling) и спречување на индексирањето (indexing) во пребарувачите:
- Појавување во резултати: Датотеката robots.txt само го спречува роботот да ја посети страницата. Сепак, блокираната страница сè уште може да се појави во резултатите од пребарувањето доколку други веб-страници водат до неа преку линкови.
- Што не проверува алатката: Овој валидатор не врши проверка за директиви како
noindex, не проверува системи за контрола на пристап (како лозинки) и не врши физичко отстранување на страници од серверот. За целосно отстранување на страница од пребарувањето, мора да се користат соодветни мета-ознаки или автентикација.
Локално процесирање и приватност
Сите операции за генерирање, уредување и валидација на правилата се извршуваат локално. Вашите правила за индексирање се креираат и проверуваат во вашиот прелистувач. Ништо не се испраќа на BroBroGo, со што се гарантира дека вашите тест-патеки и структура на сајтот остануваат приватни на вашиот уред.
Дополнително, алатката има ограничување на големината на текстуалниот внес. Доколку генерираната содржина во robots.txt надмине 100.000 карактери, ќе се појави известувањето: „Овој robots.txt е преголем за да се прегледа тука.“.
Често поставувани прашања (FAQ)
Што може да додаде овој генератор во robots.txt?
Додајте група на кориснички агенти (user-agent), патеки за Allow и Disallow и една или повеќе URL-адреси на мапи на сајтови. Прегледот е подготвен за копирање во датотека robots.txt.
Како алатката за проверка на патеки избира правило?
Го следи редоследот на совпаѓање на Google: победува најдолгата патека што се совпаѓа. Ако правилата Allow и Disallow се еднакво специфични, победува Allow.
Дали Disallow ја отстранува страницата од Google пребарувањето?
Не. Блокираната страница сè уште може да се појави во резултатите од пребарувањето ако други страници водат до неа. Користете noindex, контрола на пристап или отстранете ја страницата кога сакате целосно да ја тргнете од пребарувањето.