Предназначение и функции на инструмента
Инструментът „Генератор и валидатор на robots.txt“ помага на потребителите да създават и проверяват правила, които уеб роботите (като Googlebot) да следват при посещение на уебсайт. Чрез него можете да изградите файл robots.txt, като добавяте различни правила за разнообразни роботи, а след това да тествате конкретни пътища от сайта, за да проверите дали даден робот ще бъде допуснат или блокиран въз основа на тези правила.
Този инструмент е предназначен за:
- Поддържащи уебсайтове, които искат да контролират как уеб роботите осъществяват достъп до техния сайт.
- Разработчици, които трябва да създават или променят файлове robots.txt.
- Всеки, който иска да попречи на роботите да осъществяват достъп до определени части от уебсайта му.
- Потребители, които искат да се уверят, че важни страници не са блокирани случайно за уеб роботите.
Конфигуриране на правила за обхождане
При стартиране инструментът започва с автоматично зададени настройки по подразбиране: User-agent: * и Disallow: /admin. Потребителите могат да въвеждат следните входни данни за генериране на файла:
- User-agent: Името на конкретен робот или символът
*за всички роботи. Името на потребителския агент не трябва да съдържа интервали. При неспазване на това изискване се показва съобщението „Въведете едно име на user-agent без интервали или използвайте * за всички роботи.“. - Път: Пътят на правилото в уебсайта, който задължително трябва да започва с
/и не може да съдържа интервали. Символът$може да се използва единствено в края на пътя на правилото. При грешка интерфейсът показва съобщенията „Пътищата на правилата трябва да започват с / и не могат да съдържат интервали.“ или „Използвайте знака $ само в края на пътя на правилото.“. - URL адрес на карта на сайта: Пълният адрес на картата на сайта, който задължително трябва да започва с
http://илиhttps://. Ако адресът е невалиден, се задейства предупреждението „URL адресите на картите на сайта изискват пълен http:// или https:// адрес.“.
Резултати и валидация на правилата
Инструментът генерира визуализация на файла в секцията „Генериран robots.txt“ и предоставя подробна информация за структурата му:
{count}правило(а): Показва общия брой на правилата в генерирания файл.{count}елемент(а) за преглед: Посочва броя на откритите проблеми и конфликти в правилата. Ако няма открити грешки, се изписва „Не са открити синтактични грешки или конфликти между правилата.“.
По време на анализа инструментът следи за специфични грешки и конфликти:
- Това правило се повтаря за същия user-agent. – Показва се, когато едно и също правило е дублирано за един и същ робот.
- Правилата Allow и Disallow използват един и същ път. Google прилага Allow, когато и двете са еднакво специфични. – Сигнализира за дублиране на пътя в двете противоположни директиви.
- Google обединява групите, които посочват един и същ user-agent. – Появява се, когато един и същ робот е посочен в повече от една група.
- Този robots.txt файл е твърде голям за преглед тук. – Активира се, ако генерираният файл надхвърли 100 000 знака.
Тестване на път и логика на съвпадение
Разделът „Тестване на път“ позволява да се провери поведението на конкретен робот спрямо определен адрес. За целта се попълват следните полета:
- Път на URL адреса: Конкретният път на вашия уебсайт, който искате да тествате.
- Робот (Crawler): Името на робота, спрямо който се извършва проверката.
При проверка на пътищата инструментът прилага официалния ред на съвпадение на Google, при който най-дългият съвпадащ път има предимство. Ако съвпадащите правила „Разрешаване (Allow)“ и „Забраняване (Disallow)“ са еднакво специфични, предимство има правилото „Allow“.
Резултатите от теста могат да бъдат:
- Разрешено —
{rule}– Показва, че тестваният път е достъпен, и посочва правилото, което го позволява. - Блокирано —
{rule}– Показва, че пътят е блокиран, заедно с ограничаващото го правило. - Няма съвпадащо правило. Google разрешава този път по подразбиране. – Показва се, когато никое от правилата във файла не съответства на тествания път.
Ограничения при контрола на индексирането
Важно е да се разбере, че файлът robots.txt има своите ограничения по отношение на контрола върху търсачките. Блокирана страница все още може да се появи в резултатите от търсенето, ако други страници съдържат връзки към нея.
Инструментът не извършва проверки за директиви noindex, системи за контрол на достъпа или премахване на страници. За пълно изключване на дадено съдържание от търсенето трябва да се използват алтернативни методи като noindex, ограничаване на достъпа или изтриване на самата страница.
Поверителност на данните
Вашите правила за обхождане се създават и проверяват изцяло във вашия браузър. Никаква част от въведената информация или генерираните правила не се качва на сървърите на BroBroGo.
Често задавани въпроси (FAQ)
Какво може да добави този генератор в robots.txt? Добавете група за потребителски агент (user-agent), разрешени (Allow) и забранени (Disallow) пътища, както и един или повече URL адреси за карти на сайта (sitemaps). Готовият код може да се копира директно във файл robots.txt.
Как инструментът за проверка на пътища избира правило? Следва се редът на съвпадение на Google: печели най-дългият съвпадащ път. Ако съвпадащите правила Allow и Disallow са еднакво специфични, Allow има предимство.
Премахва ли директивата Disallow страница от Google Търсене? Не. Блокирана страница все още може да се появява в резултатите от търсенето, ако други страници препращат към нея. Използвайте noindex, контрол на достъпа или премахнете страницата, ако искате тя да бъде напълно изключена от търсенето.