Generátor a validátor robots.txt

Sestavte si pravidla procházení a zkontrolujte, ke kterým cestám má Googlebot přístup.

Pravidla procházení

Začněte crawlerem (vyhledávacím robotem), pro kterého mají tato pravidla platit.

Sitemapy

Vygenerovaný robots.txt

0
robots.txt
Připraveno. Ukázka blokuje přístup do složky /admin pro všechny crawlery.

Kontrola pravidel

    Otestovat cestu

    Vaše pravidla procházení se vytvářejí a kontrolují přímo ve vašem prohlížeči. Do služby BroBroGo se nic neodesílá.

    Časté dotazy

    Co všechno mohu pomocí tohoto generátoru do robots.txt přidat?

    Můžete přidat skupiny pro různé roboty (user-agent), povolené (Allow) a zakázané (Disallow) cesty a jednu nebo více URL adres sitemap. Náhled je okamžitě připraven ke zkopírování do vašeho souboru robots.txt.

    Jak kontrolor cest vybírá platné pravidlo?

    Řídí se prioritami shody Google: vítězí nejdelší odpovídající cesta. Pokud jsou odpovídající pravidla Allow a Disallow stejně specifická, vítězí Allow.

    Odstraní direktiva Disallow stránku z vyhledávání Google?

    Ne. Blokovaná stránka se stále může objevit ve výsledcích vyhledávání, pokud na ni odkazují jiné stránky. Chcete-li stránku spolehlivě udržet mimo vyhledávání, použijte tag noindex, omezení přístupu (heslo) nebo stránku zcela odstraňte.

    Účel a funkce souboru robots.txt

    Soubor robots.txt je textový dokument umístěný v kořenovém adresáři webové prezentace, který slouží jako instrukce pro internetové vyhledávače a automatické roboty (crawlery). Tento soubor definuje, které části webu mohou tito roboti procházet a indexovat, a které oblasti by naopak měly zůstat jejich přístupu uzavřeny. Správné nastavení těchto pravidel je klíčové pro efektivní řízení přenosového pásma serveru a pro ochranu citlivých nebo duplicitních sekcí webu před nežádoucím procházením.

    Nástroj Generátor a validátor robots.txt umožňuje webmasterům a vývojářům snadno sestavovat tato pravidla, kontrolovat jejich syntaktickou správnost a testovat chování konkrétních crawlerů vůči zadaným cestám. Veškeré zpracování dat probíhá lokálně: Vaše pravidla procházení se vytvářejí a kontrolují přímo ve vašem prohlížeči. Do služby BroBroGo se nic neodesílá.


    Direktiva User-agent a řízení chování crawlerů

    Základním stavebním kamenem souboru robots.txt je direktiva User-agent. Tato direktiva určuje, pro kterého konkrétního robota následující pravidla platí.

    • Univerzální pravidlo: Použitím znaku * definujete pravidla, která se vztahují na všechny crawlery, jež nemají v souboru vyhrazenou vlastní specifickou sekci.
    • Specifičtí roboti: Můžete cílit na konkrétní vyhledávače, jako je například Googlebot. Název robota v poli User-agent nesmí obsahovat mezery. Pokud zadáte neplatný název, nástroj zobrazí chybové hlášení: Zadejte jeden název robota bez mezer, nebo použijte * pro všechny crawlery.

    Nástroj ve výchozím nastavení začíná s předdefinovanou konfigurací User-agent: * a Disallow: /admin. Pokud v konfiguraci omylem definujete stejného robota ve více různých skupinách, nástroj vás na to upozorní varováním: Google slučuje skupiny, které definují stejného robota (user-agent).


    Pravidla Allow a Disallow a jejich interakce

    Pro každou skupinu crawlerů můžete definovat dva základní typy pravidel pro přístup k adresářům a souborům:

    • Disallow (Zakázat): Určuje cesty, do kterých má robot zakázán přístup.
    • Allow (Povolit): Určuje cesty, které jsou pro robota přístupné, což se často využívá k povolení přístupu do konkrétního podadresáře uvnitř jinak zakázané složky.

    Syntaktická pravidla pro cesty

    Všechny definované cesty musí splňovat přísná formální kritéria:

    1. Každá cesta musí začínat lomítkem /.
    2. Cesty nesmí obsahovat mezery. V případě porušení těchto pravidel nástroj zobrazí chybu: Cesty pravidel musí začínat znakem / a nesmí obsahovat mezery.
    3. Speciální znak $ lze použít výhradně na samotném konci cesty pro označení konce řetězce. Pokud jej umístíte jinam, zobrazí se upozornění: Znak $ používejte pouze na samotném konci cesty pravidla.

    Duplicity a konflikty

    Při sestavování pravidel může dojít k chybám v logice:

    • Pokud je identické pravidlo pro jednoho robota zapsáno vícekrát, nástroj jej označí hlášením: Toto pravidlo se pro stejného robota opakuje.
    • Pokud pro stejnou cestu nastavíte současně povolení i zákaz, nástroj vygeneruje upozornění: Pravidla Allow a Disallow používají stejnou cestu. Google v případě stejné specifičnosti uplatní pravidlo Allow.

    Význam sitemap v robots.txt

    Sitemap (mapa webu) je soubor ve formátu XML, který obsahuje seznam důležitých URL adres webu a pomáhá vyhledávačům efektivněji objevovat nový obsah. Umístění odkazu na sitemapu přímo do souboru robots.txt je standardním postupem, jak vyhledávačům usnadnit její nalezení.

    V generátoru můžete definovat jednu nebo více sitemap. Každá zadaná URL adresa sitemapy musí být kompletní, což znamená, že musí obsahovat protokol http:// nebo https://. Pokud adresa tato kritéria nesplňuje, nástroj zobrazí chybu: URL adresa sitemapy musí obsahovat kompletní adresu s http:// nebo https://.


    Jak Google vyhodnocuje prioritu pravidel

    Při testování přístupu k jednotlivým cestám se nástroj řídí oficiální specifikací společnosti Google pro vyhodnocování pravidel robots.txt. Rozhodování probíhá na základě následujících principů:

    1. Délka cesty rozhoduje: Google uplatňuje pravidlo nejdelší shody (longest matching path). To znamená, že ze všech odpovídajících pravidel vyhraje to, jehož cesta má nejvyšší počet znaků.
    2. Rovnost délky: Pokud se délka odpovídajícího pravidla Allow a Disallow shoduje (jsou stejně specifická), má přednost pravidlo Allow.
    3. Výchozí chování: Pokud zadané cestě neodpovídá vůbec žádné pravidlo v souboru, platí, že přístup je povolen. Nástroj v takovém případě vrátí výsledek: Žádné odpovídající pravidlo. Google tuto cestu ve výchozím nastavení povoluje.

    Limity a omezení robots.txt při indexaci

    Je kriticky důležité pochopit, k čemu soubor robots.txt neslouží. Blokování přístupu pomocí direktivy Disallow nezaručuje, že se stránka neobjeví ve výsledcích vyhledávání. Pokud na zablokovanou stránku vedou odkazy z jiných webů nebo z jiných částí vašeho webu, vyhledávač ji může indexovat i bez toho, aby ji navštívil.

    Tento nástroj slouží výhradně k validaci pravidel procházení a neprovádí kontrolu jiných metod zabezpečení či indexace. Nástroj nekontroluje přítomnost meta tagu noindex, nastavení řízení přístupu (např. ověřování uživatelů) ani fyzické odstranění stránek ze serveru. Pro spolehlivé zamezení indexace citlivého obsahu je nutné použít tyto doplňkové metody.

    Maximální velikost souboru robots.txt, kterou je tento nástroj schopen analyzovat, je omezena. Pokud vygenerovaný text překročí limit 100 000 znaků, validátor zobrazí upozornění: Tento soubor robots.txt je příliš velký pro kontrolu v tomto nástroji.


    Často kladené otázky (FAQ)

    Co všechno mohu pomocí tohoto generátoru do robots.txt přidat?

    Můžete přidat skupiny pro různé roboty (user-agent), povolené (Allow) a zakázané (Disallow) cesty a jednu nebo více URL adres sitemap. Náhled je okamžitě připraven ke zkopírování do vašeho souboru robots.txt.

    Jak kontrolor cest vybírá platné pravidlo?

    Řídí se prioritami shody Google: vítězí nejdelší odpovídající cesta. Pokud jsou odpovídající pravidla Allow a Disallow stejně specifická, vítězí Allow.

    Odstraní direktiva Disallow stránku z vyhledávání Google?

    Ne. Blokovaná stránka se stále může objevit ve výsledcích vyhledávání, pokud na ni odkazují jiné stránky. Chcete-li stránku spolehlivě udržet mimo vyhledávání, použijte tag noindex, omezení přístupu (heslo) nebo stránku zcela odstraňte.

    Jsou moje zadaná pravidla a URL adresy v bezpečí?

    Ano. Vaše pravidla procházení se vytvářejí a kontrolují přímo ve vašem prohlížeči. Do služby BroBroGo se nic neodesílá, takže veškerá data zůstávají lokálně ve vašem zařízení.