Robots.txt generátor és ellenőrző

Hozzon létre feltérképezési szabályokat, és ellenőrizze, mely útvonalakat érheti el a Googlebot.

Feltérképezési szabályok

Kezdje azzal a keresőrobottal (crawler), amelyre ezek a szabályok vonatkoznak.

Oldaltérképek

Generált robots.txt

0
robots.txt
Kész. A példa blokkolja az /admin útvonalat az összes keresőrobot számára.

Szabályok ellenőrzése

    Útvonal tesztelése

    A feltérképezési szabályok létrehozása és ellenőrzése a böngészőjében történik. Semmi sem kerül feltöltésre a BroBroGo szervereire.

    GYIK

    Mit tud hozzáadni ez a generátor a robots.txt fájlhoz?

    Hozzáadhat egy user-agent csoportot, Allow és Disallow útvonalakat, valamint egy vagy több oldaltérkép (sitemap) URL-t. Az előnézet azonnal készen áll a másolásra egy robots.txt fájlba.

    Hogyan választ szabályt az útvonal-ellenőrző?

    A Google egyezési sorrendjét követi: a leghosszabb egyező útvonal nyer. Ha a megfelelő Allow és Disallow szabályok egyformán specifikusak, az Allow szabály nyer.

    Eltávolítja a Disallow szabály az oldalt a Google Keresőből?

    Nem. Egy letiltott oldal továbbra is megjelenhet a keresési találatok között, ha más oldalak hivatkoznak rá. Használjon noindex címkét, hozzáférés-szabályozást, vagy távolítsa el az oldalt, ha teljesen ki szeretné zárni a keresőkből.

    A robots.txt fájl célja és működése

    A robots.txt egy egyszerű szöveges fájl a webhely gyökérkönyvtárában, amely útmutatást nyújt a webes keresőrobotok (például a Googlebot) számára arról, hogy a webhely mely részeit térképezhetik fel, és melyeket nem. A fájl elsődleges feladata a crawl-kapacitás optimalizálása, megakadályozva, hogy a robotok túlterheljék a szervert felesleges vagy privát oldalak letöltésével.

    Fontos tisztázni, hogy a robots.txt nem alkalmas az oldalak keresőmotorokból való teljes eltávolítására vagy elrejtésére. Ha egy oldalra külső hivatkozások mutatnak, az a tiltás ellenére is bekerülhet az indexbe. A teljes kizáráshoz jelszavas hozzáférés-szabályozásra vagy noindex meta-címkékre van szükség, amelyeket ez az eszköz nem ellenőriz.

    A User-agent direktívák szerepe

    A robots.txt fájlban a szabályokat csoportokba kell rendezni, amelyeket a User-agent sor vezet be. Ez határozza meg, hogy az alatta lévő utasítások melyik keresőrobotra vonatkoznak.

    • Általános érvényű szabály: A * karakter használatával az összes keresőrobotra vonatkozóan adhat meg utasításokat.
    • Specifikus robotok: Megcélozhat konkrét crawlert is, mint például a Googlebot.

    A szabályok létrehozásakor a User-agent nevek nem tartalmazhatnak szóközöket. Ha egy adott User-agent név több különböző csoportban is szerepel, a Google összevonja az azonos user-agentet megnevező csoportokat.

    Az Allow és Disallow szabályok interakciója

    A robotok viselkedését két fő direktívával szabályozhatjuk a csoportokon belül:

    • Disallow (Tiltás): Megadja azt az útvonalat, amelyet a robotnak el kell kerülnie.
    • Allow (Engedélyezés): Kivételt képez a tiltás alól egy alkönyvtáron vagy fájlon belül.

    Minden megadott útvonalnak / jellel kell kezdődnie, és nem tartalmazhat szóközöket. A $ karakter kizárólag a szabály útvonalának legvégén használható, jelezve az útvonal pontos végződését.

    Ha ugyanazt a szabályt többször is rögzíti ugyanahhoz a keresőrobothoz, a rendszer jelzi, hogy: "Ez a szabály már szerepel ugyanehhez a keresőrobothoz.". Amennyiben egy Allow és egy Disallow szabály pontosan ugyanarra az útvonalra mutat, a következő figyelmeztetés jelenik meg: "Az Allow és Disallow szabályok ugyanazt az útvonalat használják. A Google az Allow szabályt alkalmazza, ha mindkettő egyformán specifikus.".

    Oldaltérképek megadása a robots.txt-ben

    Az oldaltérkép (sitemap) megadása segít a keresőrobotoknak gyorsan megtalálni a webhely értékes tartalmait. Az oldaltérkép URL-jét a robots.txt fájlban függetlenül lehet elhelyezni a User-agent csoportoktól.

    A megadott oldaltérkép URL-jének teljes http:// vagy https:// címet kell tartalmaznia. Ha a megadott cím nem teljes, a rendszer az "Az oldaltérkép URL-jének teljes http:// vagy https:// címet kell tartalmaznia." hibaüzenetet adja vissza.

    A Google egyezési szabályai és prioritásai

    Amikor a Googlebot vagy más kompatibilis robot kiértékeli a robots.txt fájlt, meghatározott prioritási sorrendet követ az ütköző szabályok feloldására:

    1. A leghosszabb egyezés elve: A Google a leghosszabb egyező útvonalat veszi figyelembe. Minél specifikusabb (hosszabb) egy szabály útvonala, annál erősebb, függetlenül attól, hogy az Allow vagy Disallow utasítás-e.
    2. Egyenlő hosszúságú szabályok: Ha a megfelelő Allow és Disallow szabályok egyformán specifikusak, az Allow szabály nyer.

    A tesztelő funkció ezen szabályok alapján futtatja le az ellenőrzést a megadott URL-útvonal és Keresőrobot (Crawler) mezők értékeivel.

    Gyakori hibák és ellenőrzésük

    A robots.txt kézi szerkesztése során könnyen becsúszhatnak szintaktikai hibák. Az eszköz az alábbi problémákat képes azonosítani az elemzés során:

    Hiba / Állapot Rendszerüzenet
    Érvénytelen User-agent "Adjon meg egy user-agent nevet szóközök nélkül, vagy használja a * karaktert az összes keresőrobothoz."
    Hibás útvonal-formátum "A szabályok útvonalainak /-jellel kell kezdődniük, és nem tartalmazhatnak szóközöket."
    Rossz helyen lévő $ jel "A $ karaktert csak a szabály útvonalának legvégén használja."
    Ismétlődő szabály "Ez a szabály már szerepel ugyanehhez a keresőrobothoz."
    Ütköző azonos útvonalak "Az Allow és Disallow szabályok ugyanazt az útvonalat használják. A Google az Allow szabályt alkalmazza, ha mindkettő egyformán specifikus."
    Duplikált User-agent csoport "A Google összevonja az azonos user-agentet megnevező csoportokat."
    Hibás sitemap URL "Az oldaltérkép URL-jének teljes http:// vagy https:// címet kell tartalmaznia."
    Túl nagy fájlméret "Ez a robots.txt fájl túl nagy az itt történő áttekintéshez."

    A fájlméret korlátja 100 000 karakter; ha a generált robots.txt ezt meghaladja, a fenti méretproblémára figyelmeztető jelzés lép életbe.

    Adatkezelési tájékoztató

    A feltérképezési szabályok létrehozása és ellenőrzése a böngészőjében történik. Semmi sem kerül feltöltésre a BroBroGo szervereire. Ez biztosítja, hogy a konfigurációs adatok és a tesztelt útvonalak helyben maradjanak a futtatás során.

    Gyakran Ismételt Kérdések

    Mit tud hozzáadni ez a generátor a robots.txt fájlhoz?

    Hozzáadhat egy user-agent csoportot, Allow és Disallow útvonalakat, valamint egy vagy több oldaltérkép (sitemap) URL-t. Az előnézet azonnal készen áll a másolásra egy robots.txt fájlba.

    Hogyan választ szabályt az útvonal-ellenőrző?

    A Google egyezési sorrendjét követi: a leghosszabb egyező útvonal nyer. Ha a megfelelő Allow és Disallow szabályok egyformán specifikusak, az Allow szabály nyer.

    Eltávolítja a Disallow szabály az oldalt a Google Keresőből?

    Nem. Egy letiltott oldal továbbra is megjelenhet a keresési találatok között, ha más oldalak hivatkoznak rá. Használjon noindex címkét, hozzáférés-szabályozást, vagy távolítsa el az oldalt, ha teljesen ki szeretné zárni a keresőből.