A robots.txt fájl célja és működése
A robots.txt egy egyszerű szöveges fájl a webhely gyökérkönyvtárában, amely útmutatást nyújt a webes keresőrobotok (például a Googlebot) számára arról, hogy a webhely mely részeit térképezhetik fel, és melyeket nem. A fájl elsődleges feladata a crawl-kapacitás optimalizálása, megakadályozva, hogy a robotok túlterheljék a szervert felesleges vagy privát oldalak letöltésével.
Fontos tisztázni, hogy a robots.txt nem alkalmas az oldalak keresőmotorokból való teljes eltávolítására vagy elrejtésére. Ha egy oldalra külső hivatkozások mutatnak, az a tiltás ellenére is bekerülhet az indexbe. A teljes kizáráshoz jelszavas hozzáférés-szabályozásra vagy noindex meta-címkékre van szükség, amelyeket ez az eszköz nem ellenőriz.
A User-agent direktívák szerepe
A robots.txt fájlban a szabályokat csoportokba kell rendezni, amelyeket a User-agent sor vezet be. Ez határozza meg, hogy az alatta lévő utasítások melyik keresőrobotra vonatkoznak.
- Általános érvényű szabály: A
*karakter használatával az összes keresőrobotra vonatkozóan adhat meg utasításokat. - Specifikus robotok: Megcélozhat konkrét crawlert is, mint például a Googlebot.
A szabályok létrehozásakor a User-agent nevek nem tartalmazhatnak szóközöket. Ha egy adott User-agent név több különböző csoportban is szerepel, a Google összevonja az azonos user-agentet megnevező csoportokat.
Az Allow és Disallow szabályok interakciója
A robotok viselkedését két fő direktívával szabályozhatjuk a csoportokon belül:
- Disallow (Tiltás): Megadja azt az útvonalat, amelyet a robotnak el kell kerülnie.
- Allow (Engedélyezés): Kivételt képez a tiltás alól egy alkönyvtáron vagy fájlon belül.
Minden megadott útvonalnak / jellel kell kezdődnie, és nem tartalmazhat szóközöket. A $ karakter kizárólag a szabály útvonalának legvégén használható, jelezve az útvonal pontos végződését.
Ha ugyanazt a szabályt többször is rögzíti ugyanahhoz a keresőrobothoz, a rendszer jelzi, hogy: "Ez a szabály már szerepel ugyanehhez a keresőrobothoz.". Amennyiben egy Allow és egy Disallow szabály pontosan ugyanarra az útvonalra mutat, a következő figyelmeztetés jelenik meg: "Az Allow és Disallow szabályok ugyanazt az útvonalat használják. A Google az Allow szabályt alkalmazza, ha mindkettő egyformán specifikus.".
Oldaltérképek megadása a robots.txt-ben
Az oldaltérkép (sitemap) megadása segít a keresőrobotoknak gyorsan megtalálni a webhely értékes tartalmait. Az oldaltérkép URL-jét a robots.txt fájlban függetlenül lehet elhelyezni a User-agent csoportoktól.
A megadott oldaltérkép URL-jének teljes http:// vagy https:// címet kell tartalmaznia. Ha a megadott cím nem teljes, a rendszer az "Az oldaltérkép URL-jének teljes http:// vagy https:// címet kell tartalmaznia." hibaüzenetet adja vissza.
A Google egyezési szabályai és prioritásai
Amikor a Googlebot vagy más kompatibilis robot kiértékeli a robots.txt fájlt, meghatározott prioritási sorrendet követ az ütköző szabályok feloldására:
- A leghosszabb egyezés elve: A Google a leghosszabb egyező útvonalat veszi figyelembe. Minél specifikusabb (hosszabb) egy szabály útvonala, annál erősebb, függetlenül attól, hogy az Allow vagy Disallow utasítás-e.
- Egyenlő hosszúságú szabályok: Ha a megfelelő Allow és Disallow szabályok egyformán specifikusak, az Allow szabály nyer.
A tesztelő funkció ezen szabályok alapján futtatja le az ellenőrzést a megadott URL-útvonal és Keresőrobot (Crawler) mezők értékeivel.
Gyakori hibák és ellenőrzésük
A robots.txt kézi szerkesztése során könnyen becsúszhatnak szintaktikai hibák. Az eszköz az alábbi problémákat képes azonosítani az elemzés során:
| Hiba / Állapot | Rendszerüzenet |
|---|---|
| Érvénytelen User-agent | "Adjon meg egy user-agent nevet szóközök nélkül, vagy használja a * karaktert az összes keresőrobothoz." |
| Hibás útvonal-formátum | "A szabályok útvonalainak /-jellel kell kezdődniük, és nem tartalmazhatnak szóközöket." |
| Rossz helyen lévő $ jel | "A $ karaktert csak a szabály útvonalának legvégén használja." |
| Ismétlődő szabály | "Ez a szabály már szerepel ugyanehhez a keresőrobothoz." |
| Ütköző azonos útvonalak | "Az Allow és Disallow szabályok ugyanazt az útvonalat használják. A Google az Allow szabályt alkalmazza, ha mindkettő egyformán specifikus." |
| Duplikált User-agent csoport | "A Google összevonja az azonos user-agentet megnevező csoportokat." |
| Hibás sitemap URL | "Az oldaltérkép URL-jének teljes http:// vagy https:// címet kell tartalmaznia." |
| Túl nagy fájlméret | "Ez a robots.txt fájl túl nagy az itt történő áttekintéshez." |
A fájlméret korlátja 100 000 karakter; ha a generált robots.txt ezt meghaladja, a fenti méretproblémára figyelmeztető jelzés lép életbe.
Adatkezelési tájékoztató
A feltérképezési szabályok létrehozása és ellenőrzése a böngészőjében történik. Semmi sem kerül feltöltésre a BroBroGo szervereire. Ez biztosítja, hogy a konfigurációs adatok és a tesztelt útvonalak helyben maradjanak a futtatás során.
Gyakran Ismételt Kérdések
Mit tud hozzáadni ez a generátor a robots.txt fájlhoz?
Hozzáadhat egy user-agent csoportot, Allow és Disallow útvonalakat, valamint egy vagy több oldaltérkép (sitemap) URL-t. Az előnézet azonnal készen áll a másolásra egy robots.txt fájlba.
Hogyan választ szabályt az útvonal-ellenőrző?
A Google egyezési sorrendjét követi: a leghosszabb egyező útvonal nyer. Ha a megfelelő Allow és Disallow szabályok egyformán specifikusak, az Allow szabály nyer.
Eltávolítja a Disallow szabály az oldalt a Google Keresőből?
Nem. Egy letiltott oldal továbbra is megjelenhet a keresési találatok között, ha más oldalak hivatkoznak rá. Használjon noindex címkét, hozzáférés-szabályozást, vagy távolítsa el az oldalt, ha teljesen ki szeretné zárni a keresőből.