El fitxer robots.txt és un component fonamental en la gestió d'un lloc web, ja que serveix per indicar als rastrejadors web quines rutes poden o no poden visitar. L'eina Generador i validador de robots.txt permet estructurar aquestes directrius de manera precisa, avaluar la sintaxi en temps real i comprovar si rutes específiques del lloc web estan realment accessibles per a un rastrejador concret.
Les vostres regles de rastreig es creen i es comproven al vostre navegador. No es puja res a BroBroGo. Això garanteix que tot el processament de les dades i la validació de les rutes es realitza localment al dispositiu de l'usuari.
El propòsit i funcionament del fitxer robots.txt
El fitxer robots.txt és un fitxer de text pla que se situa a l'arrel d'un domini per guiar els robots de cerca (com ara Googlebot). Mitjançant un conjunt de regles, el propietari del lloc web pot definir quines seccions han de quedar excloses del rastreig.
Per defecte, l'eina s'inicia amb una configuració predeterminada que conté les següents directives:
User-agent: *Disallow: /admin
Aquesta configuració inicial serveix com a punt de partida per entendre com s'estructuren els blocs de regles per a qualsevol rastrejador general.
Directives d'User-agent i control de rastrejadors
La directiva User-agent identifica el rastrejador específic al qual s'apliquen les regles següents. Es pot utilitzar el caràcter * per indicar que les regles s'apliquen a tots els rastrejadors de manera global, o especificar noms concrets com Googlebot.
L'eina valida estrictament la introducció d'aquests valors. Si s'introdueix un nom incorrecte, es mostrarà l'error:
Introduïu un nom d'user-agent sense espais, o utilitzeu * per a tots els rastrejadors.
A més, si es defineix el mateix agent en diferents seccions, el validador advertirà amb el missatge Google combina els grups que fan referència al mateix user-agent., ja que els motors de cerca agruparan aquestes directrius durant el processament.
Regles de ruta: Allow i Disallow
Dins de cada grup d'User-agent, es defineixen les regles d'accés mitjançant les directives de permís (Allow) i prohibició (Disallow). Aquestes regles han de complir uns requisits sintàctics molt concrets per ser efectives:
- Inici de la ruta: Totes les rutes de les regles han de començar obligatòriament amb el caràcter
/. Si no es compleix, l'eina mostra l'errorLes rutes de les regles han de començar per / i no poden contenir espais.. - Ús del caràcter de finalització: El caràcter
$s'utilitza per definir la fi d'una ruta exacta. Si es col·loca en qualsevol altra posició, el validador llançarà l'advertimentUtilitzeu $ només al final d'una ruta de regla.. - Duplicitat de regles: Si es defineix exactament la mateixa regla més d'una vegada per al mateix agent, es mostrarà l'avís
Aquesta regla es repeteix per al mateix user-agent.. - Conflictes de rutes idèntiques: Quan una ruta es defineix simultàniament com a permesa i prohibida, es genera un conflicte. L'eina ho detecta i mostra l'advertiment
Allow i Disallow utilitzen la mateixa ruta. Google aplica Allow quan ambdues són igual d'específiques..
La importància de les URL de mapa del lloc
La directiva Sitemap indica als rastrejadors on es troba el mapa del lloc XML per facilitar la indexació de les pàgines. A diferència de les rutes de rastreig, les adreces dels mapes del lloc han de ser absolutes.
L'eina valida que s'introdueixi un protocol correcte. Si l'adreça no és vàlida, es mostra l'error:
Les URL del mapa del lloc necessiten una adreça completa http:// o https://.
Com funciona l'ordre de coincidència de Google
Quan un rastrejador com Googlebot avalua un fitxer robots.txt per decidir si pot accedir a una URL, segueix unes regles de prioritat molt definides basades en l'especificitat:
- La ruta més llarga guanya: Google avalua totes les regles aplicables i selecciona la que té la coincidència de caràcters més llarga (la més específica).
- Empat d'especificitat: Si una regla
Allowi una reglaDisallowcoincideixen exactament en la mateixa longitud de ruta, la directivaAllowté prioritat i guanya.
Durant la comprovació de rutes a l'interfície, l'eina pot retornar els següents resultats segons el cas:
Permès — {rule}(indica la regla exacta que permet l'accés).Bloquejat — {rule}(indica la regla exacta que denega l'accés).No hi ha cap regla coincident. Google permet aquesta ruta per defecte.
Cal tenir en compte que si el fitxer generat és extremadament complex i supera els 100.000 caràcters, el validador mostrarà l'avís Aquest robots.txt és massa gran per revisar-lo aquí..
Limitacions del robots.txt en la indexació
Un error comú és creure que prohibir el rastreig d'una pàgina mitjançant Disallow n'evita la indexació als cercadors. Un fitxer robots.txt només controla el comportament del rastreig, no la indexació.
Si altres llocs web enllacen cap a una pàgina bloquejada per robots.txt, aquesta pàgina pot continuar apareixent als resultats de cerca de Google. L'eina no realitza comprovacions de directives noindex, sistemes de control d'accés (com contrasenyes) o eliminació física de pàgines. Per garantir que una pàgina no aparegui en absolut, cal aplicar mètodes d'autenticació o etiquetes meta de noindex directament al codi HTML de la pàgina.
Preguntes freqüents (FAQ)
Què pot afegir aquest generador al robots.txt?
Afegiu un grup d'user-agent, rutes Allow i Disallow, i una o més URL de mapa del lloc. La vista prèvia està llesta per copiar-la en un fitxer robots.txt.
Com tria una regla el comprovador de rutes?
Segueix l'ordre de coincidència de Google: guanya la ruta de coincidència més llarga. Si les regles Allow i Disallow coincidents són igual d'específiques, guanya Allow.
Disallow elimina una pàgina de la Cerca de Google?
No. Una pàgina bloquejada pot continuar apareixent als resultats de cerca si altres pàgines l'enllacen. Utilitzeu noindex, control d'accés o elimineu la pàgina si voleu que quedi fora de les cerques.
On es processen les dades que s'introdueixen en aquesta eina?
Les vostres regles de rastreig es creen i es comproven al vostre navegador. No es puja cap tipus d'informació als servidors de BroBroGo, garantint un procés totalment local.