Generador y Validador de Robots.txt

Crea reglas de rastreo y comprueba qué rutas puede abrir Googlebot.

Reglas de rastreo

Empieza por el rastreador que debe seguir estas reglas.

Sitemaps

robots.txt generado

0
robots.txt
Listo. El ejemplo bloquea /admin para todos los rastreadores.

Revisión de reglas

    Probar una ruta

    Tus reglas de rastreo se crean y revisan en tu navegador. No se sube nada a BroBroGo.

    Preguntas frecuentes

    ¿Qué puede añadir este generador a robots.txt?

    Añade grupos User-agent, rutas Allow y Disallow, y una o más URL de sitemap. La vista previa queda lista para copiarla a un archivo robots.txt.

    ¿Cómo elige una regla el comprobador de rutas?

    Sigue el orden de coincidencia de Google: gana la ruta coincidente más larga. Si Allow y Disallow tienen la misma especificidad, gana Allow.

    ¿Disallow quita una página de Google Search?

    No. Una página bloqueada puede seguir apareciendo si otras páginas enlazan a ella. Usa noindex, control de acceso o elimina la página si debe quedar fuera de la búsqueda.

    El archivo robots.txt es un componente fundamental en la gestión de un sitio web, ya que actúa como el primer punto de contacto para los rastreadores web que visitan un dominio. Este archivo de texto plano indica a los motores de búsqueda qué secciones del sitio pueden rastrear y cuáles deben ignorar. El uso de un generador y validador especializado permite estructurar estas directrices sin errores de sintaxis que puedan comprometer la visibilidad de las páginas en los resultados de búsqueda.

    Toda la creación y comprobación de las reglas de rastreo se realiza de manera local: tus reglas de rastreo se crean y revisan en tu navegador, y no se sube nada a BroBroGo.

    Estructura de las directrices y el control de User-agent

    Un archivo robots.txt se organiza en grupos de directrices dirigidos a rastreadores específicos. Cada grupo comienza con la declaración User-agent, que identifica al robot de búsqueda al que se aplican las reglas siguientes.

    • Identificación del rastreador: Se puede especificar un robot concreto, como Googlebot, o aplicar una regla general para todos los rastreadores utilizando el carácter asterisco (*). El nombre del User-agent no debe contener espacios.
    • Rutas de acceso: Las reglas de exclusión (Disallow) e inclusión (Allow) definen los directorios o patrones de URL permitidos. Cada ruta declarada debe comenzar obligatoriamente con el carácter / y no puede contener espacios.
    • Anclaje de final de cadena: El carácter $ se utiliza para indicar el final exacto de una ruta, impidiendo que la regla coincida con URL más largas que compartan el mismo prefijo. Este carácter solo se puede emplear al final de una ruta.

    Por defecto, la configuración inicial del generador establece un grupo con User-agent: * y la regla Disallow: /admin.

    Interacción entre reglas Allow y Disallow

    El estándar de exclusión de robots permite combinar reglas para bloquear directorios completos y, al mismo tiempo, habilitar el acceso a subcarpetas o archivos específicos dentro de ellos. Esto se consigue mediante la combinación de directrices Allow y Disallow.

    Cuando un rastreador analiza una URL, compara la ruta con las reglas definidas para su User-agent. Si una regla de permitir y otra de bloquear coinciden con la misma ruta exacta, se produce un conflicto de redundancia. El validador detecta estas situaciones y muestra el aviso "Allow y Disallow usan la misma ruta. Google aplica Allow cuando ambas tienen la misma especificidad". Asimismo, si se define una misma directriz de forma idéntica dentro del mismo grupo, la herramienta señalará que "Esta regla se repite para el mismo User-agent".

    Declaración de Sitemaps en robots.txt

    La inclusión de la dirección del mapa del sitio o sitemap dentro del archivo robots.txt es una práctica recomendada para facilitar el descubrimiento de contenido nuevo o actualizado por parte de los motores de búsqueda.

    A diferencia de las rutas de rastreo, que son relativas a la raíz del servidor, la declaración del sitemap requiere una dirección URL absoluta. El validador comprueba que se introduzca un protocolo válido, emitiendo el aviso "Las URL de sitemap necesitan una dirección completa con http:// o https://" si el formato es incorrecto o incompleto.

    Prioridad de coincidencia según el estándar de Google

    Para determinar si una URL específica está autorizada o bloqueada, el validador aplica estrictamente las reglas de coincidencia que utiliza Googlebot:

    1. La regla más larga tiene prioridad: El orden de declaración en el archivo no influye en la prioridad. Google evalúa todas las reglas aplicables y selecciona aquella cuya ruta coincidente sea la más larga (la que tenga un mayor número de caracteres).
    2. Resolución de empates por especificidad: Si una regla Allow y una regla Disallow coinciden con la misma longitud de caracteres y tienen la misma especificidad, la directriz Allow prevalece sobre la de bloqueo.
    3. Comportamiento predeterminado: En caso de que ninguna regla del archivo coincida con la URL consultada, el validador devolverá el resultado "No hay una regla coincidente. Google permite esta ruta de forma predeterminada.".

    Errores comunes y límites de tamaño

    El análisis automático del validador ayuda a identificar fallos estructurales antes de publicar el archivo en el servidor web. Entre las advertencias de configuración que procesa la herramienta se encuentran:

    • Nombres de User-agent duplicados: Si se definen varios bloques independientes para el mismo rastreador, el sistema recuerda que "Google combina los grupos que nombran el mismo User-agent".
    • Límite de tamaño físico: Los motores de búsqueda imponen límites al tamaño del archivo robots.txt que procesan. Si el contenido generado supera los 100.000 caracteres, el validador detiene el análisis y muestra el mensaje "Este robots.txt es demasiado grande para revisarlo aquí".

    Limitaciones del archivo robots.txt en la indexación

    Es fundamental comprender que el archivo robots.txt no es un mecanismo de seguridad ni garantiza que una página no aparezca en los resultados de búsqueda.

    Una directriz Disallow impide que el rastreador acceda al contenido de la página para analizarlo, pero no evita que el motor de búsqueda indexe la URL. Si otros sitios web externos enlazan hacia esa página bloqueada, Google puede indexar la dirección y mostrarla en los resultados de búsqueda basándose únicamente en la información del enlace. Para asegurar que una página quede completamente excluida del índice, se deben emplear etiquetas noindex, configurar sistemas de control de acceso mediante contraseña o eliminar físicamente la página del servidor, ya que el archivo robots.txt no realiza estas funciones.

    Preguntas frecuentes

    ¿Qué puede añadir este generador a robots.txt?
    Añade grupos User-agent, rutas Allow y Disallow, y una o más URL de sitemap. La vista previa queda lista para copiarla a un archivo robots.txt.

    ¿Cómo elige una regla el comprobador de rutas?
    Sigue el orden de coincidencia de Google: gana la ruta coincidente más larga. Si Allow y Disallow tienen la misma especificidad, gana Allow.

    ¿Disallow quita una página de Google Search?
    No. Una página bloqueada puede seguir apareciendo si otras páginas enlazan a ella. Usa noindex, control de acceso o elimina la página si debe quedar fuera de la búsqueda.