Funcionamiento del presupuesto de rastreo y su importancia
El presupuesto de rastreo (crawl budget) define la cantidad de atención que los motores de búsqueda dedican a un sitio web. Para los profesionales del SEO técnico y los administradores de sistemas, comprender este límite es fundamental para garantizar que las páginas nuevas o actualizadas se descubran e indexen a tiempo. Si un sitio web supera la capacidad de procesamiento de su servidor o si la demanda de rastreo es ineficiente, partes críticas del catálogo de páginas pueden quedar fuera de los índices de búsqueda.
Esta herramienta permite estimar cuántas páginas puede procesar de forma segura el servidor de un sitio web al día y comparar esa cifra con la demanda de rastreo diaria estimada. Al ajustar diferentes variables del sitio y del servidor, se pueden identificar cuellos de botella y evaluar si la infraestructura actual soporta la frecuencia de actualización requerida.
Factores que influyen en la demanda y la capacidad de rastreo
La interacción entre un rastreador web y un servidor depende de dos fuerzas opuestas: la necesidad del buscador de mantener su índice actualizado (demanda) y la capacidad del hardware para responder a las peticiones sin degradar la experiencia del usuario (capacidad).
Demanda de rastreo
La demanda no es estática. Depende directamente del tamaño del sitio web y de la frecuencia con la que cambia su contenido. Un sitio con millones de páginas que se actualizan a diario requiere un volumen de solicitudes significativamente mayor que un portal corporativo estático. Para modelar esta necesidad, se aplican factores de corrección que asumen que los rastreadores necesitarán visitar las páginas con mayor frecuencia que el intervalo de actualización estricto para asegurar la frescura del índice.
Capacidad del servidor
El servidor web tiene recursos limitados de CPU, memoria y ancho de banda. El impacto del rastreo se evalúa mediante:
- Tiempo de respuesta: Cuanto más rápido responda el servidor, más solicitudes podrá procesar en el mismo periodo de tiempo.
- Tasa de solicitudes: El límite absoluto de peticiones por segundo que el servidor puede manejar.
- Simultaneidad: El número de conexiones paralelas que los rastreadores pueden abrir simultáneamente sin saturar el sistema.
Estimación de la demanda y capacidad diaria
Para realizar los cálculos, la herramienta utiliza un conjunto de datos de entrada específicos que describen la estructura del sitio y el rendimiento del servidor:
- Páginas rastreables: El volumen total de URLs que requieren indexación.
- Intervalo de actualización promedio: El periodo de tiempo estimado en el que cambia el contenido, expresado en "días", "semanas" o "meses".
- Tiempo medio de respuesta (ms): El tiempo de latencia del servidor en milisegundos.
- Capacidad del servidor (requests/second): El rendimiento máximo del servidor medido en peticiones por segundo.
- Capacidad disponible para rastreadores (%): La fracción del rendimiento total del servidor que se decide destinar a los motores de búsqueda, evitando interferir con los usuarios reales.
- Simultaneidad permitida del rastreador: El límite de conexiones simultáneas que el rastreador puede establecer.
- Multiplicador de demanda: Un factor de ajuste (por defecto 1.2) que compensa las ineficiencias y las visitas repetidas de los rastreadores.
- Utilización segura (%): Un margen de seguridad (por defecto 70%) para evitar que el servidor funcione al límite de su capacidad operativa.
Reglas de cálculo y validación de datos
Para que el estimador genere un resultado, todos los campos de entrada deben estar completados. Si falta algún dato, la interfaz mostrará el mensaje "Complete cada entrada para calcular la estimación.".
Los valores introducidos deben cumplir las siguientes condiciones estrictas:
- Deben ser números finitos ordinarios dentro del rango admitido (el valor máximo permitido es 1e12). En caso contrario, se mostrará "Ingrese números finitos ordinarios dentro del rango admitido.".
- Cada valor debe ser estrictamente mayor que cero. Si se introduce un valor no positivo, se mostrará "Cada entrada debe ser mayor que cero.".
- Los campos porcentuales, como "Capacidad disponible para rastreadores (%)" y "Utilización segura (%)", no pueden superar el 100%. Si se excede este límite, se mostrará "Los supuestos de porcentaje no deben ser superiores a 100%.".
Fórmulas de cálculo aplicadas
El estimador procesa las variables introducidas utilizando dos fórmulas principales para determinar la viabilidad del rastreo:
1. Demanda de rastreo / día
La demanda diaria se calcula dividiendo el número total de páginas por el intervalo de actualización objetivo (convertido a días), y multiplicando el resultado por el factor de demanda:
Demanda de rastreo / día = ( Páginas rastreables / Intervalo de actualización en días ) × Multiplicador de demanda
2. Capacidad segura/día
La capacidad segura se determina identificando primero el cuello de botella físico del servidor (el menor valor entre el límite por tasa de solicitudes y el límite por simultaneidad y tiempo de respuesta) y aplicando después el porcentaje de utilización segura:
- Límite por tasa de solicitudes (solicitudes/día): Capacidad del servidor (requests/second) × (Capacidad disponible para rastreadores (%)) / 100 × 86400
- Límite por simultaneidad (solicitudes/día): ( 1000 / (Tiempo medio de respuesta (ms)) ) × Simultaneidad permitida del rastreador × 86400
La capacidad segura final aplica la reducción de seguridad al menor de estos dos límites:
Capacidad segura/día = min(Límite por tasa, Límite por simultaneidad) × (Utilización segura (%)) / 100
Interpretación de los resultados y cuellos de botella
Una vez procesados los datos, la herramienta devuelve las siguientes métricas de salida para el análisis técnico:
- Demanda de rastreo / día: El volumen de peticiones diarias necesarias para mantener el sitio actualizado.
- Capacidad segura/día: El número máximo de peticiones diarias que el servidor puede soportar de manera segura.
- Rastreos alcanzables estimados/día: El número real de rastreos que se prevé que ocurrirán, limitado por el menor valor entre la demanda y la capacidad segura.
- Demanda cubierta: El porcentaje de la demanda de rastreo que la capacidad segura es capaz de asumir (visualmente limitado a un rango de 0–100%).
- Días para cubrir todas las páginas.: El tiempo necesario para que el rastreador complete la lectura de todo el sitio bajo las condiciones simuladas.
- Cuello de botella de capacidad: Identifica qué factor limita el rendimiento del servidor, mostrando "Tarifa de solicitud disponible" o "Simultaneidad y tiempo de respuesta.".
Estados de cobertura
Dependiendo del porcentaje de "Demanda cubierta", la herramienta mostrará uno de los siguientes estados de diagnóstico:
- Si la cobertura es inferior al 100%: "La demanda modelada está por encima de la estimación de capacidad segura.".
- Si la cobertura es igual o superior al 100%: "La estimación de capacidad segura cubre la demanda modelada.".
Privacidad de los datos
Las suposiciones sobre su sitio y servidor se calculan en su navegador. No se carga nada en BroBroGo. El procesamiento de los datos se realiza de manera local en el dispositivo del usuario, garantizando que los parámetros de infraestructura y volumen de páginas no se transmitan ni se almacenen en servidores externos.
Preguntas frecuentes
¿Esto predice con qué frecuencia Googlebot rastreará mi sitio?
No. Los motores de búsqueda establecen la demanda y la capacidad de rastreo a partir de señales que no son completamente públicas. Esta estimación es para planificación y comparación; calibrelo con registros del servidor e informes de rastreo.
¿Cómo se calcula la estimación?
La demanda diaria es el recuento de páginas dividido por el intervalo de actualización objetivo y luego multiplicado por el factor de demanda. La capacidad segura es el menor entre los límites de tasa de solicitudes y simultaneidad, reducido por la utilización de seguridad.
¿Qué significa que el cuello de botella sea "Simultaneidad y tiempo de respuesta."?
Significa que la velocidad con la que el servidor responde a las conexiones individuales o el número de conexiones paralelas permitidas está limitando la capacidad de rastreo diario antes de que se alcance el límite total de solicitudes por segundo del servidor. Optimizar el tiempo de respuesta (reducir los milisegundos) o permitir una mayor simultaneidad resolvería este cuello de botella.
¿Por qué la demanda cubierta se limita al 100%?
Porque representa la proporción de la demanda modelada que el servidor puede atender de forma segura. Aunque la capacidad del servidor sea muy superior a la demanda, no se puede cubrir más del 100% de las necesidades de rastreo definidas en el modelo.