Funktionsweise des Robots Crawl Budget Estimate
Der Robots Crawl Budget Estimate ist ein Werkzeug zur Kapazitätsplanung für technische SEO-Spezialisten und Website-Betreiber. Das Tool berechnet, wie viele Seiten der Server einer Website täglich sicher für das Crawling verarbeiten kann, und stellt diesen Wert dem geschätzten täglichen Crawl-Bedarf der Website gegenüber. Durch die Anpassung verschiedener Website- und Serverparameter lässt sich ermitteln, wie sich Änderungen auf die Crawling-Schätzungen auswirken, um potenzielle Engpässe und die Abdeckung der Seitenstruktur zu analysieren.
Die Berechnung erfolgt vollständig lokal: Ihre Standort- und Serverannahmen werden in Ihrem Browser berechnet, und es wird nichts auf BroBroGo hochgeladen.
Eingabeparameter und Anforderungen
Für eine präzise Schätzung benötigt das Tool spezifische Angaben zur Website-Struktur und zur Server-Infrastruktur. Alle Eingabefelder müssen vollständig ausgefüllt sein, um die Berechnung durchzuführen. Es gelten folgende Validierungsregeln für die Eingaben:
- Fehlende Werte: Sollten nicht alle Felder ausgefüllt sein, erscheint die Meldung „Vervollständigen Sie alle Eingaben, um die Schätzung zu berechnen.“.
- Zahlenformat: Es müssen gewöhnliche endliche Zahlen eingegeben werden. Ungültige Werte führen zur Fehlermeldung „Geben Sie gewöhnliche endliche Zahlen innerhalb des unterstützten Bereichs ein.“. Der maximal zulässige Eingabewert für Zahlen liegt bei 1e12.
- Wertebereich: Jede Eingabe muss größer als Null sein. Bei Verstößen wird die Meldung „Jede Eingabe muss größer als Null sein.“ ausgegeben.
- Prozentuale Grenzen: Prozentuale Annahmen dürfen nicht mehr als 100% betragen. Andernfalls zeigt das Tool den Fehler „Die prozentualen Annahmen dürfen nicht mehr als 100% betragen.“ an.
Die Eingabefelder im Detail:
- Crawlbare Seiten: Die Gesamtzahl der URLs auf der Website, die für Suchmaschinen-Crawler zugänglich sind.
- Durchschnittliches Aktualisierungsintervall: Die Frequenz, in der die Inhalte der Website im Schnitt aktualisiert werden. Als Einheit kann hierbei zwischen „Tage“, „Wochen“ oder „Monate“ gewählt werden.
- Durchschnittliche Antwortzeit (ms): Die Zeitspanne in Millisekunden, die der Server benötigt, um auf eine Crawler-Anfrage zu antworten.
- Serverkapazität (requests/second): Die maximale Anzahl an Anfragen, die der Server pro Sekunde verarbeiten kann.
- Für Crawler verfügbare Kapazität (%): Der prozentuale Anteil der gesamten Serverkapazität, der für das Crawling freigegeben werden soll, ohne den regulären Nutzerverkehr zu beeinträchtigen.
- Zulässige Crawler-Parallelität: Die maximale Anzahl gleichzeitiger Verbindungen (Concurrency), die ein Crawler zum Server aufbauen darf.
- Nachfragemultiplikator: Ein Faktor (Standardwert: 1.2), der zusätzliche Crawl-Anforderungen (wie das erneute Crawlen geänderter Ressourcen oder fehlerhafter Anfragen) im Modell berücksichtigt.
- Sichere Nutzung (%): Der Sicherheitsfaktor (Standardwert: 70%), der sicherstellt, dass der Server nicht unter Volllast läuft und Puffer für Lastspitzen behält.
Berechnungsgrundlagen und Formeln
Die Schätzungen des Tools basieren auf zwei mathematischen Säulen: dem täglichen Crawl-Bedarf und der sicheren Serverkapazität.
1. Crawl-Nachfrage/Tag
Die tägliche Nachfrage beschreibt, wie viele Crawls pro Tag theoretisch nötig sind, um alle Seiten innerhalb des gewünschten Aktualisierungsintervalls zu erfassen. Die Formel lautet:
Crawl-Nachfrage/Tag = ( Crawlbare Seiten / Aktualisierungsintervall in Tagen ) × Nachfragemultiplikator
2. Sichere Kapazität / Tag
Die sichere Kapazität bestimmt, wie viele Anfragen der Server unter Berücksichtigung der Sicherheitsgrenzen täglich verarbeiten kann. Sie ist als der niedrigere Wert aus zwei unterschiedlichen Limitierungen definiert – dem reinen Durchsatzlimit (Anforderungsrate) und dem Verbindungslimit (Parallelität in Kombination mit der Antwortzeit) –, reduziert um die Sicherheitsauslastung:
- Limit der Anforderungsrate: Serverkapazität (requests/second) × ( (Für Crawler verfügbare Kapazität (%)) / 100 ) × 86400 Sekunden/Tag
- Limit der Parallelität: ( (Zulässige Crawler-Parallelität) / (Durchschnittliche Antwortzeit (ms) / 1000) ) × 86400 Sekunden/Tag
Der kleinere dieser beiden Werte wird mit dem Faktor für die sichere Nutzung multipliziert:
Sichere Kapazität / Tag = min(Limit Anforderungsrate, Limit Parallelität) × ( (Sichere Nutzung (%)) / 100 )
Ausgabe und Interpretation der Ergebnisse
Nach der Berechnung gibt das Tool verschiedene Kennzahlen aus, die Aufschluss über die Crawling-Effizienz geben:
- Crawl-Nachfrage/Tag: Das berechnete tägliche Soll-Volumen an Crawls.
- Sichere Kapazität / Tag: Das serverschonende maximale Ist-Volumen an täglichen Crawls.
- Geschätzte erreichbare Crawls pro Tag: Die Anzahl der Crawls, die unter den gegebenen Bedingungen tatsächlich realisiert werden können.
- Bedarf gedeckt: Das prozentuale Verhältnis zwischen der sicheren Kapazität und der Nachfrage, visuell begrenzt auf einen Bereich von 0–100%.
- Liegt dieser Wert unter 100%, zeigt das Tool den Status: „Der modellierte Bedarf liegt über der sicheren Kapazitätsschätzung.“.
- Erreicht oder überschreitet der Wert 100%, lautet der Status: „Die sichere Kapazitätsschätzung deckt den modellierten Bedarf ab.“.
- Tage, um alle Seiten abzudecken: Die prognostizierte Dauer, bis der Crawler den gesamten Seitenbestand einmal vollständig erfasst hat.
- Kapazitätsengpass: Zeigt an, welcher Faktor die Kapazität limitiert. Das Tool unterscheidet hierbei zwischen:
- „Verfügbarer Anfragepreis“ (wenn die Anforderungsrate pro Sekunde der begrenzende Faktor ist).
- „Parallelität und Reaktionszeit“ (wenn die Anzahl gleichzeitiger Verbindungen und die Serverantwortzeit das Nadelöhr bilden).
Analyse von Kapazitätsengpässen
Die Identifikation des Kapazitätsengpasses hilft Webmastern bei der gezielten Optimierung der Server-Infrastruktur.
Wenn der Engpass bei Parallelität und Reaktionszeit liegt, nützt eine Erhöhung der reinen Serverbandbreite wenig. In diesem Fall müssen entweder die Antwortzeiten des Servers verkürzt (z. B. durch Caching oder Datenbankoptimierung) oder die zulässigen parallelen Verbindungen für den Crawler erhöht werden.
Liegt der Engpass hingegen beim Verfügbaren Anfragepreis, ist die zugewiesene Bandbreite oder der für Crawler reservierte prozentuale Anteil der Serverleistung der limitierende Faktor. Hier kann eine Erhöhung der Serverkapazität oder eine großzügigere Freigabe der Ressourcen für Suchmaschinen Abhilfe schaffen.
Häufig gestellte Fragen (FAQ)
Lässt sich dadurch vorhersagen, wie oft Googlebot meine Website crawlen wird?
Nein. Suchmaschinen legen die Crawling-Nachfrage und -Kapazität anhand von Signalen fest, die nicht vollständig öffentlich sind. Diese Schätzung dient der Planung und dem Vergleich; Kalibrieren Sie es mit Serverprotokollen und Crawling-Berichten.
Wie wird der Kostenvoranschlag berechnet?
Der tägliche Bedarf ist die Seitenzahl dividiert durch das angestrebte Aktualisierungsintervall und dann multipliziert mit dem Bedarfsfaktor. Die sichere Kapazität ist die niedrigere der Grenzwerte für Anforderungsrate und Parallelität, reduziert um die Sicherheitsauslastung.
Welche Rolle spielen der Nachfragemultiplikator und die sichere Nutzung bei der Planung?
Der Nachfragemultiplikator fängt zusätzliche, unvorhergesehene Crawl-Anfragen ab, da Crawler selten nur die reine Netto-Seitenzahl einmalig aufrufen. Die sichere Nutzung stellt sicher, dass der Server durch das Crawling nicht überlastet wird und genügend Ressourcen für echte menschliche Besucher frei bleiben.
Garantiert ein optimiertes Crawl-Budget eine bessere Indexierung?
Nein. Hierbei handelt es sich um eine Planungsschätzung, nicht um ein Suchmaschinenversprechen. Crawling garantiert keine Indizierung und die tatsächlichen Crawling-Raten hängen auch vom Inhaltswert, Fehlern, der Nachfrage und den Crawler-Richtlinien ab.