Crawlbudget en de impact op website-indexering
Het crawlbudget is een cruciale factor voor de vindbaarheid van grote websites. Zoekmachines hebben geen oneindige bronnen en verdelen hun aandacht op basis van de efficiëntie en de structuur van een server. Wanneer een website groeit, ontstaat de noodzaak om te berekenen of de server de intensiteit van zoekmachine-crawlers kan verwerken zonder dat de prestaties voor menselijke bezoekers in gevaar komen.
De Robots Crawlen Budgetschatter helpt technische SEO-specialisten en sitebeheerders om deze dynamiek in kaart te brengen. De tool vergelijkt de geschatte dagelijkse crawlvraag van een website met de veilige capaciteit die de server kan bieden. Door parameters zoals responstijd, servercapaciteit en update-intervallen te analyseren, worden potentiële knelpunten zichtbaar voordat ze de indexering van belangrijke pagina's belemmeren.
Factoren die crawlvraag en servercapaciteit beïnvloeden
De frequentie waarmee een crawler een website bezoekt, is afhankelijk van twee hoofdfactoren: de crawlvraag (hoe vaak moet de site gecrawld worden om up-to-date te blijven) en de servercapaciteit (hoeveel verzoeken kan de server veilig verwerken).
De crawlvraag stijgt naarmate een website meer pagina's bevat en deze pagina's vaker worden bijgewerkt. Aan de andere kant wordt de servercapaciteit beperkt door de hardware, de database-efficiëntie en de bandbreedte. Crawlers proberen de server niet te overbelasten. Als een server traag reageert of foutmeldingen geeft, zullen zoekmachines hun crawlsnelheid automatisch verlagen om de gebruikerservaring van echte bezoekers te beschermen.
Het berekenen van de dagelijkse crawlvraag
Om te bepalen hoeveel crawls per dag nodig zijn om een website actueel te houden, kijkt de schatter naar de omvang van de site en de vernieuwingsfrequentie. De berekening gebruikt de volgende invoergegevens:
- Crawlbare pagina's: Het totale aantal unieke URL's dat toegankelijk is voor crawlers.
- Gemiddeld update-interval: De frequentie waarmee pagina's gemiddeld worden bijgewerkt, instelbaar in de eenheden "dagen", "weken" of "maanden".
- Vraagvermenigvuldiger: Een factor (standaard ingesteld op 1.2) die rekening houdt met extra crawls, zoals het herhaaldelijk bezoeken van belangrijke pagina's of foutieve pogingen.
De formule voor de dagelijkse crawlvraag luidt:
Dagelijkse vraag = ( Aantal pagina's / (Target update-interval) ) × Vraagvermenigvuldiger
Als een website bijvoorbeeld 10.000 pagina's heeft die gemiddeld elke 10 dagen worden bijgewerkt, met een vraagvermenigvuldiger van 1.2, dan is de dagelijkse crawlvraag:
(10.000 ÷ 10) × 1.2 = 1.200 crawls per dag
Servercapaciteit voor crawlers beoordelen
De servercapaciteit bepaalt de grens van wat technisch haalbaar is zonder dat de server overbelast raakt. De schatter gebruikt hiervoor de volgende variabelen:
- Gemiddelde responstijd (ms): De tijd in milliseconden die de server nodig heeft om een pagina te laden.
- Servercapaciteit (requests/second): Het maximale aantal verzoeken dat de server per seconde kan verwerken.
- Capaciteit beschikbaar voor crawlers (%): Het percentage van de totale servercapaciteit dat mag worden toegewezen aan zoekmachines.
- Toegestane gelijktijdigheid van crawlers: Het aantal parallelle connecties dat crawlers tegelijkertijd mogen openen.
- Veilig gebruik (%): Een veiligheidsmarge (standaard 70%) om te voorkomen dat de server bezwijkt onder piekbelasting.
De veilige capaciteit per dag wordt berekend als de laagste waarde van twee limieten: de limiet op basis van de verzoeksnelheid (request-rate) en de limiet op basis van gelijktijdigheid (concurrency) in combinatie met de responstijd. Deze laagste waarde wordt vervolgens verminderd met het veiligheidsgebruik.
Knelpunten in de crawlbaarheid identificeren
Wanneer de berekening is voltooid, geeft de tool aan waar de bottleneck van de server ligt. Dit wordt weergegeven als de Knelpunt in de capaciteit, met twee mogelijke uitkomsten:
- Beschikbaar aanvraagtarief: De server loopt vast op het maximale aantal verzoeken per seconde dat is toegewezen aan crawlers.
- Gelijktijdigheid en responstijd: De server wordt beperkt doordat de responstijd te hoog is in combinatie met het aantal toegestane parallelle connecties.
Als de responstijd van een server bijvoorbeeld erg hoog is, kunnen crawlers zelfs met een hoge toegestane gelijktijdigheid niet genoeg pagina's per seconde downloaden om de capaciteit volledig te benutten. Het optimaliseren van de laadtijd van pagina's is in dat geval de meest effectieve manier om de crawlcapaciteit te vergroten.
De rol van de vraagvermenigvuldiger en veilig gebruik
In een ideale situatie zou elke pagina precies één keer per update-interval worden gecrawld. In de praktijk bezoeken zoekmachines bepaalde pagina's (zoals de homepage of belangrijke categoriepagina's) veel vaker. De Vraagvermenigvuldiger vangt dit gedrag op door de theoretische vraag te verhogen.
Het Veilig gebruik (%) zorgt ervoor dat er altijd voldoende serverbronnen overblijven voor menselijke bezoekers. Een server die constant op 100% van zijn capaciteit draait door crawler-verkeer, zal traag reageren op echte gebruikers of zelfs offline gaan. Een standaardwaarde van 70% biedt een veilige buffer voor onverwachte verkeerspieken.
Gebruik van de schatting in de praktijk
De resultaten van de schatter helpen bij het maken van strategische beslissingen over de sitestructuur en serverinfrastructuur. De tool toont de volgende resultaten:
- Crawlvraag/dag: Het aantal benodigde dagelijkse crawls.
- Veilige capaciteit / dag: Het aantal crawls dat de server veilig kan verwerken.
- Geschatte haalbare crawls/dag: De werkelijke limiet van wat de server kan leveren.
- De vraag gedekt: Het percentage van de crawlvraag dat binnen de veilige capaciteit valt (visueel begrensd tussen 0% en 100%).
- Dagen om alle pagina's te bedekken: De tijd die nodig is om de volledige site te crawlen op basis van de haalbare capaciteit.
Als de gedekte vraag minder dan 100% is, toont de tool de status: "De gemodelleerde vraag ligt boven de schatting van de veilige capaciteit." Bij een dekking van 100% of meer verschijnt de status: "De schatting van de veilige capaciteit dekt de gemodelleerde vraag."
Privacy en gegevensverwerking
Bij het gebruik van de Robots Crawlen Budgetschatter hoeft u zich geen zorgen te maken over de vertrouwelijkheid van uw servergegevens. Alle berekeningen en invoerwaarden worden lokaal in uw eigen webbrowser verwerkt. Er worden geen gegevens geüpload naar de servers van BroBroGo.
Veelgestelde vragen
Voorspelt dit hoe vaak Googlebot mijn site zal crawlen?
Nee. Zoekmachines bepalen de crawlvraag en -capaciteit op basis van signalen die niet volledig openbaar zijn. Deze schatting is bedoeld voor planning en vergelijking; kalibreer het met serverlogboeken en crawlrapporten.
Hoe wordt de schatting berekend?
De dagelijkse vraag is het aantal pagina's gedeeld door het beoogde update-interval en vervolgens vermenigvuldigd met de vraagfactor. Veilige capaciteit is de laagste van de verzoeksnelheid- en gelijktijdigheidslimieten, verminderd met het veiligheidsgebruik.
Wat betekenen de invoerfouten in de tool?
De tool hanteert strikte regels voor een betrouwbare berekening:
- Voltooi elke invoer om de schatting te berekenen.: Verschijnt als een van de velden leeg is gelaten.
- Voer gewone eindige getallen in binnen het ondersteunde bereik.: Dit betekent dat getallen niet groter mogen zijn dan 1e12.
- Elke invoer moet groter zijn dan nul.: Negatieve getallen of nulwaarden zijn niet toegestaan.
- Percentageaannames mogen niet meer zijn dan 100%.: Dit geldt voor de velden "Capaciteit beschikbaar voor crawlers (%)" en "Veilig gebruik (%)".
Is een crawlbudgetschatting hetzelfde als een garantie voor indexering?
Nee. Dit is een planningsschatting, geen belofte voor zoekmachines. Crawlen garandeert geen indexering, en de werkelijke crawlsnelheid is ook afhankelijk van de inhoudswaarde, fouten, vraag en crawlerbeleid.