Ang pamamahala sa crawl budget ay isang mahalagang bahagi ng teknikal na SEO at pagpapanatili ng website. Ang "Tantiya ng Crawl Budget ng Robot" ay isang tool na idinisenyo upang tulungan ang mga technical SEO at mga tagapamahala ng site na tantiyahin kung ilang pahina ang ligtas na makakayanan ng server ng isang website para sa pag-crawl bawat araw, at ihambing ito sa tinantyang pang-araw-araw na demand sa pag-crawl. Sa pamamagitan ng pag-adjust sa iba't ibang pagpapalagay sa site at server, mas madaling mauunawaan ang mga potensyal na bottleneck at ang saklaw ng pag-crawl.
Pag-unawa sa Crawl Budget at Kahalagahan Nito
Ang crawl budget ay tumutukoy sa dami ng mga pahina na pinipili ng mga search engine crawler na i-crawl sa isang website sa loob ng isang partikular na panahon. Ang pag-unawa sa konseptong ito ay kritikal dahil kung ang isang site ay may libu-libong pahina ngunit limitado ang kapasidad ng server o mababa ang priyoridad ng pag-crawl, maaaring hindi ma-index ang mga mahahalagang bagong nilalaman o mga update. Ang tool na ito ay nagbibigay ng paraan upang masuri kung ang kasalukuyang imprastraktura ng server ay sapat para sa laki at dalas ng pagbabago ng mga pahina sa site.
Mga Salik na Nakaaapekto sa Demand at Kapasidad
Ang kabuuang crawl budget ay naiimpluwensyahan ng dalawang pangunahing aspeto: ang demand ng site at ang kapasidad ng server.
- Demand ng Site: Ito ay nakabatay sa kabuuang bilang ng mga pahina at kung gaano kadalas nagbabago ang mga ito. Ang mga site na madalas mag-update ay nangangailangan ng mas mataas na dalas ng pag-crawl upang mapanatiling sariwa ang index ng mga search engine.
- Kapasidad ng Server: Ito ay tinutukoy ng bilis ng pagtugon ng server, ang kabuuang dami ng mga kahilingan (requests) na kaya nitong iproseso bawat segundo, at ang dami ng sabay-sabay na koneksyon (concurrency) na pinapayagan para sa mga crawler nang hindi naaapektuhan ang karanasan ng mga totoong gumagamit.
Pagkalkula ng Pang-araw-araw na Demand sa Pag-crawl
Upang makuha ang "Demand ng pag-crawl / araw", ginagamit ng tool ang mga sumusunod na input sa ilalim ng seksyong "Demand ng site":
- Mga page na na-crawl: Ang kabuuang bilang ng mga pahina sa site.
- Average na agwat ng pag-update: Ang dalas ng pagbabago ng nilalaman, na may "I-update ang unit ng interval" na maaaring itakda sa "araw", "linggo", o "buwan".
- Demand multiplier: Isang salik (default na halaga ay 1.2) na nagbibigay ng allowance para sa karagdagang pag-crawl na lampas sa simpleng pag-update ng pahina.
Ang pormula para sa pang-araw-araw na demand ay: Daily Demand = ( Bilang ng Pahina / (Target na Agwat ng Pag-update) ) × Demand Multiplier
Pagsusuri sa Kapasidad ng Server para sa Pag-crawl
Para sa "Mga pagpapalagay sa kapasidad ng server", kinakailangan ang mga sumusunod na teknikal na detalye:
- Average na oras ng pagtugon (ms): Ang bilis ng pagtugon ng server sa bawat kahilingan sa loob ng milliseconds.
- Kapasidad ng server (requests/second): Ang kabuuang rate ng kahilingan na kayang hawakan ng server.
- Available ang kapasidad sa mga crawler (%): Ang porsyento ng kabuuang kapasidad ng server na inilalaan para sa mga search engine bot.
- Pinapayagan ang crawler concurrency: Ang maximum na bilang ng sabay-sabay na koneksyon na pinapayagan para sa crawler.
- Ligtas na paggamit (%) (Safe utilization): Ang porsyento ng inilaang kapasidad na ligtas gamitin (default na halaga ay 70%) upang maiwasan ang labis na karga sa server.
Ang "Ligtas na kapasidad / araw" ay kinakalkula bilang ang mas mababa sa rate ng kahilingan (request-rate limit) at mga limitasyon ng concurrency, na nababawasan ng paggamit ng kaligtasan.
Pagtukoy sa mga Bottleneck sa Pag-crawl
Depende sa mga inilagay na teknikal na limitasyon, tutukuyin ng tool kung ano ang naglilimita sa kakayahan ng server na ma-crawl. Ang "Ang bottleneck ng kapasidad" ay maaaring maging isa sa mga sumusunod:
- Magagamit na rate ng kahilingan: Nangyayari kapag ang kabuuang limitasyon ng requests bawat segundo ng server ang pangunahing naglilimita sa pag-crawl.
- Concurrency at oras ng pagtugon: Nangyayari kapag ang mabagal na tugon ng server o ang mababang limitasyon sa sabay-sabay na koneksyon ang nagiging sanhi ng pagkaantala.
Kung ang "Saklaw ang demand" ay mas mababa sa 100%, ang ipapakitang status ay "Ang modelong demand ay higit sa tinantyang ligtas na kapasidad.". Kung ito naman ay 100% o higit pa, ang ipapakitang status ay "Ang pagtatantya ng ligtas na kapasidad ay sumasaklaw sa modelong demand.". Ang output para sa "Saklaw ang demand" ay may limitasyon sa visual na hanay na 0–100%.
Mga Panuntunan sa Paggamit at Pagproseso ng Datos
Upang gumana ang estimator, dapat makumpleto ang lahat ng mga input field. Ang mga sumusunod na panuntunan sa pagpapatunay ay ipinapatupad:
- Kung may kulang na field, ipapakita ang error: "Kumpletuhin ang bawat input upang kalkulahin ang pagtatantya.".
- Ang lahat ng input ay dapat na ordinaryong may hangganang numero na hindi hihigit sa 1e12. Kung hindi, ipapakita ang error: "Ipasok ang mga ordinaryong may hangganang numero sa loob ng sinusuportahang hanay.".
- Ang bawat input ay dapat na mas malaki sa zero. Kung may zero o negatibong halaga, ipapakita ang error: "Ang bawat input ay dapat na mas malaki kaysa sa zero.".
- Ang mga porsyento tulad ng "Available ang kapasidad sa mga crawler (%)" at "Ligtas na paggamit (%)" ay hindi dapat lumampas sa 100%. Kung lumampas, ipapakita ang error: "Ang mga pagpapalagay ng porsyento ay dapat na hindi hihigit sa 100%.".
Ang lahat ng kalkulasyon ay lokal na pinoproseso. Ang mga pagpapalagay ng iyong site at server ay kinakalkula sa iyong browser, at walang anumang datos na na-upload sa BroBroGo.
Mga Madalas Itanong (FAQ)
Hinulaan ba nito kung gaano kadalas iko-crawl ni Googlebot ang aking site? Hindi. Ang mga search engine ay nagtatakda ng pangangailangan sa pag-crawl at kapasidad mula sa mga signal na hindi ganap na pampubliko. Ang pagtatantya na ito ay para sa pagpaplano at paghahambing; i-calibrate ito gamit ang mga log ng server at mga ulat sa pag-crawl.
Paano kinakalkula ang pagtatantya? Ang pang-araw-araw na demand ay bilang ng pahina na hinati sa target na agwat ng pag-update, pagkatapos ay i-multiply sa salik ng demand. Ang ligtas na kapasidad ay ang mas mababa sa rate ng kahilingan at mga limitasyon ng concurrency, na nababawasan ng paggamit ng kaligtasan.
Ano ang pagkakaiba ng pagtatantya ng crawl budget sa aktwal na gawi ng search engine? Isa itong pagtatantya sa pagpaplano, hindi isang pangako sa search-engine. Ang pag-crawl ay hindi ginagarantiyahan ang pag-index, at ang tunay na mga rate ng pag-crawl ay nakasalalay din sa halaga ng nilalaman, mga error, demand at patakaran ng crawler.
Ano ang ibig sabihin kapag ang bottleneck ay "Concurrency at oras ng pagtugon"? Ibig sabihin nito na kahit mataas ang kabuuang kapasidad ng server sa mga kahilingan bawat segundo, ang mabagal na tugon ng server (mataas na millisecond) o ang limitadong sabay-sabay na koneksyon (concurrency) ang nagiging pangunahing hadlang upang maabot ang mas mataas na bilang ng pag-crawl bawat araw.