Faili la robots.txt ni zana muhimu katika usimamizi wa tovuti inayoelekeza roboti za utafutaji (crawlers) kuhusu maeneo wanayoweza au wasiyoweza kufikia kwenye seva yako. Jenereta na Kikaguzi cha Robots.txt hukusaidia kuunda sheria hizi kwa usahihi na kujaribu kama njia fulani za tovuti yako zinaruhusiwa au zimezuiliwa kulingana na sheria ulizoweka.
Kazi ya Faili la Robots.txt na Maagizo ya User-agent
Faili la robots.txt huwekwa kwenye saraka kuu (root directory) ya tovuti ili kutoa maelekezo kwa roboti za utafutaji kabla hazijaanza kupakua kurasa. Maelekezo haya yanategemea dhana ya vikundi vya sheria vinavyoanza na tangazo la User-agent.
User-agent inataja jina la mtambaji maalum ambaye sheria zinazofuata zinamhusu. Unaweza kutumia alama ya * ili kuwakilisha watambaji wote kwa ujumla. Katika zana hii, sheria huanza na mpangilio wa chaguo-msingi wa User-agent: * na Disallow: /admin. Wakati wa kuingiza majina ya watambaji, jina la user-agent halipaswi kuwa na nafasi yoyote. Ikiwa jina lina nafasi, zana itaonyesha ujumbe wa kosa: "Weka jina moja la user-agent bila nafasi, au tumia * kwa watambaji wote.".
Sheria za Ruhusu (Allow) na Zuia (Disallow)
Ndani ya kila kikundi cha user-agent, unaweza kuongeza sheria mbili kuu za njia:
- Zuia (Disallow): Inamzuia mtambaji asitembelee njia maalum au saraka.
- Ruhusu (Allow): Inamruhusu mtambaji kufikia njia maalum, ambayo mara nyingi inakuwa ndani ya saraka iliyozuiwa.
Njia zote za sheria lazima zianze na alama ya / na haziwezi kuwa na nafasi. Ikiwa sheria haifuati utaratibu huu, mfumo utatoa onyo: "Njia za sheria lazima zianze na / na haziwezi kuwa na nafasi.".
Alama ya $ inaweza kutumika kuashiria mwisho wa njia (kwa mfano, kuzuia faili zinazoishia na kiambishi maalum pekee). Alama hii inaruhusiwa tu mwishoni mwa njia ya sheria. Ikitumika katikati, zana itaonyesha kosa: "Tumia $ mwishoni mwa njia ya sheria pekee.".
Jinsi Google Inavyolinganisha na Kutatua Migongano ya Sheria
Wakati mtambaji wa Google (Googlebot) anaposoma faili la robots.txt, anafuata sheria maalum za ulinganishaji ili kuamua kama njia inaruhusiwa au la:
- Urefu wa Njia Ndiyo Unaoshinda: Google hufuata mpangilio wa ulinganishaji ambapo njia ndefu zaidi inayolingana ndiyo inayoshinda. Kwa mfano, sheria ya
Allow: /picha/asili/ina nguvu zaidi kulikoDisallow: /picha/kwa sababu ina herufi nyingi zaidi na ni maalum zaidi. - Umaalum Sawa: Ikiwa sheria zinazolingana za Ruhusu (Allow) na Zuia (Disallow) zina umaalum sawa (yaani zina urefu sawa wa herufi), sheria ya Ruhusu (Allow) ndiyo inayoshinda.
- Hakuna Sheria Inayolingana: Ikiwa hakuna sheria yoyote inayolingana na njia iliyojaribiwa, Google inaruhusu njia hiyo kwa chaguo-msingi.
Umuhimu wa URL za Sitemap
Sitemap ni faili linaloorodhesha kurasa muhimu za tovuti yako ili kusaidia watambaji kuzipata na kuziorodhesha kwa urahisi. Ni muhimu kujumuisha URL ya sitemap ndani ya robots.txt yako ili watambaji wote waione kwa urahisi.
URL za sitemap lazima ziwe anwani kamili zinazoanza na http:// au https://. Ikiwa utaingiza URL isiyo kamili, zana itaashiria kosa hili kwa ujumbe: "URL za sitemap zinahitaji anwani kamili ya http:// au https://.".
Makosa ya Kawaida na Ukaguzi wa Sheria
Wakati wa kuunda faili la robots.txt, makosa ya kisintaksia au ya kimantiki yanaweza kutokea. Zana hii inakagua sheria zako na kuonyesha idadi ya masuala kupitia ujumbe "Kuna vipengele {count} vya kukagua." au "Hakuna migongano ya sintaksia au sheria iliyopatikana." ikiwa kila kitu kiko sawa.
Makosa ya kawaida yanayokaguliwa ni pamoja na:
- Sheria zilizorudiwa: Ikiwa sheria inajirudia kwa user-agent yuleyule, mfumo utaonyesha: "Sheria hii imerudiwa kwa user-agent huyo huyo.".
- Migongano ya njia sawa: Ikiwa sheria za Ruhusu na Zuia zinatumia njia sawa kabisa, utaona onyo: "Ruhusu (Allow) na Zuia (Disallow) zinatumia njia sawa. Google hutumia Ruhusu wakati zote mbili zina umaalum sawa.".
- Vikundi vilivyotawanyika vya user-agent yuleyule: Ikiwa utataja user-agent yuleyule katika vikundi tofauti, zana itaonya: "Google huunganisha vikundi vinavyotaja user-agent yuleyule.".
- Ukubwa wa faili: Ikiwa robots.txt iliyozalishwa inazidi herufi 100,000, zana itaacha kukagua na kuonyesha: "Robots.txt hii ni kubwa mno kukaguliwa hapa.".
Vikwazo vya Robots.txt katika Uorodheshaji wa Google
Ni muhimu kuelewa kuwa robots.txt si zana ya kuzuia ukurasa usionekane kabisa kwenye matokeo ya utafutaji ya Google.
Ukurasa uliozuiliwa kupitia amri ya Disallow bado unaweza kuonekana kwenye matokeo ya utafutaji ikiwa kurasa zingine kwenye mtandao zinauunganisha (backlinks). Faili la robots.txt linazuia tu watambaji wasipakue maudhui ya ukurasa huo, lakini halizuii uorodheshaji wa anwani yake ya URL. Ili kuzuia ukurasa usionekane kabisa kwenye injini za utafutaji, lazima utumie mbinu zingine kama vile lebo ya noindex, mifumo ya kudhibiti ufikiaji (kama nenosiri), au kuuondoa ukurasa huo kabisa kwenye seva yako. Zana hii haikagui uwepo wa noindex, mifumo ya kudhibiti ufikiaji, au uondoshaji wa kurasa.
Usalama wa Data na Uchakataji
Sheria zako zote za utambaji zinaundwa na kukaguliwa kwenye kivinjari chako. Hakuna data au sheria yoyote inayopakiwa kwenye seva za BroBroGo, hivyo mchakato mzima unafanyika ndani ya kifaa chako.
Maswali Yanayoulizwa Mara kwa Mara (FAQ)
Je, jenereta hii inaweza kuongeza nini kwenye robots.txt?
Ongeza kikundi cha user-agent, njia za Ruhusu na Zuia, na URL moja au zaidi za sitemap. Uhakiki uko tayari kunakiliwa kwenye faili ya robots.txt.
Je, kikaguzi cha njia kinachaguaje sheria?
Inafuata mpangilio wa ulinganishaji wa Google: njia ndefu zaidi inayolingana ndiyo inayoshinda. Ikiwa sheria zinazolingana za Ruhusu na Zuia zina umaalum sawa, Ruhusu inashinda.
Je, Zuia (Disallow) inaondoa ukurasa kwenye Google Search?
Hapana. Ukurasa uliozuiliwa bado unaweza kuonekana kwenye matokeo ya utafutaji wakati kurasa zingine zinauunganisha. Tumia noindex, udhibiti wa ufikiaji, au uondoe ukurasa kabisa wakati unahitaji uwekwe mbali na utafutaji.