Robots.txt फाईलचे उद्दिष्ट आणि कार्यप्रणाली
Robots.txt ही कोणत्याही वेबसाईटच्या रूट डिरेक्टरीमध्ये ठेवली जाणारी एक महत्त्वाची टेक्स्ट फाईल आहे. या फाईलचा मुख्य उद्देश गुगलचा Googlebot सारख्या वेब क्रॉलर्सना वेबसाईटच्या कोणत्या भागांचे क्रॉलिंग करावे आणि कोणत्या भागांचे करू नये, याचे निर्देश देणे हा आहे.
वेबसाईटचे व्यवस्थापक, डेव्हलपर्स आणि क्रॉलर्सना विशिष्ट भागांमध्ये प्रवेश करण्यापासून रोखू इच्छिणाऱ्या युझर्ससाठी हे नियंत्रण अत्यंत आवश्यक असते. योग्य नियमांमुळे महत्त्वाचे पेजेस क्रॉलर्सपासून चुकून ब्लॉक होत नाहीत आणि वेबसाईटचे क्रॉल बजेट कार्यक्षमतेने वापरले जाते.
User-agent निर्देश आणि क्रॉलर नियंत्रण
Robots.txt फाईलमध्ये 'युझर-एजंट' हा निर्देश अत्यंत महत्त्वाचा आहे. हा निर्देश विशिष्ट क्रॉलरचे नाव दर्शवतो ज्याला पुढील नियम लागू होतात.
- सर्व क्रॉलर्ससाठी नियम: जर सर्व क्रॉलर्सना एकच नियम लागू करायचा असेल, तर
*या चिन्हाचा वापर केला जातो. - विशिष्ट क्रॉलरसाठी नियम: विशिष्ट क्रॉलरसाठी (उदा. Googlebot) त्याचे नाव प्रविष्ट केले जाते. युझर-एजंटच्या नावामध्ये कोणतीही स्पेस (रिकामी जागा) नसावी. जर स्पेस असेल, तर हे साधन "स्पेसशिवाय एक युझर-एजंट नाव प्रविष्ट करा, किंवा सर्व क्रॉलर्ससाठी * वापरा." अशी त्रुटी दर्शवते.
हे साधन डीफॉल्टनुसार User-agent: * आणि Disallow: /admin या नियमांसह सुरू होते. जर एकाच युझर-एजंटचे नाव एकापेक्षा जास्त गटांमध्ये वापरले गेले, तर गुगल ते गट एकत्र करते. अशा वेळी हे साधन "Google एकाच युझर-एजंटचे नाव असणारे गट एकत्र करते." अशी चेतावणी दर्शवते.
Allow आणि Disallow नियमांमधील परस्पर संबंध
क्रॉलर्सना पाथवर प्रवेश देण्याकरिता किंवा रोखण्याकरिता प्रामुख्याने दोन नियम वापरले जातात:
- Allow (अनुमती द्या): क्रॉलरला विशिष्ट पाथ क्रॉल करण्याची परवानगी देतो.
- Disallow (अनुमती नाकारा): क्रॉलरला विशिष्ट पाथवर जाण्यापासून रोखतो.
या नियमांचे पाथ नेहमी / ने सुरू होणे आवश्यक आहे आणि त्यात कोणतीही स्पेस नसावी. नियम पाथच्या शेवटीच $ हे चिन्ह वापरता येते. नियमांमध्ये विसंगती असल्यास खालील त्रुटी किंवा चेतावणी संदेश दिसतात:
- जर नियम पाथ चुकीचा असेल, तर "नियम पाथ / ने सुरू होणे आवश्यक आहे आणि त्यात स्पेस नसावी." हा संदेश मिळतो.
- जर
$चिन्ह चुकीच्या ठिकाणी असेल, तर "नियम पाथच्या शेवटीच $ वापरा." हा संदेश दिसतो. - जर एकाच युझर-एजंटसाठी एकाच नियमाची पुनरावृत्ती झाली, तर "या नियमाची त्याच युझर-एजंटसाठी पुनरावृत्ती झाली आहे." हा संदेश येतो.
- जर Allow आणि Disallow दोन्ही नियम एकाच पाथसाठी वापरले गेले, तर "Allow आणि Disallow दोन्ही एकाच पाथचा वापर करत आहेत. दोन्ही तितकेच विशिष्ट असल्यास Google 'Allow' लागू करते." हा संदेश मिळतो.
साइटमॅप URL चे महत्त्व
Robots.txt फाईलमध्ये साइटमॅप (Sitemap) URL समाविष्ट करणे अत्यंत गरजेचे आहे. यामुळे सर्च इंजिन क्रॉलर्सना वेबसाईटवरील सर्व उपलब्ध पेजेसची रचना सहज समजते.
साइटमॅप जोडताना त्याची URL ही संपूर्ण http:// किंवा https:// स्वरूपातील पत्ता असणे आवश्यक आहे. अपूर्ण किंवा चुकीची URL असल्यास हे साधन "साइटमॅप URL साठी संपूर्ण http:// or https:// पत्ता आवश्यक आहे." अशी त्रुटी दर्शवते.
Google चा मॅचिंग क्रम आणि नियम प्राधान्य
जेव्हा गुगल सारखे क्रॉलर्स वेबसाईटला भेट देतात, तेव्हा ते विशिष्ट नियमांनुसार पाथ तपासतात. हे साधन गुगलच्या अधिकृत मॅचिंग क्रमाचे अनुसरण करते:
- सर्वात लांब पाथ: क्रॉलर सर्वात लांब जुळणारा पाथ (longest matching path) विचारात घेतो आणि तोच नियम लागू होतो.
- समान लांबीचे नियम: जर जुळणारे Allow आणि Disallow नियम सारखेच विशिष्ट (समान लांबीचे) असतील, तर 'Allow' नियमाला प्राधान्य दिले जाते आणि तोच लागू होतो.
पाथ तपासताना खालीलपैकी एक परिणाम दिसून येतो:
- अनुमती दिली —
{rule}: तपासलेला पाथ सुरक्षित आहे आणि त्याला परवानगी देणारा नियम कंसात दर्शवला जातो. - ब्लॉक केले —
{rule}: तपासलेला पाथ ब्लॉक केला गेला आहे आणि त्याला कारणीभूत असलेला नियम कंसात दर्शवला जातो. - कोणताही जुळणारा नियम नाही. Google डीफॉल्टनुसार या पाथला अनुमती देते.: जेव्हा कोणताही विशिष्ट नियम लागू होत नाही, तेव्हा गुगल डीफॉल्टनुसार त्या पाथला परवानगी देते.
Robots.txt च्या मर्यादा आणि इंडेक्सिंग
Robots.txt फाईल वापरताना तिच्या मर्यादा समजून घेणे आवश्यक आहे:
- इंडेक्सिंग नियंत्रण नाही: Disallow नियमाद्वारे ब्लॉक केलेले पेज देखील सर्च रिझल्ट्समध्ये दिसू शकते, जर इतर कोणत्याही वेबपेजने त्याला लिंक केले असेल.
- सुरक्षा मर्यादा: ही फाईल
noindexनिर्देश तपासत नाही, तसेच ॲक्सेस कंट्रोल (पासवर्ड संरक्षण) किंवा पेज पूर्णपणे काढून टाकण्याची खात्री करत नाही. सर्च इंजिनमधून पेज पूर्णपणे काढून टाकण्यासाठीnoindexटॅग, ॲक्सेस कंट्रोल वापरणे किंवा ते पेज सर्व्हरवरून काढून टाकणे आवश्यक आहे. - फाईल आकाराची मर्यादा: जर जनरेट केलेली robots.txt फाईल 100,000 अक्षरांपेक्षा (characters) जास्त मोठी झाली, तर हे साधन "ही robots.txt येथे पुनरावलोकन करण्यासाठी खूप मोठी आहे." असा इशारा देते.
गोपनीयता आणि डेटा प्रक्रिया
या साधनामध्ये सुरक्षिततेला प्राधान्य दिले जाते. तुमचे सर्व क्रॉल नियम आणि तपासणी पूर्णपणे तुमच्या स्वतःच्या ब्राउझरमध्येच प्रक्रिया केली जाते. BroBroGo च्या सर्व्हरवर कोणताही डेटा किंवा नियम अपलोड केले जात नाहीत.
वारंवार विचारले जाणारे प्रश्न (FAQ)
प्रश्न: हे जनरेटर robots.txt मध्ये काय जोडू शकते?
उत्तर: युझर-एजंट गट, Allow आणि Disallow पाथ आणि एक किंवा अधिक साइटमॅप URL जोडा. पूर्वावलोकन robots.txt फाईलमध्ये कॉपी करण्यासाठी तयार आहे.
प्रश्न: पाथ तपासक नियम कसा निवडतो?
उत्तर: हे Google च्या मॅचिंग क्रमाचे अनुसरण करते: सर्वात लांब जुळणारा पाथ जिंकतो. जर जुळणारे Allow आणि Disallow नियम सारखेच विशिष्ट असतील, तर Allow जिंकतो.
प्रश्न: Disallow केल्याने Google सर्चमधून पेज निघून जाते का?
उत्तर: नाही. इतर पेजेसनी लिंक केल्यास ब्लॉक केलेले पेज तरीही सर्च रिझल्ट्समध्ये दिसू शकते. सर्चमधून पूर्णपणे बाहेर ठेवण्यासाठी noindex, ॲक्सेस कंट्रोल वापरा किंवा ते पेज काढून टाका.