Robots.txt फ़ाइल का उद्देश्य और कार्यप्रणाली
robots.txt एक टेक्स्ट फ़ाइल होती है जो वेब क्रॉलर्स (जैसे Googlebot) को यह निर्देश देती है कि वे आपकी वेबसाइट के किन हिस्सों पर जा सकते हैं और किन पर नहीं। जब कोई क्रॉलर किसी वेबसाइट पर आता है, तो वह सबसे पहले इस फ़ाइल को देखता है।
यह उपकरण आपको अपनी वेबसाइट के लिए क्रॉल नियम बनाने और उनकी जाँच करने की सुविधा देता है। आप विभिन्न क्रॉलर्स के लिए अलग-अलग नियम जोड़ सकते हैं और फिर विशिष्ट वेबसाइट पथों का परीक्षण करके देख सकते हैं कि कोई क्रॉलर उन तक पहुँच सकता है या नहीं।
User-agent निर्देश और क्रॉलर नियंत्रण
User-agent निर्देश यह तय करता है कि नियम किस क्रॉलर पर लागू होंगे।
- विशिष्ट क्रॉलर: आप किसी विशेष क्रॉलर का नाम लिख सकते हैं, लेकिन ध्यान रखें कि यूज़र-एजेंट के नाम में स्पेस नहीं होना चाहिए।
- सभी क्रॉलर: सभी क्रॉलर्स पर नियम लागू करने के लिए
*का उपयोग किया जाता है।
यह उपकरण डिफ़ॉल्ट रूप से User-agent: * और Disallow: /admin के साथ शुरू होता है। यदि आप एक ही यूज़र-एजेंट को अलग-अलग समूहों में लिखते हैं, तो उपकरण "Google एक ही User-agent वाले समूहों को मिला देता है।" की चेतावनी दिखाता है, क्योंकि Google इन समूहों को आपस में जोड़ देता है।
Allow और Disallow नियमों का व्यवहार
वेबसाइट के पथों को नियंत्रित करने के लिए दो मुख्य नियमों का उपयोग किया जाता है:
- Disallow (क्रॉल रोकें): यह क्रॉलर्स को निर्दिष्ट पथ पर जाने से रोकता है।
- Allow (अनुमति दें): यह क्रॉलर्स को किसी ऐसे सब-फ़ोल्डर या पथ पर जाने की अनुमति देता है जो किसी Disallow नियम के अंतर्गत आता हो।
नियमों को लिखते समय निम्नलिखित तकनीकी बातों का ध्यान रखना आवश्यक है:
- प्रत्येक नियम पथ अनिवार्य रूप से
/से शुरू होना चाहिए और उसमें कोई स्पेस नहीं होना चाहिए। ऐसा न होने पर "नियम पथ / से शुरू होना चाहिए और उसमें स्पेस नहीं हो सकता।" त्रुटि दिखाई देती है। - विशेष वर्ण
$का उपयोग केवल नियम पथ के अंत में ही किया जा सकता है। यदि इसका उपयोग बीच में किया जाता है, तो "$ का उपयोग नियम पथ के अंत में ही करें।" की चेतावनी मिलती है। - यदि आप एक ही नियम को एक ही यूज़र-एजेंट के लिए दोबारा लिखते हैं, तो उपकरण "यह नियम उसी User-agent के लिए दोहराया गया है।" का संकेत देता है।
- यदि Allow और Disallow दोनों में एक ही पथ का उपयोग किया जाता है, तो उपकरण "Allow और Disallow में एक ही पथ है। दोनों बराबर विशिष्ट हों तो Google Allow लागू करता है।" की चेतावनी प्रदर्शित करता है।
Sitemap URL का महत्व
robots.txt फ़ाइल में साइटमैप का पता देना खोज इंजनों को आपकी वेबसाइट के सभी महत्वपूर्ण पेजों को खोजने में मदद करता है।
- फ़ाइल में जोड़ा जाने वाला साइटमैप URL हमेशा पूर्ण होना चाहिए, जिसमें
http://याhttps://शामिल हो। - यदि पता अधूरा या गलत है, तो उपकरण "साइटमैप URL में पूरा http:// या https:// पता चाहिए।" की त्रुटि दिखाता है।
Google का मिलान क्रम (Matching Order)
जब कोई क्रॉलर किसी पथ पर पहुँचने का प्रयास करता है, तो यह उपकरण Google के आधिकारिक मिलान क्रम के अनुसार उसकी जाँच करता है:
- सबसे लंबा पथ: क्रॉलर हमेशा सबसे लंबे और सबसे विशिष्ट मिलान वाले पथ नियम का पालन करता है।
- समान लंबाई पर प्राथमिकता: यदि Allow और Disallow दोनों नियम समान रूप से विशिष्ट (एक ही लंबाई के) हैं, तो Allow नियम को प्राथमिकता मिलती है और वह प्रभावी होता है।
जाँच के बाद उपकरण निम्नलिखित परिणाम दिखाता है:
- अनुमति है —
{rule}: यह दर्शाता है कि जाँचे गए पथ पर जाने की अनुमति है और वह नियम भी दिखाता है जो इसकी अनुमति देता है। - क्रॉल रोका गया —
{rule}: यह दर्शाता है कि पथ ब्लॉक है और ब्लॉक करने वाले नियम को प्रदर्शित करता है। - कोई मेल खाता नियम नहीं है। Google इस पथ को डिफ़ॉल्ट रूप से अनुमति देता है।: यह तब दिखाई देता है जब जाँचे गए पथ पर कोई भी नियम लागू नहीं होता।
खोज इंजन इंडेक्सिंग की सीमाएँ
robots.txt का उपयोग केवल क्रॉलिंग को नियंत्रित करने के लिए किया जाता है, इंडेक्सिंग को रोकने के लिए नहीं।
यदि कोई पेज robots.txt में Disallow (क्रॉल रोकें) द्वारा ब्लॉक किया गया है, तब भी यदि इंटरनेट पर मौजूद अन्य पेज उस ब्लॉक किए गए पेज से लिंक करते हैं, तो वह खोज परिणामों में दिखाई दे सकता है। यह उपकरण noindex टैग, एक्सेस कंट्रोल (पासवर्ड सुरक्षा), या पेज हटाने (removal) की जाँच नहीं करता है। खोज परिणामों से किसी पेज को पूरी तरह हटाने के लिए इन अन्य सुरक्षा उपायों का उपयोग किया जाना चाहिए।
गोपनीयता और डेटा प्रोसेसिंग
इस उपकरण का उपयोग करते समय आपकी गोपनीयता पूरी तरह सुरक्षित रहती है। आपके क्रॉल नियम और पथ परीक्षण सीधे आपके वेब ब्राउज़र के भीतर ही प्रोसेस किए जाते हैं। BroBroGo के सर्वर पर कोई भी डेटा अपलोड या स्टोर नहीं किया जाता है।
यदि आपकी बनाई गई robots.txt फ़ाइल का आकार 100,000 कैरेक्टर से अधिक हो जाता है, तो उपकरण "यह robots.txt यहाँ जाँचने के लिए बहुत बड़ा है।" का संदेश दिखाता है।
अक्सर पूछे जाने वाले प्रश्न (FAQ)
प्रश्न: यह जनरेटर robots.txt में क्या जोड़ सकता है?
उत्तर: User-agent समूह, Allow और Disallow पथ, और एक या कई Sitemap URL जोड़ें। प्रीव्यू को सीधे robots.txt फ़ाइल में कॉपी किया जा सकता है।
प्रश्न: पथ जाँच नियम कैसे चुनती है?
उत्तर: यह Google के मिलान क्रम का पालन करती है: सबसे लंबा मिलता हुआ पथ चुना जाता है। Allow और Disallow बराबर विशिष्ट हों तो Allow चुना जाता है।
प्रश्न: क्या Disallow पेज को Google Search से हटा देता है?
उत्तर: नहीं। दूसरे पेज उस पते से लिंक करें तो वह खोज परिणामों में फिर भी दिख सकता है। खोज से हटाने के लिए noindex, पहुँच नियंत्रण या पेज हटाने का उपयोग करें।