Robots.txt கோப்பின் நோக்கமும் செயல்பாடும்
Robots.txt என்பது இணையதளங்களின் முதன்மை கோப்பகத்தில் வைக்கப்படும் ஒரு எளிய உரை கோப்பாகும். கூகுள்பாட் (Googlebot) போன்ற இணைய கிராலர்கள் (crawlers) உங்கள் தளத்திற்கு வரும்போது, அவை எந்தெந்தப் பக்கங்களை அணுகலாம் மற்றும் எந்தெந்தப் பாதைகளைத் தவிர்க்க வேண்டும் என்பதை இந்த கோப்பு வழிகாட்டுகிறது.
இணையதளப் பராமரிப்பாளர்கள், மென்பொருள் உருவாக்குநர்கள் மற்றும் குறிப்பிட்ட பகுதிகளை கிராலர்கள் அணுகுவதைத் தடுக்க விரும்பும் எவரும் இந்த கோப்பைப் பயன்படுத்துகின்றனர். இதன் மூலம் முக்கியமான பக்கங்கள் தவறுதலாகத் தடுக்கப்படாமல் இருப்பதை உறுதி செய்ய முடியும்.
பயனர்-ஏஜென்ட் மற்றும் கிரால் விதிகள்
Robots.txt கோப்பின் அடிப்படை கட்டமைப்பு பயனர்-ஏஜென்ட் அறிவிப்புகளுடன் தொடங்குகிறது. இது குறிப்பிட்ட தேடுபொறி கிராலர்களைக் குறிக்கப் பயன்படுகிறது.
- அனைத்து கிராலர்கள்: அனைத்து கிராலர்களுக்கும் பொதுவான விதிகளைப் பயன்படுத்த
*குறியீடு பயன்படுகிறது. - குறிப்பிட்ட கிராலர்: ஒரு குறிப்பிட்ட கிராலருக்கு மட்டும் விதியை உருவாக்க அதன் பெயரை இடைவெளிகள் இல்லாமல் உள்ளிட வேண்டும்.
இந்தக் கருவி இயல்பாக User-agent: * மற்றும் Disallow: /admin ஆகிய விதிகளுடன் தொடங்குகிறது. பயனர்-ஏஜென்ட் பெயர்களில் இடைவெளிகள் இருக்கக்கூடாது. அவ்வாறு இருந்தால், "இடைவெளிகள் இல்லாமல் ஒரு பயனர்-ஏஜென்ட் பெயரை உள்ளிடவும் அல்லது அனைத்து கிராலர்களுக்கும் * ஐப் பயன்படுத்தவும்." என்ற பிழை செய்தி காட்டப்படும்.
அனுமதி (Allow) மற்றும் அனுமதி மறுப்பு (Disallow) விதிகள்
கிராலர்களின் அணுகலைக் கட்டுப்படுத்த இரண்டு முக்கிய விதிகள் பயன்படுத்தப்படுகின்றன:
- அனுமதி மறுப்பு (Disallow): கிராலர்கள் அணுகக் கூடாத பாதைகளைக் குறிக்கப் பயன்படுகிறது.
- அனுமதி (Allow): தடுக்கப்பட்ட ஒரு கோப்பகத்திற்குள் இருக்கும் குறிப்பிட்ட பக்கத்தை கிராலர்கள் அணுக அனுமதிக்கப் பயன்படுகிறது.
விதிமுறைகள் மற்றும் கட்டுப்பாடுகள்:
- அனைத்து விதிப் பாதைகளும் கட்டாயமாக
/குறியீட்டுடன் தொடங்க வேண்டும் மற்றும் அவற்றில் இடைவெளிகள் இருக்கக்கூடாது. தவறான பாதைகளுக்கு "விதிப் பாதைகள் / இல் தொடங்க வேண்டும் மற்றும் இடைவெளிகளைக் கொண்டிருக்கக்கூடாது." என்ற எச்சரிக்கை காட்டப்படும். - ஒரு பாதையின் முடிவை துல்லியமாகக் குறிக்க
$குறியீட்டைப் பயன்படுத்தலாம். இது விதிப் பாதையின் முடிவில் மட்டுமே பயன்படுத்தப்பட வேண்டும். இல்லையெனில், "விதிப் பாதையின் முடிவில் மட்டுமே $ ஐப் பயன்படுத்தவும்." என்ற பிழை செய்தி தோன்றும்.
தளவரைபடங்கள்
தேடுபொறிகள் உங்கள் தளத்தின் அனைத்துப் பக்கங்களையும் எளிதாகக் கண்டறிய தளவரைபட URLகளை robots.txt கோப்பில் சேர்ப்பது அவசியமாகும்.
தளவரைபடங்களைச் சேர்க்கும்போது, அவை முழுமையான http:// அல்லது https:// முகவரியைக் கொண்டிருக்க வேண்டும். முழுமையற்ற முகவரிகளை உள்ளிட்டால், "தளவரைபட URLகளுக்கு முழுமையான http:// அல்லது https:// முகவரி தேவை." என்ற பிழை செய்தி காட்டப்படும்.
கூகுளின் விதிப் பொருத்த முறை மற்றும் முன்னுரிமைகள்
பாதை சரிபார்ப்பான் ஒரு விதியைத் தேர்ந்தெடுக்கும்போது கூகுளின் அதிகாரப்பூர்வ பொருத்த வரிசை முறையைப் பின்பற்றுகிறது:
- நீளமான பாதை முன்னுரிமை: மிக நீளமாகப் பொருந்தும் பாதை எதுவோ, அதுவே இறுதியாக வெற்றி பெறுகிறது.
- சமமான நீளம்: பொருந்தும் அனுமதி (Allow) மற்றும் அனுமதி மறுப்பு (Disallow) விதிகள் சமமான நீளத்தைக் கொண்டிருந்தால், அனுமதி (Allow) விதியே வெற்றி பெறுகிறது.
- பொருந்தும் விதி இல்லாதபோது: சோதிக்கப்படும் பாதைக்கு எந்த விதியும் பொருந்தவில்லை எனில், "பொருந்தும் விதி எதுவும் இல்லை. கூகுள் இயல்பாகவே இந்தப் பாதையை அனுமதிக்கிறது." என்ற முடிவு காட்டப்படும்.
பொதுவான பிழைகளும் விதி முரண்பாடுகளும்
Robots.txt கோப்புகளை உருவாக்கும்போது ஏற்படும் பொதுவான தவறுகளை இந்தக் கருவி கண்டறிந்து எச்சரிக்கிறது:
- மீண்டும் மீண்டும் எழுதப்பட்ட விதி: ஒரே பயனர்-ஏஜென்ட்டிற்கு ஒரே விதி மீண்டும் பயன்படுத்தப்பட்டால், "ஒரே பயனர்-ஏஜென்ட்டிற்கு இந்த விதி மீண்டும் மீண்டும் பயன்படுத்தப்பட்டுள்ளது." என எச்சரிக்கும்.
- ஒரே பாதை முரண்பாடு: அனுமதி மற்றும் அனுமதி மறுப்பு ஆகிய இரண்டும் ஒரே பாதையைப் பயன்படுத்தினால், "அனுமதி (Allow) மற்றும் அனுமதி மறுப்பு (Disallow) ஆகிய இரண்டும் ஒரே பாதையைப் பயன்படுத்துகின்றன. இரண்டும் சமமாக இருக்கும்போது Google அனுமதியைப் பயன்படுத்துகிறது." என்ற செய்தி காட்டப்படும்.
- குழுக்கள் ஒன்றிணைப்பு: ஒரே பயனர்-ஏஜென்ட்டைப் பல குழுக்களில் குறிப்பிட்டால், "ஒரே பயனர்-ஏஜென்ட்டைக் குறிப்பிடும் குழுக்களை Google ஒன்றிணைக்கிறது." என்ற எச்சரிக்கை தோன்றும்.
- அளவுக் கட்டுப்பாடு: உருவாக்கப்பட்ட robots.txt கோப்பின் அளவு 100,000 எழுத்துகளுக்கு மேல் (exceeds 100,000 characters) இருந்தால், "இந்த robots.txt இங்கு மதிப்பாய்வு செய்ய முடியாத அளவுக்குப் பெரியதாக உள்ளது." என்ற செய்தி காட்டப்படும்.
தேடல் குறியீட்டு முறை (Indexing) வரம்புகள்
Robots.txt கோப்பில் ஒரு பாதையைத் தடுப்பது (Disallow) தேடுபொறி குறியீட்டு முறையிலிருந்து (Indexing) அப்பக்கத்தை முழுமையாக நீக்காது.
பிற இணையப் பக்கங்கள் அல்லது தளங்கள் குறிப்பிட்ட அந்தப் பக்கத்துடன் இணைந்திருக்கும்போது, தடுக்கப்பட்ட பக்கமும் கூகுள் தேடல் முடிவுகளில் தோன்றக்கூடும். தேடலில் இருந்து ஒரு பக்கத்தை முற்றிலும் விலக்கி வைக்க வேண்டிய அவசியம் இருக்கும்போது noindex குறியீடு, அணுகல் கட்டுப்பாடு (access control) ஆகியவற்றைப் பயன்படுத்த வேண்டும் அல்லது அந்தப் பக்கத்தையே தளத்திலிருந்து அகற்ற வேண்டும். இந்தத் தளம் noindex, அணுகல் கட்டுப்பாடு அல்லது பக்க அகற்றம் போன்றவற்றைச் சரிபார்க்காது.
தரவு செயலாக்கம் மற்றும் தனியுரிமை
இந்தக் கருவியைப் பயன்படுத்தும்போது உங்கள் தனியுரிமை முழுமையாகப் பாதுகாக்கப்படுகிறது. உங்கள் கிரால் விதிகள் அனைத்தும் உங்கள் உலாவியிலேயே நேரடியாக உருவாக்கப்பட்டுச் சரிபார்க்கப்படுகின்றன. BroBroGo இணையதளத்திற்கு எந்தவொரு தரவும் பதிவேற்றப்படாது.
அடிக்கடி கேட்கப்படும் கேள்விகள் (FAQ)
இந்த ஜெனரேட்டர் robots.txt இல் எதைச் சேர்க்க முடியும்?
பயனர்-ஏஜென்ட் குழு, அனுமதி மற்றும் அனுமதி மறுப்பு பாதைகள் மற்றும் ஒன்று அல்லது அதற்கு மேற்பட்ட தளவரைபட URLகளைச் சேர்க்கலாம். மாதிரிக்காட்சி robots.txt கோப்பில் நகலெடுக்கத் தயாராக இருக்கும்.
பாதை சரிபார்ப்பான் ஒரு விதியை எவ்வாறு தேர்வு செய்கிறது?
இது கூகுளின் பொருத்த வரிசையைப் பின்பற்றுகிறது: மிக நீளமாகப் பொருந்தும் பாதை வெற்றி பெறுகிறது. பொருந்தும் அனுமதி (Allow) மற்றும் அனுமதி மறுப்பு (Disallow) விதிகள் சமமாக இருந்தால், அனுமதி விதி வெற்றி பெறுகிறது.
அனுமதி மறுப்பு (Disallow) கூகுள் தேடலில் இருந்து ஒரு பக்கத்தை அகற்றுமா?
இல்லை. பிற பக்கங்கள் அதனுடன் இணைந்திருக்கும்போது, தடுக்கப்பட்ட பக்கமும் தேடல் முடிவுகளில் தோன்றக்கூடும். தேடலில் இருந்து விலக்கி வைக்க வேண்டிய அவசியம் இருக்கும்போது noindex, அணுகல் கட்டுப்பாடு ஆகியவற்றைப் பயன்படுத்தவும் அல்லது பக்கத்தை அகற்றவும்.