വെബ്സൈറ്റുകളിലേക്ക് എത്തുന്ന സെർച്ച് എഞ്ചിൻ ക്രോളറുകളുടെ (ഉദാഹരണത്തിന് Googlebot) പ്രവർത്തനം നിയന്ത്രിക്കുന്നതിനുള്ള നിയമങ്ങൾ അടങ്ങിയ ഫയലാണ് robots.txt. വെബ്സൈറ്റ് അഡ്മിനിസ്ട്രേറ്റർമാർക്കും ഡെവലപ്പർമാർക്കും തങ്ങളുടെ സൈറ്റിലെ ഏതൊക്കെ ഭാഗങ്ങളാണ് ക്രോളറുകൾ സന്ദർശിക്കേണ്ടത്, ഏതൊക്കെ ഭാഗങ്ങളാണ് ഒഴിവാക്കേണ്ടത് എന്ന് നിർദ്ദേശിക്കാൻ ഈ ഫയൽ സഹായിക്കുന്നു. "Robots.txt ജനറേറ്ററും വാലിഡേറ്ററും" എന്ന ഈ ടൂൾ ഉപയോഗിച്ച് കൃത്യമായ സിന്റാക്സ് നിയമങ്ങൾ പാലിച്ചുകൊണ്ട് ഒരു robots.txt ഫയൽ നിർമ്മിക്കാനും, നിലവിലുള്ള നിയമങ്ങൾ പരിശോധിക്കാനും സാധിക്കും.
നിങ്ങളുടെ ബ്രൗസറിൽ തന്നെയാണ് ഈ ടൂളിന്റെ പ്രവർത്തനങ്ങൾ നടക്കുന്നത്. ക്രോൾ നിയമങ്ങൾ ബ്രൗസറിൽ തന്നെ നിർമ്മിക്കുകയും പരിശോധിക്കുകയും ചെയ്യുന്നു. BroBroGo-ലേക്ക് ഒന്നും അപ്ലോഡ് ചെയ്യുന്നില്ല.
User-agent നിർദ്ദേശങ്ങളും ക്രോളർ നിയന്ത്രണവും
ഒരു robots.txt ഫയലിലെ ഏറ്റവും പ്രധാനപ്പെട്ട ഭാഗമാണ് User-agent നിർദ്ദേശം. ഏത് ക്രോളറിനാണ് താഴെ പറയുന്ന നിയമങ്ങൾ ബാധകമാകുന്നത് എന്ന് വ്യക്തമാക്കാനാണ് ഇത് ഉപയോഗിക്കുന്നത്.
- എല്ലാ ക്രോളറുകൾക്കും: എല്ലാ വെബ് ക്രോളറുകൾക്കുമായി പൊതുവായ നിയമം നൽകാൻ
*ചിഹ്നം ഉപയോഗിക്കുന്നു. - പ്രത്യേക ക്രോളറുകൾക്ക്: Googlebot പോലുള്ള നിർദ്ദിഷ്ട ക്രോളറുകൾക്കായി പ്രത്യേക നിയമങ്ങൾ നൽകാം.
ഈ ടൂൾ ഉപയോഗിക്കുമ്പോൾ യൂസർ-ഏജന്റ് നാമങ്ങളിൽ സ്പേസുകൾ ഉൾപ്പെടുത്താൻ പാടില്ല. സ്പേസുകൾ ഉൾപ്പെടുത്തിയാൽ "സ്പേസുകൾ ഇല്ലാതെ ഒരു യൂസർ-ഏജന്റ് നാമം നൽകുക, അല്ലെങ്കിൽ എല്ലാ ക്രോളറുകൾക്കുമായി * ഉപയോഗിക്കുക." എന്ന പിശക് സന്ദേശം കാണിക്കും. ഈ ടൂൾ ആരംഭിക്കുമ്പോൾ ഡിഫോൾട്ടായി User-agent: *, Disallow: /admin എന്നീ നിയമങ്ങളോടെയാണ് സജ്ജീകരിച്ചിരിക്കുന്നത്.
Allow, Disallow നിയമങ്ങളുടെ പ്രവർത്തനം
ക്രോളറുകൾക്ക് വെബ്സൈറ്റിലെ പാത്തുകൾ അനുവദിക്കുന്നതിനും തടയുന്നതിനുമാണ് Allow, Disallow നിയമങ്ങൾ ഉപയോഗിക്കുന്നത്.
- Disallow: ക്രോളറുകൾ പ്രവേശിക്കാൻ പാടില്ലാത്ത വെബ്സൈറ്റ് പാത്തുകൾ നിർദ്ദേശിക്കുന്നു.
- Allow: Disallow ചെയ്ത ഒരു ഫോൾഡറിനുള്ളിലെ പ്രത്യേക പാത്തുകൾ ക്രോളറുകൾക്ക് അനുവദിക്കാൻ ഇത് ഉപയോഗിക്കുന്നു.
ഈ നിയമങ്ങൾ എഴുതുമ്പോൾ ചില പ്രധാന നിബന്ധനകൾ പാലിക്കേണ്ടതുണ്ട്:
- എല്ലാ റൂൾ പാത്തുകളും
/ചിഹ്നത്തിൽ ആരംഭിക്കണം, അവയിൽ സ്പേസുകൾ ഉണ്ടാകാൻ പാടില്ല. ഈ നിയമം ലംഘിച്ചാൽ "റൂൾ പാത്തുകൾ / എന്ന് തുടങ്ങണം, അവയിൽ സ്പേസുകൾ ഉണ്ടാകാൻ പാടില്ല." എന്ന മുന്നറിയിപ്പ് ലഭിക്കും. - ഒരു പാത്തിന്റെ അവസാനം കൃത്യമായി നിർവചിക്കാൻ
$ചിഹ്നം ഉപയോഗിക്കാം. എന്നാൽ ഇത് പാത്തിന്റെ അവസാനത്തിൽ മാത്രമേ ഉപയോഗിക്കാവൂ. അല്ലാത്തപക്ഷം "ഒരു റൂൾ പാത്തിന്റെ അവസാനം മാത്രം $ ഉപയോഗിക്കുക." എന്ന പിശക് കാണിക്കും.
ഗൂഗിളിന്റെ മാച്ചിംഗ് ഓർഡർ (Matching Order)
robots.txt ഫയലിലെ നിയമങ്ങൾ വിലയിരുത്തുമ്പോൾ ഗൂഗിൾ ചില പ്രത്യേക മുൻഗണനാ ക്രമങ്ങൾ പിന്തുടരുന്നുണ്ട്. പാത്ത് പരിശോധിക്കുമ്പോൾ ഈ ടൂളും ഗൂഗിളിന്റെ അതേ മാച്ചിംഗ് ഓർഡർ തന്നെയാണ് പിന്തുടരുന്നത്.
- ഏറ്റവും നീളമുള്ള പാത്ത്: പൊരുത്തപ്പെടുന്ന നിയമങ്ങളിൽ ഏറ്റവും നീളമുള്ള മാച്ചിംഗ് പാത്ത് ഏതാണോ, അതിനാണ് മുൻഗണന ലഭിക്കുക.
- തുല്യമായ നീളമുള്ള നിയമങ്ങൾ: മാച്ചിംഗ് ആയ Allow, Disallow നിയമങ്ങൾ ഒരേപോലെ വ്യക്തമാണെങ്കിൽ, Allow വിജയിക്കും.
ഒരു പാത്ത് പരിശോധിക്കുമ്പോൾ പൊരുത്തപ്പെടുന്ന നിയമങ്ങൾ ഒന്നും തന്നെ ഇല്ലെങ്കിൽ "പൊരുത്തപ്പെടുന്ന നിയമമില്ല. ഗൂഗിൾ ഈ പാത്ത് ഡിഫോൾട്ടായി അനുവദിക്കുന്നു." എന്ന ഫലം ലഭിക്കും.
സാധാരണയായി സംഭവിക്കുന്ന പിശകുകൾ
robots.txt ഫയലുകൾ നിർമ്മിക്കുമ്പോൾ സാധാരണയായി ഉണ്ടാകുന്ന ചില സിന്റാക്സ് വൈരുദ്ധ്യങ്ങളും അവ ഈ ടൂൾ എങ്ങനെ കണ്ടെത്തുന്നു എന്നും താഴെ നൽകുന്നു:
| പിശക് / വൈരുദ്ധ്യം | ടൂൾ നൽകുന്ന മുന്നറിയിപ്പ് സന്ദേശം |
|---|---|
| ഒരേ യൂസർ-ഏജന്റിനായി ഒരേ നിയമം ആവർത്തിച്ചു നൽകുക | "ഈ നിയമം ഒരേ യൂസർ-ഏജന്റിനായി ആവർത്തിച്ചിരിക്കുന്നു." |
| Allow, Disallow എന്നിവയ്ക്കായി ഒരേ പാത്ത് നൽകുക | "Allow-ഉം Disallow-ഉം ഒരേ പാത്ത് ഉപയോഗിക്കുന്നു. രണ്ടും ഒരേപോലെ വ്യക്തമായിരിക്കുമ്പോൾ ഗൂഗിൾ Allow ബാധകമാക്കുന്നു." |
| ഒരേ യൂസർ-ഏജന്റ് നാമം ഒന്നിലധികം ഗ്രൂപ്പുകളിൽ ഉപയോഗിക്കുക | "ഒരേ യൂസർ-ഏജന്റ് നാമമുള്ള ഗ്രൂപ്പുകളെ ഗൂഗിൾ സംയോജിപ്പിക്കുന്നു." |
| തെറ്റായ സൈറ്റ്മാപ്പ് വിലാസം നൽകുക | "സൈറ്റ്മാപ്പ് URL-കൾക്ക് പൂർണ്ണമായ http:// അല്ലെങ്കിൽ https:// വിലാസം ആവശ്യമാണ്." |
| ഫയലിന്റെ വലിപ്പം പരിധി കവിയുക | "ഈ robots.txt ഇവിടെ വിലയിരുത്താൻ കഴിയാത്ത വിധം വളരെ വലുതാണ്." (ഫയൽ 100,000 ക്യാരക്ടറുകളിൽ കൂടുതലാകുമ്പോൾ) |
സൈറ്റ്മാപ്പ് URL-കളുടെ പ്രാധാന്യം
സെർച്ച് എഞ്ചിൻ ക്രോളറുകൾക്ക് വെബ്സൈറ്റിലെ എല്ലാ പേജുകളും എളുപ്പത്തിൽ കണ്ടെത്താൻ സൈറ്റ്മാപ്പുകൾ സഹായിക്കുന്നു. robots.txt ഫയലിൽ സൈറ്റ്മാപ്പ് വിലാസം ചേർക്കുന്നത് ക്രോളിംഗ് പ്രക്രിയ വേഗത്തിലാക്കും. robots.txt ഫയലിൽ സൈറ്റ്മാപ്പ് ചേർക്കുമ്പോൾ അത് പൂർണ്ണമായ http:// അല്ലെങ്കിൽ https:// വിലാസമായിരിക്കണം.
ഇൻഡെക്സിംഗും robots.txt ഫയലിന്റെ പരിമിതികളും
robots.txt ഫയൽ ഉപയോഗിക്കുന്നത് വഴി ക്രോളറുകൾ സൈറ്റ് സന്ദർശിക്കുന്നത് നിയന്ത്രിക്കാൻ സാധിക്കുമെങ്കിലും, സെർച്ച് എഞ്ചിൻ ഇൻഡെക്സിംഗ് പൂർണ്ണമായി തടയാൻ ഇതിന് കഴിയില്ല.
മറ്റ് വെബ്സൈറ്റുകളിലെ പേജുകൾ നിങ്ങളുടെ തടയപ്പെട്ട പേജിലേക്ക് ലിങ്ക് ചെയ്യുന്നുണ്ടെങ്കിൽ, ആ പേജ് ഇപ്പോഴും തിരയൽ ഫലങ്ങളിൽ പ്രത്യക്ഷപ്പെട്ടേക്കാം. ഈ ടൂൾ noindex നിർദ്ദേശങ്ങൾ, ആക്സസ് കൺട്രോൾ (Access Control), അല്ലെങ്കിൽ വെബ് പേജ് നീക്കം ചെയ്യൽ എന്നിവ പരിശോധിക്കുന്നില്ല. തിരയലിൽ നിന്ന് ഒരു പേജ് പൂർണ്ണമായി ഒഴിവാക്കാൻ noindex ടാഗുകൾ ഉപയോഗിക്കുകയോ, പാസ്വേഡ് പരിരക്ഷ പോലുള്ള ആക്സസ് കൺട്രോൾ സംവിധാനങ്ങൾ ഏർപ്പെടുത്തുകയോ, അല്ലെങ്കിൽ പേജ് വെബ്സൈറ്റിൽ നിന്ന് നീക്കം ചെയ്യുകയോ ചെയ്യേണ്ടതുണ്ട്.
FAQ
ഈ ജനറേറ്ററിന് robots.txt-ലേക്ക് എന്തൊക്കെ ചേർക്കാൻ കഴിയും?
ഒരു യൂസർ-ഏജന്റ് ഗ്രൂപ്പ്, Allow, Disallow പാത്തുകൾ, ഒന്നോ അതിലധികമോ സൈറ്റ്മാപ്പ് URL-കൾ എന്നിവ ചേർക്കുക. പ്രിവ്യൂ ഒരു robots.txt ഫയലിലേക്ക് പകർത്താൻ പാകത്തിൽ തയ്യാറാണ്.
പാത്ത് ചെക്കർ എങ്ങനെയാണ് ഒരു നിയമം തിരഞ്ഞെടുക്കുന്നത്?
ഇത് ഗൂഗിളിന്റെ മാച്ചിംഗ് ഓർഡർ പിന്തുടരുന്നു: ഏറ്റവും നീളമുള്ള മാച്ചിംഗ് പാത്ത് വിജയിക്കുന്നു. മാച്ചിംഗ് ആയ Allow, Disallow നിയമങ്ങൾ ഒരേപോലെ വ്യക്തമാണെങ്കിൽ, Allow വിജയിക്കും.
Disallow ഉപയോഗിച്ചാൽ ഗൂഗിൾ സെർച്ചിൽ നിന്ന് ഒരു പേജ് നീക്കം ചെയ്യപ്പെടുമോ?
ഇല്ല. മറ്റ് പേജുകൾ അതിലേക്ക് ലിങ്ക് ചെയ്യുമ്പോൾ ഒരു തടയപ്പെട്ട പേജ് ഇപ്പോഴും തിരയൽ ഫലങ്ങളിൽ പ്രത്യക്ഷപ്പെട്ടേക്കാം. തിരയലിൽ നിന്ന് പൂർണ്ണമായി ഒഴിവാക്കാൻ noindex, ആക്സസ് കൺട്രോൾ എന്നിവ ഉപയോഗിക്കുക അല്ലെങ്കിൽ പേജ് നീക്കം ചെയ്യുക.