Robots.txt ၏ လုပ်ဆောင်ချက်နှင့် အရေးပါပုံ
robots.txt ဖိုင်သည် ဝဘ်ဆိုက်တစ်ခုသို့ လာရောက်သော Googlebot ကဲ့သို့သော web crawler များ လိုက်နာရမည့် စည်းမျဉ်းများကို သတ်မှတ်ပေးသည့် လမ်းညွှန်ဖိုင်ဖြစ်သည်။ ဤဖိုင်ကို အသုံးပြုခြင်းဖြင့် ဝဘ်ဆိုက်ပိုင်ရှင်များသည် ၎င်းတို့၏ ဝဘ်ဆိုက်အတွင်းရှိ မည်သည့်လမ်းကြောင်းများကို crawler များ ဝင်ရောက်ကြည့်ရှုခွင့်ပြုမည် သို့မဟုတ် ပိတ်ဆို့မည်ကို ထိန်းချုပ်နိုင်သည်။
Robots.txt ထုတ်လုပ်နှင့် စစ်ဆေးသည့်ကိရိယာ သည် crawler အမျိုးမျိုးအတွက် စည်းမျဉ်းများကို စနစ်တကျ တည်ဆောက်ပေးပြီး သတ်မှတ်ထားသော လမ်းကြောင်းများကို crawler များက ဝင်ရောက်ခွင့် ရှိမရှိ တိုက်ရိုက်စမ်းသပ်စစ်ဆေးပေးနိုင်သည်။
User-agent ညွှန်ကြားချက်များဖြင့် Crawler များကို ထိန်းချုပ်ခြင်း
ဝဘ်ဆိုက်အတွင်းသို့ ဝင်ရောက်သည့် crawler တစ်ခုချင်းစီ သို့မဟုတ် crawler အားလုံးကို ထိန်းချုပ်ရန် User-agent ညွှန်ကြားချက်ကို အသုံးပြုရသည်။
- User-agent: crawler အမည်ကို သတ်မှတ်ရန်ဖြစ်ပြီး crawler အားလုံးအတွက်
*ကို အသုံးပြုနိုင်သည်။ User-agent အမည်များတွင် စာလုံးခြားကွက်လပ်များ မပါဝင်ရပါ။ စာလုံးခြားကွက်လပ်ပါဝင်ပါကစာလုံးခြားကွက်လပ်မပါသော user-agent အမည်တစ်ခုကို ထည့်သွင်းပါ သို့မဟုတ် crawler အားလုံးအတွက် * ကို အသုံးပြုပါ။ဟူသော အမှားပြင်ဆင်ချက်ကို ပြသမည်ဖြစ်သည်။ - အုပ်စုများ ပေါင်းစည်းခြင်း: Google သည် တူညီသော user-agent ကို အုပ်စုအမျိုးမျိုးတွင် ခွဲခြားသတ်မှတ်ထားသော်လည်း ၎င်းတို့ကို တစ်စုတည်းအဖြစ် ပေါင်းစည်း၍ စည်းမျဉ်းများကို အကျိုးသက်ရောက်စေသည်။ ထို့ကြောင့် တူညီသော user-agent ကို အုပ်စုအများအပြားတွင် ခွဲရေးပါက
Google သည် တူညီသော user-agent ကို အမည်ပေးထားသည့် အုပ်စုများကို ပေါင်းစည်းပါမည်။ဟူသော သတိပေးချက်ကို ပြသမည်ဖြစ်သည်။
Allow နှင့် Disallow စည်းမျဉ်းများ သတ်မှတ်ခြင်း
crawler များ၏ ဝင်ရောက်မှုကို ခွင့်ပြုရန် သို့မဟုတ် ပိတ်ဆို့ရန်အတွက် Allow နှင့် Disallow စည်းမျဉ်းများကို အသုံးပြုရသည်။ ဤစည်းမျဉ်းများကို ရေးသားရာတွင် အောက်ပါသတ်မှတ်ချက်များကို လိုက်နာရမည်ဖြစ်သည်။
- လမ်းကြောင်း သတ်မှတ်ချက်: စည်းမျဉ်းလမ်းကြောင်းများသည် အမြဲတမ်း
/ဖြင့် စတင်ရမည်ဖြစ်ပြီး စာလုံးခြားကွက်လပ်များ မပါဝင်ရပါ။ ဤစည်းမျဉ်းကို မလိုက်နာပါကစည်းမျဉ်းလမ်းကြောင်းများသည် / ဖြင့် စတင်ရမည်ဖြစ်ပြီး စာလုံးခြားကွက်လပ်များ မပါဝင်ရပါ။ဟူသော အမှားကို ပြသမည်ဖြစ်သည်။ - အဆုံးသတ် သင်္ကေတ ($): လမ်းကြောင်းတစ်ခု၏ အဆုံးကို အတိအကျ သတ်မှတ်လိုပါက
$သင်္ကေတကို အသုံးပြုနိုင်သည်။ သို့သော် ၎င်းကို လမ်းကြောင်း၏ အဆုံးတွင်သာ အသုံးပြုရမည်ဖြစ်ပြီး မဟုတ်ပါက$ ကို စည်းမျဉ်းလမ်းကြောင်း၏ အဆုံးတွင်သာ အသုံးပြုပါ။ဟူသော အမှားကို ပြသမည်ဖြစ်သည်။ - ထပ်ခါတလဲလဲ ဖြစ်နေသော စည်းမျဉ်းများ: တူညီသော user-agent တစ်ခုတည်းအတွက် စည်းမျဉ်းတစ်ခုကို ထပ်ခါတလဲလဲ ရေးသားထားပါက
ဤစည်းမျဉ်းသည် တူညီသော user-agent အတွက် ထပ်ခါတလဲလဲ ဖြစ်နေသည်။ဟု ဖော်ပြမည်ဖြစ်သည်။ - လမ်းကြောင်း တူညီမှု ပဋိပက္ခ: Allow နှင့် Disallow စည်းမျဉ်းနှစ်ခုစလုံးတွင် လမ်းကြောင်းတစ်ခုတည်းကို တူညီစွာ အသုံးပြုထားပါက
Allow နှင့် Disallow တို့သည် တူညီသောလမ်းကြောင်းကို သုံးထားသည်။ နှစ်ခုစလုံးသည် တူညီစွာ တိကျနေပါက Google သည် Allow ကို သတ်မှတ်ပါမည်။ဟူသော သတိပေးချက်ကို ပြသမည်ဖြစ်သည်။
Sitemap URL များ ထည့်သွင်းခြင်း
robots.txt ဖိုင်အတွင်း sitemap URL ကို ထည့်သွင်းပေးခြင်းဖြင့် search engine crawler များသည် ဝဘ်ဆိုက်၏ စာမျက်နှာတည်ဆောက်ပုံကို ပိုမိုလွယ်ကူစွာ ရှာဖွေဖတ်ရှုနိုင်သည်။ sitemap လိပ်စာကို ထည့်သွင်းရာတွင် ပြည့်စုံသော http:// သို့မဟုတ် https:// ပရိုတိုကော ပါဝင်သော လိပ်စာအပြည့်အစုံ ဖြစ်ရမည်။ ဤပုံစံအတိုင်း မဟုတ်ပါက Sitemap URL များတွင် ပြည့်စုံသော http:// သို့မဟုတ် https:// လိပ်စာ လိုအပ်သည်။ ဟူသော အမှားကို ပြသမည်ဖြစ်သည်။
Google ၏ စည်းမျဉ်းကိုက်ညီမှု ဦးစားပေးအစီအစဉ် (Matching Order)
လမ်းကြောင်းများကို စစ်ဆေးရာတွင် ဤကိရိယာသည် Google ၏ စည်းမျဉ်းကိုက်ညီမှု ဦးစားပေးအစီအစဉ်အတိုင်း လိုက်နာဆောင်ရွက်သည်။
- အရှည်ဆုံးလမ်းကြောင်း ဦးစားပေးခြင်း: ကိုက်ညီမှုရှိသော စည်းမျဉ်းများအနက် အရှည်ဆုံးနှင့် အတိကျဆုံး သတ်မှတ်ထားသော လမ်းကြောင်းသည် အမြဲတမ်း အနိုင်ရရှိသည်။
- တူညီစွာ တိကျမှုရှိခြင်း: အကယ်၍ ကိုက်ညီသော Allow နှင့် Disallow စည်းမျဉ်းနှစ်ခုစလုံးသည် လမ်းကြောင်းအရှည် တူညီနေပါက Allow စည်းမျဉ်းက အနိုင်ရရှိသည်။
စည်းမျဉ်းများ စစ်ဆေးခြင်းနှင့် ရလဒ်များ
ဤကိရိယာသည် စည်းမျဉ်းများကို စစ်ဆေးပြီးနောက် အောက်ပါရလဒ်များကို ပြသပေးသည်။
- စည်းမျဉ်း အရေအတွက်: ဖိုင်အတွင်းရှိ စည်းမျဉ်းစုစုပေါင်းကို
စည်းမျဉ်း {count} ခုဟု ပြသသည်။ - ပြဿနာများ ရှိမရှိ စစ်ဆေးခြင်း: syntax သို့မဟုတ် စည်းမျဉ်း ပဋိပက္ခများ မရှိပါက
syntax သို့မဟုတ် စည်းမျဉ်း ပဋိပက္ခများ မတွေ့ရှိရပါ။ဟု ပြသပြီး၊ ပြဿနာရှိပါကပြန်လည်သုံးသပ်ရန် အရာ {count} ခု ရှိနေသည်။ဟု ပြသသည်။ - ဖိုင်အရွယ်အစား ကန့်သတ်ချက်: ထုတ်လုပ်လိုက်သော robots.txt ဖိုင်သည် စာလုံးရေ ၁၀၀,၀၀၀ ထက် ကျော်လွန်သွားပါက
ဤ robots.txt သည် ဤနေရာတွင် ပြန်လည်သုံးသပ်ရန် အလွန်ကြီးမားနေသည်။ဟူသော သတိပေးချက် ထွက်ပေါ်လာမည်ဖြစ်သည်။ - လမ်းကြောင်း စမ်းသပ်မှု ရလဒ်များ:
- လမ်းကြောင်းကို ခွင့်ပြုထားပါက:
ခွင့်ပြုထားသည် — {rule} - လမ်းကြောင်းကို ပိတ်ဆို့ထားပါက:
ပိတ်ဆို့ထားသည် — {rule} - ကိုက်ညီသော စည်းမျဉ်းမရှိပါက:
ကိုက်ညီသော စည်းမျဉ်းမရှိပါ။ Google သည် ဤလမ်းကြောင်းကို ပုံမှန်အားဖြင့် ခွင့်ပြုသည်။
- လမ်းကြောင်းကို ခွင့်ပြုထားပါက:
ကိုယ်ရေးအချက်အလက် လုံခြုံမှုနှင့် လုပ်ဆောင်ပုံ
သင့် crawl စည်းမျဉ်းများကို သင့်ဘရောက်ဆာထဲတွင်သာ ဖန်တီးပြီး စစ်ဆေးပေးပါသည်။ BroBroGo သို့ မည်သည့်အရာမျှ တင်ပို့မည်မဟုတ်ပါ။ အချက်အလက်အားလုံးကို အသုံးပြုသူ၏ စက်တွင်း၌သာ လုပ်ဆောင်သောကြောင့် ကိုယ်ရေးအချက်အလက် လုံခြုံမှုရှိစွာ အသုံးပြုနိုင်သည်။
အမေးများသော မေးခွန်းများ (FAQ)
မေး။ ဤထုတ်လုပ်သည့်ကိရိယာသည် robots.txt ထဲသို့ မည်သည့်အရာများ ထည့်သွင်းနိုင်သနည်း။
ဖြေ။ user-agent အုပ်စု၊ Allow နှင့် Disallow လမ်းကြောင်းများ၊ နှင့် sitemap URL တစ်ခု သို့မဟုတ် တစ်ခုထက်ပို၍ ထည့်သွင်းပါ။ အစမ်းကြည့်ရှုမှုကို robots.txt ဖိုင်ထဲသို့ ကူးယူရန် အဆင်သင့်ဖြစ်ပါမည်။
မေး။ လမ်းကြောင်း စစ်ဆေးသည့်ကိရိယာသည် စည်းမျဉ်းတစ်ခုကို မည်သို့ ရွေးချယ်သနည်း။
ဖြေ။ ၎င်းသည် Google ၏ ကိုက်ညီမှုအစီအစဉ်အတိုင်း လိုက်နာပါသည်- အရှည်ဆုံး ကိုက်ညီသော လမ်းကြောင်းက အနိုင်ရရှိသည်။ ကိုက်ညီသော Allow နှင့် Disallow စည်းမျဉ်းများသည် တူညီစွာ တိကျနေပါက Allow က အနိုင်ရရှိသည်။
မေး။ Disallow သည် စာမျက်နှာတစ်ခုကို Google Search မှ ဖယ်ရှားပေးပါသလား။
ဖြေ။ မဟုတ်ပါ။ အခြားစာမျက်နှာများမှ ၎င်းကို ချိတ်ဆက်ထားပါက ပိတ်ဆို့ထားသော စာမျက်နှာသည် ရှာဖွေမှုရလဒ်များတွင် ပေါ်လာနိုင်ပါသေးသည်။ ရှာဖွေမှုမှ လုံးဝဖယ်ထုတ်လိုပါက noindex၊ ဝင်ရောက်ခွင့် ထိန်းချုပ်မှု (access control) ကို အသုံးပြုပါ သို့မဟုတ် စာမျက်နှာကို ဖယ်ရှားပါ။ ဤကိရိယာသည် noindex၊ ဝင်ရောက်ခွင့် ထိန်းချုပ်မှု သို့မဟုတ် စာမျက်နှာ ဖယ်ရှားထားမှု ရှိမရှိကို စစ်ဆေးပေးခြင်း မရှိပါ။