Robots.txt ထုတ်လုပ်နှင့် စစ်ဆေးသည့်ကိရိယာ

Crawl စည်းမျဉ်းများကို တည်ဆောက်ပြီး Googlebot မည်သည့်လမ်းကြောင်းကို ဝင်ရောက်နိုင်သည်ကို စစ်ဆေးပါ။

Crawl စည်းမျဉ်းများ

ဤစည်းမျဉ်းများကို လိုက်နာရမည့် crawler ဖြင့် စတင်ပါ။

Sitemap များ

ထုတ်လုပ်ထားသော robots.txt

0
robots.txt
အဆင်သင့်ဖြစ်ပါပြီ။ နမူနာသည် crawler အားလုံးအတွက် /admin ကို ပိတ်ဆို့ထားသည်။

စည်းမျဉ်း စစ်ဆေးမှု

    လမ်းကြောင်းတစ်ခုကို စမ်းသပ်ရန်

    သင့် crawl စည်းမျဉ်းများကို သင့်ဘရောက်ဆာထဲတွင်သာ ဖန်တီးပြီး စစ်ဆေးပေးပါသည်။ BroBroGo သို့ မည်သည့်အရာမျှ တင်ပို့မည်မဟုတ်ပါ။

    အမေးအဖြေ

    ဤထုတ်လုပ်သည့်ကိရိယာသည် robots.txt ထဲသို့ မည်သည့်အရာများ ထည့်သွင်းနိုင်သနည်း။

    user-agent အုပ်စု၊ Allow နှင့် Disallow လမ်းကြောင်းများ၊ နှင့် sitemap URL တစ်ခု သို့မဟုတ် တစ်ခုထက်ပို၍ ထည့်သွင်းပါ။ အစမ်းကြည့်ရှုမှုကို robots.txt ဖိုင်ထဲသို့ ကူးယူရန် အဆင်သင့်ဖြစ်ပါမည်။

    လမ်းကြောင်း စစ်ဆေးသည့်ကိရိယာသည် စည်းမျဉ်းတစ်ခုကို မည်သို့ ရွေးချယ်သနည်း။

    ၎င်းသည် Google ၏ ကိုက်ညီမှုအစီအစဉ်အတိုင်း လိုက်နာပါသည်- အရှည်ဆုံး ကိုက်ညီသော လမ်းကြောင်းက အနိုင်ရရှိသည်။ ကိုက်ညီသော Allow နှင့် Disallow စည်းမျဉ်းများသည် တူညီစွာ တိကျနေပါက Allow က အနိုင်ရရှိသည်။

    Disallow သည် စာမျက်နှာတစ်ခုကို Google Search မှ ဖယ်ရှားပေးပါသလား။

    မဟုတ်ပါ။ အခြားစာမျက်နှာများမှ ၎င်းကို ချိတ်ဆက်ထားပါက ပိတ်ဆို့ထားသော စာမျက်နှာသည် ရှာဖွေမှုရလဒ်များတွင် ပေါ်လာနိုင်ပါသေးသည်။ ရှာဖွေမှုမှ လုံးဝဖယ်ထုတ်လိုပါက noindex၊ ဝင်ရောက်ခွင့် ထိန်းချုပ်မှု (access control) ကို အသုံးပြုပါ သို့မဟုတ် စာမျက်နှာကို ဖယ်ရှားပါ။

    Robots.txt ၏ လုပ်ဆောင်ချက်နှင့် အရေးပါပုံ

    robots.txt ဖိုင်သည် ဝဘ်ဆိုက်တစ်ခုသို့ လာရောက်သော Googlebot ကဲ့သို့သော web crawler များ လိုက်နာရမည့် စည်းမျဉ်းများကို သတ်မှတ်ပေးသည့် လမ်းညွှန်ဖိုင်ဖြစ်သည်။ ဤဖိုင်ကို အသုံးပြုခြင်းဖြင့် ဝဘ်ဆိုက်ပိုင်ရှင်များသည် ၎င်းတို့၏ ဝဘ်ဆိုက်အတွင်းရှိ မည်သည့်လမ်းကြောင်းများကို crawler များ ဝင်ရောက်ကြည့်ရှုခွင့်ပြုမည် သို့မဟုတ် ပိတ်ဆို့မည်ကို ထိန်းချုပ်နိုင်သည်။

    Robots.txt ထုတ်လုပ်နှင့် စစ်ဆေးသည့်ကိရိယာ သည် crawler အမျိုးမျိုးအတွက် စည်းမျဉ်းများကို စနစ်တကျ တည်ဆောက်ပေးပြီး သတ်မှတ်ထားသော လမ်းကြောင်းများကို crawler များက ဝင်ရောက်ခွင့် ရှိမရှိ တိုက်ရိုက်စမ်းသပ်စစ်ဆေးပေးနိုင်သည်။


    User-agent ညွှန်ကြားချက်များဖြင့် Crawler များကို ထိန်းချုပ်ခြင်း

    ဝဘ်ဆိုက်အတွင်းသို့ ဝင်ရောက်သည့် crawler တစ်ခုချင်းစီ သို့မဟုတ် crawler အားလုံးကို ထိန်းချုပ်ရန် User-agent ညွှန်ကြားချက်ကို အသုံးပြုရသည်။

    • User-agent: crawler အမည်ကို သတ်မှတ်ရန်ဖြစ်ပြီး crawler အားလုံးအတွက် * ကို အသုံးပြုနိုင်သည်။ User-agent အမည်များတွင် စာလုံးခြားကွက်လပ်များ မပါဝင်ရပါ။ စာလုံးခြားကွက်လပ်ပါဝင်ပါက စာလုံးခြားကွက်လပ်မပါသော user-agent အမည်တစ်ခုကို ထည့်သွင်းပါ သို့မဟုတ် crawler အားလုံးအတွက် * ကို အသုံးပြုပါ။ ဟူသော အမှားပြင်ဆင်ချက်ကို ပြသမည်ဖြစ်သည်။
    • အုပ်စုများ ပေါင်းစည်းခြင်း: Google သည် တူညီသော user-agent ကို အုပ်စုအမျိုးမျိုးတွင် ခွဲခြားသတ်မှတ်ထားသော်လည်း ၎င်းတို့ကို တစ်စုတည်းအဖြစ် ပေါင်းစည်း၍ စည်းမျဉ်းများကို အကျိုးသက်ရောက်စေသည်။ ထို့ကြောင့် တူညီသော user-agent ကို အုပ်စုအများအပြားတွင် ခွဲရေးပါက Google သည် တူညီသော user-agent ကို အမည်ပေးထားသည့် အုပ်စုများကို ပေါင်းစည်းပါမည်။ ဟူသော သတိပေးချက်ကို ပြသမည်ဖြစ်သည်။

    Allow နှင့် Disallow စည်းမျဉ်းများ သတ်မှတ်ခြင်း

    crawler များ၏ ဝင်ရောက်မှုကို ခွင့်ပြုရန် သို့မဟုတ် ပိတ်ဆို့ရန်အတွက် Allow နှင့် Disallow စည်းမျဉ်းများကို အသုံးပြုရသည်။ ဤစည်းမျဉ်းများကို ရေးသားရာတွင် အောက်ပါသတ်မှတ်ချက်များကို လိုက်နာရမည်ဖြစ်သည်။

    • လမ်းကြောင်း သတ်မှတ်ချက်: စည်းမျဉ်းလမ်းကြောင်းများသည် အမြဲတမ်း / ဖြင့် စတင်ရမည်ဖြစ်ပြီး စာလုံးခြားကွက်လပ်များ မပါဝင်ရပါ။ ဤစည်းမျဉ်းကို မလိုက်နာပါက စည်းမျဉ်းလမ်းကြောင်းများသည် / ဖြင့် စတင်ရမည်ဖြစ်ပြီး စာလုံးခြားကွက်လပ်များ မပါဝင်ရပါ။ ဟူသော အမှားကို ပြသမည်ဖြစ်သည်။
    • အဆုံးသတ် သင်္ကေတ ($): လမ်းကြောင်းတစ်ခု၏ အဆုံးကို အတိအကျ သတ်မှတ်လိုပါက $ သင်္ကေတကို အသုံးပြုနိုင်သည်။ သို့သော် ၎င်းကို လမ်းကြောင်း၏ အဆုံးတွင်သာ အသုံးပြုရမည်ဖြစ်ပြီး မဟုတ်ပါက $ ကို စည်းမျဉ်းလမ်းကြောင်း၏ အဆုံးတွင်သာ အသုံးပြုပါ။ ဟူသော အမှားကို ပြသမည်ဖြစ်သည်။
    • ထပ်ခါတလဲလဲ ဖြစ်နေသော စည်းမျဉ်းများ: တူညီသော user-agent တစ်ခုတည်းအတွက် စည်းမျဉ်းတစ်ခုကို ထပ်ခါတလဲလဲ ရေးသားထားပါက ဤစည်းမျဉ်းသည် တူညီသော user-agent အတွက် ထပ်ခါတလဲလဲ ဖြစ်နေသည်။ ဟု ဖော်ပြမည်ဖြစ်သည်။
    • လမ်းကြောင်း တူညီမှု ပဋိပက္ခ: Allow နှင့် Disallow စည်းမျဉ်းနှစ်ခုစလုံးတွင် လမ်းကြောင်းတစ်ခုတည်းကို တူညီစွာ အသုံးပြုထားပါက Allow နှင့် Disallow တို့သည် တူညီသောလမ်းကြောင်းကို သုံးထားသည်။ နှစ်ခုစလုံးသည် တူညီစွာ တိကျနေပါက Google သည် Allow ကို သတ်မှတ်ပါမည်။ ဟူသော သတိပေးချက်ကို ပြသမည်ဖြစ်သည်။

    Sitemap URL များ ထည့်သွင်းခြင်း

    robots.txt ဖိုင်အတွင်း sitemap URL ကို ထည့်သွင်းပေးခြင်းဖြင့် search engine crawler များသည် ဝဘ်ဆိုက်၏ စာမျက်နှာတည်ဆောက်ပုံကို ပိုမိုလွယ်ကူစွာ ရှာဖွေဖတ်ရှုနိုင်သည်။ sitemap လိပ်စာကို ထည့်သွင်းရာတွင် ပြည့်စုံသော http:// သို့မဟုတ် https:// ပရိုတိုကော ပါဝင်သော လိပ်စာအပြည့်အစုံ ဖြစ်ရမည်။ ဤပုံစံအတိုင်း မဟုတ်ပါက Sitemap URL များတွင် ပြည့်စုံသော http:// သို့မဟုတ် https:// လိပ်စာ လိုအပ်သည်။ ဟူသော အမှားကို ပြသမည်ဖြစ်သည်။


    Google ၏ စည်းမျဉ်းကိုက်ညီမှု ဦးစားပေးအစီအစဉ် (Matching Order)

    လမ်းကြောင်းများကို စစ်ဆေးရာတွင် ဤကိရိယာသည် Google ၏ စည်းမျဉ်းကိုက်ညီမှု ဦးစားပေးအစီအစဉ်အတိုင်း လိုက်နာဆောင်ရွက်သည်။

    1. အရှည်ဆုံးလမ်းကြောင်း ဦးစားပေးခြင်း: ကိုက်ညီမှုရှိသော စည်းမျဉ်းများအနက် အရှည်ဆုံးနှင့် အတိကျဆုံး သတ်မှတ်ထားသော လမ်းကြောင်းသည် အမြဲတမ်း အနိုင်ရရှိသည်။
    2. တူညီစွာ တိကျမှုရှိခြင်း: အကယ်၍ ကိုက်ညီသော Allow နှင့် Disallow စည်းမျဉ်းနှစ်ခုစလုံးသည် လမ်းကြောင်းအရှည် တူညီနေပါက Allow စည်းမျဉ်းက အနိုင်ရရှိသည်။

    စည်းမျဉ်းများ စစ်ဆေးခြင်းနှင့် ရလဒ်များ

    ဤကိရိယာသည် စည်းမျဉ်းများကို စစ်ဆေးပြီးနောက် အောက်ပါရလဒ်များကို ပြသပေးသည်။

    • စည်းမျဉ်း အရေအတွက်: ဖိုင်အတွင်းရှိ စည်းမျဉ်းစုစုပေါင်းကို စည်းမျဉ်း {count} ခု ဟု ပြသသည်။
    • ပြဿနာများ ရှိမရှိ စစ်ဆေးခြင်း: syntax သို့မဟုတ် စည်းမျဉ်း ပဋိပက္ခများ မရှိပါက syntax သို့မဟုတ် စည်းမျဉ်း ပဋိပက္ခများ မတွေ့ရှိရပါ။ ဟု ပြသပြီး၊ ပြဿနာရှိပါက ပြန်လည်သုံးသပ်ရန် အရာ {count} ခု ရှိနေသည်။ ဟု ပြသသည်။
    • ဖိုင်အရွယ်အစား ကန့်သတ်ချက်: ထုတ်လုပ်လိုက်သော robots.txt ဖိုင်သည် စာလုံးရေ ၁၀၀,၀၀၀ ထက် ကျော်လွန်သွားပါက ဤ robots.txt သည် ဤနေရာတွင် ပြန်လည်သုံးသပ်ရန် အလွန်ကြီးမားနေသည်။ ဟူသော သတိပေးချက် ထွက်ပေါ်လာမည်ဖြစ်သည်။
    • လမ်းကြောင်း စမ်းသပ်မှု ရလဒ်များ:
      • လမ်းကြောင်းကို ခွင့်ပြုထားပါက: ခွင့်ပြုထားသည် — {rule}
      • လမ်းကြောင်းကို ပိတ်ဆို့ထားပါက: ပိတ်ဆို့ထားသည် — {rule}
      • ကိုက်ညီသော စည်းမျဉ်းမရှိပါက: ကိုက်ညီသော စည်းမျဉ်းမရှိပါ။ Google သည် ဤလမ်းကြောင်းကို ပုံမှန်အားဖြင့် ခွင့်ပြုသည်။

    ကိုယ်ရေးအချက်အလက် လုံခြုံမှုနှင့် လုပ်ဆောင်ပုံ

    သင့် crawl စည်းမျဉ်းများကို သင့်ဘရောက်ဆာထဲတွင်သာ ဖန်တီးပြီး စစ်ဆေးပေးပါသည်။ BroBroGo သို့ မည်သည့်အရာမျှ တင်ပို့မည်မဟုတ်ပါ။ အချက်အလက်အားလုံးကို အသုံးပြုသူ၏ စက်တွင်း၌သာ လုပ်ဆောင်သောကြောင့် ကိုယ်ရေးအချက်အလက် လုံခြုံမှုရှိစွာ အသုံးပြုနိုင်သည်။


    အမေးများသော မေးခွန်းများ (FAQ)

    မေး။ ဤထုတ်လုပ်သည့်ကိရိယာသည် robots.txt ထဲသို့ မည်သည့်အရာများ ထည့်သွင်းနိုင်သနည်း။
    ဖြေ။ user-agent အုပ်စု၊ Allow နှင့် Disallow လမ်းကြောင်းများ၊ နှင့် sitemap URL တစ်ခု သို့မဟုတ် တစ်ခုထက်ပို၍ ထည့်သွင်းပါ။ အစမ်းကြည့်ရှုမှုကို robots.txt ဖိုင်ထဲသို့ ကူးယူရန် အဆင်သင့်ဖြစ်ပါမည်။

    မေး။ လမ်းကြောင်း စစ်ဆေးသည့်ကိရိယာသည် စည်းမျဉ်းတစ်ခုကို မည်သို့ ရွေးချယ်သနည်း။
    ဖြေ။ ၎င်းသည် Google ၏ ကိုက်ညီမှုအစီအစဉ်အတိုင်း လိုက်နာပါသည်- အရှည်ဆုံး ကိုက်ညီသော လမ်းကြောင်းက အနိုင်ရရှိသည်။ ကိုက်ညီသော Allow နှင့် Disallow စည်းမျဉ်းများသည် တူညီစွာ တိကျနေပါက Allow က အနိုင်ရရှိသည်။

    မေး။ Disallow သည် စာမျက်နှာတစ်ခုကို Google Search မှ ဖယ်ရှားပေးပါသလား။
    ဖြေ။ မဟုတ်ပါ။ အခြားစာမျက်နှာများမှ ၎င်းကို ချိတ်ဆက်ထားပါက ပိတ်ဆို့ထားသော စာမျက်နှာသည် ရှာဖွေမှုရလဒ်များတွင် ပေါ်လာနိုင်ပါသေးသည်။ ရှာဖွေမှုမှ လုံးဝဖယ်ထုတ်လိုပါက noindex၊ ဝင်ရောက်ခွင့် ထိန်းချုပ်မှု (access control) ကို အသုံးပြုပါ သို့မဟုတ် စာမျက်နှာကို ဖယ်ရှားပါ။ ဤကိရိယာသည် noindex၊ ဝင်ရောက်ခွင့် ထိန်းချုပ်မှု သို့မဟုတ် စာမျက်နှာ ဖယ်ရှားထားမှု ရှိမရှိကို စစ်ဆေးပေးခြင်း မရှိပါ။