Robots.txt үүсгэгч ба шалгагч

Индексжүүлэх дүрмүүдийг үүсгэж, Googlebot ямар зам руу хандаж болохыг шалгана уу.

Индексжүүлэх дүрмүүд

Эдгээр дүрмийг дагах ёстой хайлтын роботоос (crawler) эхэлнэ үү.

Sitemap-ууд

Үүсгэсэн robots.txt

0
robots.txt
Бэлэн. Жишээ нь бүх роботын хувьд /admin замыг хориглосон байна.

Дүрмийн шалгалт

    Зам турших

    Таны индексжүүлэх дүрмүүд хөтөч дээр тань үүсэж, шалгагдана. BroBroGo руу юу ч илгээгдэхгүй.

    Түгээмэл асуултууд

    Энэ үүсгэгч robots.txt файлд юу нэмж чадах вэ?

    User-agent бүлэг, Allow болон Disallow замууд, мөн нэг буюу хэд хэдэн sitemap URL нэмнэ үү. Урьдчилан харах хэсэг нь robots.txt файл руу хуулахад бэлэн байна.

    Зам шалгагч дүрмийг хэрхэн сонгодог вэ?

    Энэ нь Google-ийн тохирох дарааллыг баримталдаг: хамгийн урт тохирсон зам нь давуу эрхтэй болно. Хэрэв Allow болон Disallow дүрмүүд ижил нарийвчлалтай байвал Allow нь давуу эрхтэй байна.

    Disallow дүрэм нь хуудсыг Google хайлтаас устгах уу?

    Үгүй. Бусад хуудсууд холбосон тохиолдолд хориглосон хуудас хайлтын үр дүнд харагдсаар байх боломжтой. Хайлтаас бүрэн хасахын тулд noindex, хандалтын хяналт ашиглах эсвэл хуудсыг устгана уу.

    Robots.txt файлын зорилго ба ажиллах зарчим

    Robots.txt нь вэб сайтын эх хавтсанд байрладаг текстэн файл бөгөөд хайлтын системийн роботууд (crawler) тухайн вэб сайтын аль хэсэгт нэвтэрч, хайлтын үр дүнд индексжүүлэхийг зааж өгдөг. Энэхүү файл нь вэб сайтын серверийн ачааллыг зохицуулах, хэрэгцээгүй эсвэл хувийн шинжтэй хэсгүүдийг хайлтын роботоос хамгаалахад чухал үүрэг гүйцэтгэдэг.

    Вэб сайтын администраторууд, хөгжүүлэгчид болон хайлтын системийн оновчлолын (SEO) мэргэжилтнүүд robots.txt файлыг ашиглан хайлтын роботуудын хөдөлгөөнийг чиглүүлдэг. Хэрэв robots.txt файлыг буруу тохируулбал чухал хуудсууд хайлтын системд индексжихгүй үлдэх, эсвэл эсрэгээрээ нууцлах шаардлагатай хэсгүүд ил задгай харагдах эрсдэлтэй.

    User-agent зааварчилгаа ба хайлтын роботуудыг удирдах нь

    Robots.txt файлын бүтэц нь тодорхой хайлтын роботуудад зориулсан зааварчилгааны бүлгүүдээс бүрддэг. Эдгээр бүлгийг User-agent заавраар эхлүүлдэг.

    • Тодорхой роботыг заах: Жишээ нь, зөвхөн Google-ийн үндсэн роботод дүрэм үйлчлэхээр тохируулах бол User-agent: Googlebot гэж заана.
    • Бүх роботыг заах: Хэрэв вэб сайтын дүрмийг ямар нэгэн ялгаваргүйгээр бүх хайлтын роботод ижил үйлчлүүлэхээр тохируулах бол * тэмдэгтийг ашиглана.

    Энэхүү хэрэгсэл нь анхдагч байдлаар User-agent: * болон Disallow: /admin гэсэн тохиргоотойгоор эхэлдэг. Дүрмийг үүсгэх явцад хэрэглэгчийн оруулсан утгад дараах хязгаарлалтууд тавигдана:

    • User-agent нэр нь дотроо ямар нэгэн хоосон зай агуулж болохгүй. Хэрэв хоосон зай оруулбал хэрэгсэл нь "Хоосон зайгүй нэг user-agent нэр оруулна уу, эсвэл бүх роботод зориулж * ашиглана уу." гэсэн алдааг заана.
    • Хэрэв ижил user-agent нэрийг хэд хэдэн өөр бүлэгт хуваан бичсэн бол "Google нь ижил user-agent заасан бүлгүүдийг нэгтгэдэг." гэсэн анхааруулга гарна.

    Allow болон Disallow дүрмүүдийн харилцан үйлчлэл

    Хайлтын роботын хандах эрхийг зохицуулахдаа Allow (Зөвшөөрөх) болон Disallow (Хориглох) дүрмүүдийг ашигладаг. Эдгээр дүрмийг бичихдээ дараах синтаксийн шаардлагуудыг чанд мөрдөх шаардлагатай:

    1. Эхлэх тэмдэгт: Дүрмийн замууд нь заавал / тэмдэгтээр эхлэх ёстой бөгөөд дотроо хоосон зай агуулж болохгүй. Энэ шаардлагыг зөрчвөл "Дүрмийн замууд нь /-оор эхлэх ёстой бөгөөд хоосон зай агуулж болохгүй." гэсэн алдааг харуулна.
    2. Төгсгөлийн тэмдэгт: Замын төгсгөлийг заахын тулд $ тэмдэгтийг ашиглаж болно. Гэхдээ энэ тэмдэгтийг зөвхөн замын төгсгөлд ашиглах ёстой бөгөөд бусад хэсэгт оруулбал "$ тэмдэгтийг зөвхөн дүрмийн замын төгсгөлд ашиглана уу." гэсэн алдаа гарна.
    3. Давхардал: Хэрэв нэг бүлэгт ижил дүрэм дахин давтагдвал "Энэ дүрэм ижил user-agent-д давтагдсан байна." гэж тэмдэглэгдэнэ.
    4. Зөрчил: Хэрэв Allow болон Disallow дүрмүүд нь яг ижил замыг зааж байвал "Allow болон Disallow нь ижил замыг ашиглаж байна. Хоёр дүрэм ижил нарийвчлалтай байвал Google нь Allow-ийг хэрэгжүүлдэг." гэсэн анхааруулга гарна.

    Google-ийн дүрэм тохирох дараалал ба ажиллах зарчим

    Хайлтын роботууд, ялангуяа Googlebot нь robots.txt файлын дүрмүүдийг уншихдаа тодорхой эрэмбэ дарааллыг баримталдаг.

    • Хамгийн урт замын дүрэм: Google нь хамгийн урт тохирсон замыг давуу эрхтэй гэж үзнэ. Жишээ нь, Disallow: /user/ болон Allow: /user/profile/ гэсэн хоёр дүрэм байвал /user/profile/avatar.jpg хаяг руу хандахад хамгийн урт тохирч байгаа Allow дүрэм үйлчилнэ.
    • Ижил урттай дүрмүүд: Хэрэв тохирч буй Allow болон Disallow дүрмүүд нь яг ижил тэмдэгтийн урттай буюу ижил нарийвчлалтай байвал Allow дүрэм нь давуу эрхтэй болж, хандалтыг зөвшөөрнө.

    Sitemap URL-ийг robots.txt файлд зааж өгөх нь

    Sitemap буюу сайтын зураг нь хайлтын роботуудад вэб сайтын бүх хуудсыг хурдан, үр дүнтэй олж индексжүүлэхэд тусалдаг. Robots.txt файлын аль ч хэсэгт sitemap-ийн байршлыг зааж өгч болно.

    Sitemap URL-ийг оруулахдаа дараах дүрмийг баримтална:

    • Sitemap-ийн хаяг нь бүтэн http:// эсвэл https:// протокол бүхий хаяг байх ёстой.
    • Хэрэв хаяг дутуу эсвэл буруу форматтай байвал "Sitemap URL нь бүтэн http:// эсвэл https:// хаяг байх шаардлагатай." гэсэн алдааг заана.

    Robots.txt файлын хязгаарлалт ба индексжүүлэлт

    Robots.txt файлыг ашиглахдаа түүний хязгаарлалтуудыг сайтар ойлгох хэрэгтэй. Энэхүү файл нь хайлтын системээс хуудсыг бүрэн нуух хэрэгсэл биш юм.

    • Холбоосоор дамжин индексжих: Хэрэв robots.txt файлд ямар нэгэн хуудсыг Disallow дүрмээр хаасан байсан ч, өөр вэб сайт эсвэл таны сайтын бусад хуудаснаас тухайн хаасан хуудас руу холбоос (link) заасан байвал Google тухайн хуудсыг хайлтын үр дүнд харуулсаар байх боломжтой.
    • Хамгаалалтын бусад аргууд: Robots.txt нь noindex зааварчилгааг шалгадаггүй, мөн вэб хуудасны хандалтын хяналт (нууц үгээр хамгаалах) болон хуудсыг серверээс устгасан эсэхийг хянадаггүй. Хэрэв хуудсыг хайлтын үр дүнгээс бүрэн хасах шаардлагатай бол noindex мета таг ашиглах, хандалтыг хязгаарлах эсвэл хуудсыг бүрмөсөн устгах хэрэгтэй.
    • Файлын хэмжээний хязгаарлалт: Хэрэв үүсгэсэн robots.txt файлын нийт хэмжээ 100,000 тэмдэгтээс давбал "Энэ robots.txt энд хянахад хэтэрхий том байна." гэсэн алдааг харуулна.

    Нууцлал ба өгөгдөл боловсруулалт

    Энэхүү хэрэгслийг ашиглах явцад таны оруулсан мэдээлэл, индексжүүлэх дүрмүүд болон шалгаж буй замууд нь зөвхөн таны вэб хөтөч (browser) дотор боловсруулагдана. Ямар нэгэн өгөгдөл BroBroGo серверийн систем рүү илгээгдэхгүй бөгөөд гадагш дамжихгүй.


    Түгээмэл асуултууд

    Энэ үүсгэгч robots.txt файлд юу нэмж чадах вэ? User-agent бүлэг, Allow болон Disallow замууд, мөн нэг буюу хэд хэдэн sitemap URL нэмнэ үү. Урьдчилан харах хэсэг нь robots.txt файл руу хуулахад бэлэн байна.

    Зам шалгагч дүрмийг хэрхэн сонгодог вэ? Энэ нь Google-ийн тохирох дарааллыг баримталдаг: хамгийн урт тохирсон зам нь давуу эрхтэй болно. Хэрэв Allow болон Disallow дүрмүүд ижил нарийвчлалтай байвал Allow нь давуу эрхтэй байна.

    Disallow дүрэм нь хуудсыг Google хайлтаас устгах уу? Үгүй. Бусад хуудсууд холбосон тохиолдолд хориглосон хуудас хайлтын үр дүнд харагдсаар байх боломжтой. Хайлтаас бүрэн хасахын тулд noindex, хандалтын хяналт ашиглах эсвэл хуудсыг устгана уу.