የ-Robots.txt አመንጪ እና ማረጋገጫ

የክራውል ደንቦችን ይገንቡ እና Googlebot የትኛውን መንገድ መድረስ እንደሚችል ይፈትሹ።

የክራውል ደንቦች

እነዚህን ደንቦች መከተል በሚገባው ክራውለር (crawler) ይጀምሩ።

የጣቢያ ካርታዎች

የተፈጠረ robots.txt

0
robots.txt
ዝግጁ ነው። ምሳሌው ለሁሉም ክራውለሮች /adminን ያግዳል።

የደንብ ፍተሻ

    መንገድን መፈተኛ

    የእርስዎ የክራውል ደንቦች በብሮውዘርዎ ውስጥ ይፈጠራሉ እና ይረጋገጣሉ። ወደ BroBroGo ምንም ነገር አይሰቀልም።

    በተደጋጋሚ የሚነሱ ጥያቄዎች

    ይህ አመንጪ ወደ robots.txt ምን ማከል ይችላል?

    የ-user-agent ቡድን፣ የ-Allow እና Disallow መንገዶችን፣ እና አንድ ወይም ከዚያ በላይ የጣቢያ ካርታ (sitemap) URLዎችን ያክሉ። ቅድመ-ዕይታው ወደ robots.txt ፋይል ለመቀዳት ዝግጁ ነው።

    የመንገድ ፈታሹ ደንብን የሚመርጠው እንዴት ነው?

    የ-Googleን የማዛመጃ ቅደም ተከተል ይከተላል፦ ረጅሙ የሚዛመደው መንገድ ያሸንፋል። የሚዛመዱ Allow እና Disallow ደንቦች እኩል ዝርዝር ከሆኑ፣ Allow ያሸንፋል።

    Disallow ማድረግ አንድን ገጽ ከGoogle ፍለጋ ያስወግዳል?

    አይደለም። ሌሎች ገጾች ወደ እሱ የሚያገናኙ ከሆነ የታገደ ገጽ አሁንም በፍለጋ ውጤቶች ውስጥ ሊታይ ይችላል። ከፍለጋ ውጭ እንዲሆን ሲፈልጉ noindex፣ የመዳረሻ ቁጥጥር ይጠቀሙ ወይም ገጹን ያስወግዱት።

    የ-robots.txt ፋይል ዓላማ እና ተግባር

    የ-robots.txt ፋይል የድር ጣቢያ ባለቤቶች የፍለጋ ፕሮግራም ክራውለሮች (ለምሳሌ Googlebot) በጣቢያቸው ላይ የትኞቹን ገጾች ወይም ማውጫዎች መጎብኘት (crawl) እንደሚችሉ ወይም እንደማይችሉ ለመቆጣጠር የሚጠቀሙበት መደበኛ የጽሑፍ ፋይል ነው። ይህ ፋይል በድር ጣቢያው ዋና ማውጫ (root directory) ላይ የሚቀመጥ ሲሆን፣ ክራውለሮች ጣቢያውን መፈተሽ ከመጀመራቸው በፊት መመሪያዎችን ለማግኘት መጀመሪያ የሚያነቡት ሰነድ ነው።

    ይህንን ፋይል በትክክል ማዋቀር የጣቢያውን የክራውል በጀት (crawl budget) በአግባቡ ለመጠቀም እና የፍለጋ ፕሮግራሞች አስፈላጊ ያልሆኑ ወይም ሚስጥራዊ የሆኑ ክፍሎችን እንዳያሰሱ ለመከላከል ይረዳል። የ-Robots.txt አመንጪ እና ማረጋገጫ መሣሪያ እነዚህን የክራውል ደንቦች በቀላሉ ለመገንባት፣ ለመፈተሽ እና በሕጎቹ ውስጥ ያሉ ስህተቶችን ወይም ግጭቶችን ለመለየት ያገለግላል።


    የ-User-agent መመሪያዎች እና የክራውለር ቁጥጥር

    በ-robots.txt ፋይል ውስጥ እያንዳንዱ የደንብ ቡድን የሚጀምረው በ-User-agent መመሪያ ነው። ይህ መመሪያ ደንቡ የሚመለከተውን የተወሰነ የፍለጋ ፕሮግራም ክራውለር ስም ይገልጻል።

    • ለሁሉም ክራውለሮች፦ ሁሉንም የፍለጋ ፕሮግራም ቦቶች በአንድ ላይ ለመጥቀስ * ምልክትን መጠቀም ይቻላል።
    • ለተወሰኑ ክራውለሮች፦ እንደ Googlebot ያሉ የተወሰኑ የክራውለር ስሞችን ለይቶ መግለጽ ይቻላል።

    በመሣሪያው ውስጥ የ-User-agent ስሞችን ሲያስገቡ ስሞች ባዶ ቦታ (space) መያዝ የለባቸውም። ባዶ ቦታ ካላቸው መሣሪያው "ያለ ባዶ ቦታዎች አንድ የ-user-agent ስም ያስገቡ፣ ወይም ለሁሉም ክራውለሮች * ይጠቀሙ።" የሚለውን የስህተት መልዕክት ያሳያል። መሣሪያው በነባሪነት በ-User-agent: * እና በ-Disallow: /admin ደንብ ይጀምራል።


    የ-Allow እና Disallow ደንቦች መስተጋብር

    የክራውል ደንቦችን በሚገነቡበት ጊዜ ሁለት ዋና መመሪያዎች ጥቅም ላይ ይውላሉ፦

    1. Disallow (አትፍቀድ)፦ ክራውለሮች እንዳይደርሱባቸው የሚታገዱ የጣቢያ መንገዶችን ለመግለጽ ያገለግላል።
    2. Allow (ፍቀድ)፦ በታገደ ማውጫ ውስጥ ያሉ የተወሰኑ ንዑስ መንገዶችን ክራውለሮች እንዲያሰሱ ለመፍቀድ ያገለግላል።

    እነዚህን ደንቦች ሲያዋቅሩ የሚከተሉትን የደንብ መመሪያዎች መከተል ያስፈልጋል፦

    • ሁሉም የደንብ መንገዶች በ / መጀመር አለባቸው እና ባዶ ቦታዎችን መያዝ አይችሉም። ይህ ካልሆነ መሣሪያው "የደንብ መንገዶች በ / መጀመር አለባቸው እና ባዶ ቦታዎችን መያዝ አይችሉም።" የሚል ማስጠንቀቂያ ያሳያል።
    • $ ምልክት ጥቅም ላይ መዋል ያለበት የአንድ መንገድ ማብቂያን ለመጠቆም ሲሆን፣ በደንብ መንገድ መጨረሻ ላይ ብቻ መገኘት አለበት። በተሳሳተ ቦታ ላይ ከተቀመጠ "$ ምልክትን በደንብ መንገድ መጨረሻ ላይ ብቻ ይጠቀሙ።" የሚል ስህተት ይታያል።
    • አንድ ደንብ ለተመሳሳይ user-agent ከአንድ ጊዜ በላይ ከተደገመ፣ መሣሪያው "ይህ ደንብ ለተመሳሳይ user-agent ተደግሟል።" በማለት ምልክት ያደርጋል።
    • Allow እና Disallow መመሪያዎች ተመሳሳይ መንገድ የሚጠቀሙ ከሆነ፣ መሣሪያው "Allow እና Disallow ተመሳሳይ መንገድ ይጠቀማሉ። ሁለቱም እኩል ዝርዝር ሲሆኑ Google 'Allow'ን ተግባራዊ ያደርጋል።" የሚለውን ግጭት ያሳያል።

    የጣቢያ ካርታ (Sitemap) URL አስፈላጊነት

    የጣቢያ ካርታ (Sitemap) የፍለጋ ፕሮግራሞች በጣቢያው ላይ ያሉትን ሁሉንም ገጾች በቀላሉ እንዲያገኙ እና ኢንዴክስ እንዲያደርጉ የሚረዳ የ-XML ፋይል አድራሻ ነው። በ-robots.txt ፋይል ውስጥ የጣቢያ ካርታ URLን ማካተት ክራውለሮች የጣቢያውን መዋቅር በፍጥነት እንዲረዱ ያግዛል።

    በዚህ መሣሪያ ውስጥ የጣቢያ ካርታዎችን ሲያክሉ፣ አድራሻዎቹ ሙሉ የ-http:// ወይም https:// አድራሻ መሆን አለባቸው። ይህ መስፈርት ካልተሟላ መሣሪያው "የጣቢያ ካርታ URLዎች ሙሉ http:// ወይም https:// አድራሻ ያስፈልጋቸዋል።" የሚል ስህተት ያሳያል የተፈጠረ robots.txt ፋይሉ ከ 100,000 ቁምፊዎች (characters) በላይ ከሆነ፣ መሣሪያው "ይህ robots.txt እዚህ ለመገምገም በጣም ትልቅ ነው።" የሚል ማስጠንቀቂያ ይሰጣል።


    የ-Google ደንብ ማዛመጃ ቅደም ተከተል

    የፍለጋ ፕሮግራሞች (በተለይም Google) በ-robots.txt ውስጥ ያሉ ደንቦችን በሚያነቡበት ጊዜ የተወሰነ የማዛመጃ ቅደም ተከተልን ይከተላሉ፦

    • ረጅሙ መንገድ ያሸንፋል፦ Googlebot ከአንድ በላይ ከሚዛመዱ ደንቦች ውስጥ ረጅሙን (ይበልጥ የተወሰነውን) መንገድ መርጦ ይተገብራል።
    • እኩል ሲሆኑ Allow ያሸንፋል፦ የሚዛመዱ የ-Allow እና Disallow ደንቦች እኩል የቁምፊ ርዝመት (ዝርዝር) ካላቸው፣ Google የ-Allow ደንብን ተግባራዊ ያደርጋል።
    • የቡድኖች ውህደት፦ በፋይሉ ውስጥ ተመሳሳይ user-agent በተለያዩ ቦታዎች በተደጋጋሚ ከተጠቀሰ፣ Google እነዚህን ቡድኖች በአንድ ላይ ያዋህዳቸዋል። መሣሪያው ይህንን ሁኔታ "Google አንድ አይነት user-agent የሚጠቅሱ ቡድኖችን ያዋህዳል።" በማለት ያሳውቃል።

    የ-robots.txt ውስንነቶች በኢንዴክስ ቁጥጥር ላይ

    የ-robots.txt ፋይል ክራውለሮች ወደ አንድ ገጽ እንዳይገቡ ለመከልከል የሚያገለግል ቢሆንም፣ ገጹ በGoogle የፍለጋ ውጤቶች ውስጥ እንዳይታይ ሙሉ በሙሉ ለመከላከል ዋስትና አይሆንም።

    አንድ ገጽ በ-Disallow ደንብ ቢታገድም እንኳ፣ ሌሎች የድር ገጾች ወደዚያ የታገደ ገጽ የሚወስድ አገናኝ (link) ካላቸው፣ Google ገጹን አሁንም በቁልፍ ቃላት ፈልጎ በውጤት ገጽ ላይ ሊያሳየው ይችላል። ገጾች በፍለጋ ውጤቶች ውስጥ እንዳይታዩ ሙሉ በሙሉ ለማስቀረት noindex መመሪያን መጠቀም፣ የመዳረሻ ቁጥጥር (access control) ማዋቀር ወይም ገጹን ከጣቢያው ላይ ሙሉ በሙሉ ማስወገድ ያስፈልጋል። ይህ መሣሪያ የ-noindex መመሪያዎችን፣ የመዳረሻ ቁጥጥርን ወይም የገጽ መወገድን አይፈትሽም።


    የግላዊነት እና የውሂብ አሰናዳት መርህ

    የ-Robots.txt አመንጪ እና ማረጋገጫ መሣሪያን ሲጠቀሙ የእርስዎ የክራውል ደንቦች እና የጣቢያ መንገዶች ሙሉ በሙሉ የሚሰሩት እና የሚረጋገጡት በእርስዎ የድር ብሮውዘር (browser) ውስጥ ብቻ ነው። ወደ BroBroGo አገልጋዮች ምንም ዓይነት ውሂብ ወይም የጣቢያ መረጃ አይሰቀልም።


    ተደጋግመው የሚነሱ ጥያቄዎች (FAQ)

    ይህ አመንጪ ወደ robots.txt ምን ማከል ይችላል?
    የ-user-agent ቡድን፣ የ-Allow እና Disallow መንገዶችን፣ እና አንድ ወይም ከዚያ በላይ የጣቢያ ካርታ (sitemap) URLዎችን ያክሉ። ቅድመ-ዕይታው ወደ robots.txt ፋይል ለመቀዳት ዝግጁ ነው።

    የመንገድ ፈታሹ ደንብን የሚመርጠው እንዴት ነው?
    የ-Googleን የማዛመጃ ቅደም ተከተል ይከተላል፦ ረጅሙ የሚዛመደው መንገድ ያሸንፋል። የሚዛመዱ Allow እና Disallow ደንቦች እኩል ዝርዝር ከሆኑ፣ Allow ያሸንፋል።

    Disallow ማድረግ አንድን ገጽ ከGoogle ፍለጋ ያስወግዳል?
    አይደለም። ሌሎች ገጾች ወደ እሱ የሚያገናኙ ከሆነ የታገደ ገጽ አሁንም በፍለጋ ውጤቶች ውስጥ ሊታይ ይችላል። ከፍለጋ ውጭ እንዲሆን ሲፈልጉ noindex፣ የመዳረሻ ቁጥጥር ይጠቀሙ ወይም ገጹን ያስወግዱት።

    በመሣሪያው ውስጥ የደንብ ፍተሻ ውጤቶች እንዴት ይገለጻሉ?
    መንገድ ሲፈተሽ መሣሪያው የሚከተሉትን ውጤቶች ያሳያል፦

    • የተፈቀደ — {rule} (መንገዱ የተፈቀደ መሆኑን እና የትኛው ደንብ እንደፈቀደው ያሳያል)።
    • የታገደ — {rule} (መንገዱ የታገደ መሆኑን እና የትኛው ደንብ እንደከለከለው ያሳያል)።
    • ምንም የሚዛመድ ደንብ የለም። Google በነባሪነት ይህንን መንገድ ይፈቅዳል። (ምንም ዓይነት የሚዛመድ ደንብ በማይኖርበት ጊዜ)።