Robots.txt ֆայլի նպատակը և գործառույթները
Robots.txt ֆայլը պարզ տեքստային փաստաթուղթ է, որը տեղադրվում է վեբկայքի արմատային թղթապանակում և հրահանգներ է տալիս որոնողական ռոբոտներին (օրինակ՝ Googlebot-ին) այն մասին, թե կայքի որ էջերը կամ բաժինները նրանք կարող են սկանավորել և որոնք պետք է շրջանցեն: Այս ֆայլի ճիշտ կազմումը կարևոր է կայքի սպասարկողների և մշակողների համար, ովքեր ցանկանում են վերահսկել որոնողական սարդերի մուտքը դեպի իրենց ռեսուրսներ:
Այս գործիքի օգնությամբ դուք կարող եք ստեղծել կանոններ տարբեր որոնողական ռոբոտների համար և անմիջապես փորձարկել կոնկրետ URL ուղիները՝ համոզվելու համար, որ կարևոր էջերը պատահաբար չեն արգելափակվել, իսկ անցանկալի բաժինները հուսալիորեն պաշտպանված են սկանավորումից:
Ինդեքսավորման կանոնների ստեղծում և User-agent հրահանգներ
Robots.txt ֆայլի կառուցվածքը հիմնված է խմբերի վրա, որոնք սկսվում են User-agent հրահանգով: Այն սահմանում է, թե կոնկրետ որ որոնողական ռոբոտին են վերաբերում հաջորդող տողերը:
- User-agent: Որոնողական ռոբոտի անունը (օրինակ՝ Googlebot), կամ
*նշանը, որը վերաբերում է բոլոր ռոբոտներին միաժամանակ: - Կանոնների սահմանափակումներ: Օգտագործողի գործակալի (User-agent) անունները չեն կարող պարունակել բացատներ: Եթե մուտքագրվի սխալ անուն, համակարգը ցույց կտա հետևյալ հաղորդագրությունը. «Մուտքագրեք մեկ user-agent անուն առանց բացատների, կամ օգտագործեք * բոլոր ռոբոտների համար:»:
Գործիքը լռելյայն սկսվում է նախապես սահմանված կանոնով՝ User-agent: * և Disallow: /admin:
Allow և Disallow կանոնների փոխազդեցությունը
Որոնողական ռոբոտների վարքագիծը կառավարվում է երկու հիմնական հրահանգներով՝ Allow (Թույլատրել) և Disallow (Արգելել):
- Ուղիների ձևաչափը: Կանոնների բոլոր ուղիները պետք է պարտադիր սկսվեն
/նշանով և չպարունակեն բացատներ: Այս պահանջը խախտելու դեպքում գործիքը կցուցադրի սխալի հաղորդագրություն. «Կանոնների ուղիները պետք է սկսվեն /-ով և չպետք է պարունակեն բացատներ:»: - Վերջավորության սահմանափակում:
$նշանը, որն օգտագործվում է ուղու ճշգրիտ վերջավորությունը նշելու համար, կարող է կիրառվել միայն կանոնի ուղու վերջում: Հակառակ դեպքում կհայտնվի զգուշացում. «Օգտագործեք $ նշանը միայն կանոնի ուղու վերջում:»:
Եթե նույն օգտագործողի գործակալի համար սահմանվում են հակասական կամ կրկնվող կանոններ, գործիքը վավերացման փուլում կհայտնաբերի դրանք և կցուցադրի համապատասխան զգուշացումները.
- Եթե կանոնը կրկնվում է նույն ռոբոտի համար, կցուցադրվի՝ «Այս կանոնը կրկնվում է նույն user-agent-ի համար:»:
- Եթե Allow և Disallow հրահանգները մատնանշում են միևնույն ուղին, կհայտնվի հետևյալ հաղորդագրությունը. «Allow-ը և Disallow-ն օգտագործում են նույն ուղին: Google-ը կիրառում է Allow-ը, երբ երկուսն էլ հավասարապես կոնկրետ են:»:
- Եթե նույն user-agent-ը նշված է մի քանի տարբեր խմբերում, գործիքը կզգուշացնի. «Google-ը միավորում է այն խմբերը, որոնք նշում են նույն user-agent-ը:»:
Կայքի քարտեզի (Sitemap) հասցեների կարևորությունը
Sitemap-ի հասցեն robots.txt ֆայլում ներառելը օգնում է որոնողական ռոբոտներին արագ գտնել կայքի բոլոր էջերի քարտեզը և ավելի արդյունավետ իրականացնել ինդեքսավորումը:
Գործիքի մեջ կայքի քարտեզի հասցեներ ավելացնելիս պետք է հաշվի առնել, որ դրանք պետք է լինեն ամբողջական URL-ներ: Դրանք պետք է պարտադիր սկսվեն http:// կամ https:// նախդիրներով: Եթե հասցեն թերի է կամ սխալ ձևաչափով, համակարգը կցուցադրի հետևյալ զգուշացումը. «Sitemap URL-ների համար անհրաժեշտ է ամբողջական http:// կամ https:// հասցե:»:
Կանոնների համընկնման հերթականությունը ըստ Google-ի
Երբ որոնողական ռոբոտը ստուգում է կոնկրետ URL ուղի, այն առաջնորդվում է որոշակի հիերարխիայով: Այս գործիքը ուղիները փորձարկելիս կիրառում է Google-ի համընկնման պաշտոնական կանոնները.
- Ամենաերկար համընկնման սկզբունքը: Որոշում կայացնելիս հաղթում է այն կանոնը, որի ուղին ավելի երկար է և ավելի կոնկրետ է նկարագրում տվյալ հասցեն:
- Հավասար ճշգրտության դեպք: Եթե համընկնող Allow և Disallow կանոնները ունեն հավասար երկարություն (հավասարապես կոնկրետ են), ապա առաջնահերթությունը տրվում է Allow կանոնին:
Եթե գեներացված robots.txt ֆայլի ընդհանուր չափը գերազանցում է 100,000 նիշը, գործիքը չի կարողանա այն ամբողջությամբ վերլուծել և կցուցադրի հետևյալ հաղորդագրությունը. «Այս robots.txt-ն չափազանց մեծ է այստեղ վերանայելու համար:»:
Ինդեքսավորման սահմանափակումները և Robots.txt-ի սահմանները
Կարևոր է հասկանալ, որ robots.txt ֆայլը չի հանդիսանում կայքի էջերի անվտանգության կամ որոնման արդյունքներից լիակատար հեռացման գործիք:
Եթե որևէ էջ արգելափակված է Disallow կանոնով, այն դեռ կարող է հայտնվել որոնման արդյունքներում, եթե համացանցի այլ էջերից կան դեպի այդ էջ տանող հղումներ: Այս գործիքը նախատեսված չէ և չի իրականացնում ստուգումներ noindex հրահանգի, օգտատերերի մուտքի վերահսկման (access control) կամ կայքից էջերի ամբողջական հեռացման համար: Էջերի հուսալի թաքցման համար անհրաժեշտ է կիրառել այլ մեթոդներ:
Տվյալների մշակում և գաղտնիություն
Այս գործիքի հետ աշխատելիս ձեր տվյալների գաղտնիությունը պահպանվում է տեղային մակարդակում: Ձեր կողմից մուտքագրված ինդեքսավորման բոլոր կանոնները ստեղծվում և ստուգվում են անմիջապես ձեր բրաուզերում: Ոչ մի տեղեկատվություն կամ կանոն չի վերբեռնվում BroBroGo սերվերներին:
Հաճախ տրվող հարցեր (FAQ)
Ի՞նչ կարող է այս գեներատորն ավելացնել robots.txt-ում:
Ավելացրեք user-agent խումբ, Allow և Disallow ուղիներ և մեկ կամ մի քանի sitemap URL-ներ: Նախադիտումը պատրաստ է robots.txt ֆայլում պատճենելու համար:
Ինչպե՞ս է ուղու ստուգիչն ընտրում կանոնը:
Այն հետևում է Google-ի համընկնման հերթականությանը. հաղթում է ամենաերկար համընկնող ուղին: Եթե համընկնող Allow և Disallow կանոնները հավասարապես կոնկրետ են, հաղթում է Allow-ը:
Արդյո՞ք Disallow-ն հեռացնում է էջը Google որոնումից:
Ոչ: Արգելափակված էջը դեռ կարող է հայտնվել որոնման արդյունքներում, եթե այլ էջեր հղվում են դրան: Օգտագործեք noindex, մուտքի վերահսկում կամ հեռացրեք էջը, եթե անհրաժեշտ է այն ամբողջությամբ զերծ պահել որոնումից:
Ի՞նչ է նշանակում, երբ ստուգման արդյունքում հայտնվում է «Համընկնող կանոն չկա: Google-ը լռելյայն թույլատրում է այս ուղին:» հաղորդագրությունը:
Դա նշանակում է, որ ձեր սահմանած կանոններից ոչ մեկը չի տարածվում փորձարկվող URL ուղու վրա: Նման դեպքերում Googlebot-ը լռելյայն համարում է, որ տվյալ էջի սկանավորումը թույլատրված է: