Layunin at Gamit ng Robots.txt Generator & Validator
Ang Robots.txt Generator & Validator ay isang tool na tumutulong sa paggawa at pagsusuri ng mga panuntunan para sa mga web crawler, tulad ng Googlebot, na dapat nilang sundin kapag bumibisita sila sa iyong website. Sa pamamagitan ng tool na ito, maaari kang bumuo ng isang robots.txt file sa pamamagitan ng pagdaragdag ng iba't ibang panuntunan para sa iba't ibang crawler, at pagkatapos ay subukan ang mga partikular na path ng website upang makita kung ang isang crawler ay papayagan o haharangin batay sa mga panuntunang iyon.
Ang tool na ito ay mahalaga para sa:
- Mga maintainer ng website na gustong kontrolin kung paano ina-access ng mga web crawler ang kanilang site.
- Mga developer na kailangang gumawa o magbago ng mga robots.txt file.
- Sinumang gustong pigilan ang mga crawler sa pag-access sa mga partikular na bahagi ng kanilang website.
- Mga user na gustong tiyakin na ang mga mahahalagang page ay hindi aksidenteng nahaharang mula sa mga crawler.
Mga Input sa Paggawa at Pagsusuri
Upang magamit ang tool, may mga partikular na input na kinakailangan para sa pagbuo ng mga panuntunan at pagsubok sa mga ito:
- User-agent: Ang pangalan ng crawler, o
*para sa lahat ng crawler. - Path: Ang path ng website, na dapat magsimula sa
/. - URL ng Sitemap: Isang buong
http://ohttps://na address para sa sitemap. - URL path: Isang partikular na path sa iyong website na nais mong subukan.
- Crawler: Ang pangalan ng crawler na gagamitin upang subukan ang isang path.
Mga Output at Resulta ng Tool
Mula sa mga inilagay na impormasyon, magpapakita ang tool ng mga sumusunod na output:
- Binuong robots.txt: Isang preview ng robots.txt file.
{count}(na) panuntunan: Ang bilang ng mga panuntunan sa binuong robots.txt.{count}(na) item ang kailangang suriin: Ang bilang ng mga isyu o problema na nahanap sa mga panuntunan.- Pinayagan —
{rule}: Nagpapahiwatig na ang sinubukang path ay pinayagan at ipinapakita ang panuntunan na nagpapahintulot dito. - Hinarang —
{rule}: Nagpapahiwatig na ang sinubukang path ay hinarang at ipinapakita ang panuntunan na humaharang dito. - Walang tumutugmang panuntunan. Pinapayagan ng Google ang path na ito bilang default.: Nagpapahiwatig na walang panuntunang naaangkop sa sinubukang path.
Mga Panuntunan, Limitasyon, at mga Error sa Syntax
Kapag ginagamit ang tool, may mga default na setting at mahigpit na panuntunan sa syntax na dapat sundin upang maiwasan ang mga error:
- Default na Setting: Ang tool ay nagsisimula sa default na
User-agent: *atDisallow: /admin. - Mga Pangalan ng User-agent: Ang mga pangalan ng user-agent ay hindi maaaring maglaman ng mga espasyo. Kung mali ang pagkakalagay, ipapakita ang error na: Maglagay ng isang pangalan ng user-agent nang walang espasyo, o gamitin ang * para sa lahat ng crawler..
- Mga Path ng Panuntunan: Ang mga path ng panuntunan ay dapat magsimula sa
/at hindi maaaring maglaman ng mga espasyo. Ang paglabag dito ay magpapakita ng error na: Dapat magsimula sa / ang mga path ng panuntunan at hindi maaaring maglaman ng mga espasyo.. - Paggamit ng $: Ang karakter na
$ay maaari lamang gamitin sa dulo ng isang path ng panuntunan. Kung hindi ito nasunod, lalabas ang error na: Gamitin lamang ang $ sa dulo ng isang path ng panuntunan.. - Inuulit na Panuntunan: Kung ang isang panuntunan ay inulit para sa parehong user-agent, ito ay mamarkahan ng: Inuulit ang panuntunang ito para sa parehong user-agent..
- Salungatan sa Allow at Disallow: Kung ang mga panuntunan ng Allow at Disallow ay gumagamit ng parehong path, ito ay mamarkahan ng: Parehong path ang ginagamit ng Allow at Disallow. Inilalapat ng Google ang Allow kapag pareho silang partikular..
- Maramihang Grupo para sa Parehong User-agent: Kung ang parehong user-agent ay pinangalanan sa maraming grupo, ito ay mamarkahan ng: Pinagsasama ng Google mga grupong nagpapangalan sa parehong user-agent..
- Format ng Sitemap: Ang mga URL ng sitemap ay dapat na buong
http://ohttps://na mga address. Kung hindi, ipapakita ang error na: Kailangan ng mga URL ng sitemap ng buong http:// o https:// na address.. - Limitasyon sa Laki: Kung ang binuong robots.txt ay lumampas sa 100,000 karakter, ito ay mamarkahan ng: Masyadong malaki ang robots.txt na ito para suriin dito..
Paano Pinipili ng Google ang mga Panuntunan
Kapag sinusuri ang mga path, sinusunod ng tool ang pagkakasunud-sunod ng pagtutugma ng Google:
- Pinakamahabang Path: Ang pinakamahabang tumutugmang path ang palaging nananalo.
- Patas na Pagtutugma: Kung ang magkatugmang panuntunan ng Allow at Disallow ay parehong partikular (pantay ang haba), ang Allow ang nananalo.
- Limitasyon sa Pag-index: Ang robots.txt ay may limitasyon sa pagkontrol sa pag-index sa search engine. Ang isang hinarang na page (blocked page) ay maaari pa ring lumitaw sa mga resulta ng paghahanap kung ang ibang mga page ay may link patungo rito. Ang tool na ito ay hindi nagche-check para sa
noindex, kontrol sa pag-access (access control), o pagtanggal ng page.
Patakaran sa Privacy at Pagproseso ng Data
Ang iyong privacy ay pinangangalagaan habang ginagamit ang tool na ito. Ang inyong mga panuntunan sa crawl ay ginagawa at sinusuri sa inyong browser. Walang anuman ang ina-upload sa BroBroGo.
Mga Madalas Itanong (FAQ)
Ano ang maaaring idagdag ng generator na ito sa robots.txt? Magdagdag ng grupo ng user-agent, mga path ng Allow at Disallow, at isa o higit pang URL ng sitemap. Handa nang kopyahin ang preview sa isang robots.txt file.
Paano pumipili ng panuntunan ang path checker? Sumusunod ito sa pagkakasunud-sunod ng pagtutugma ng Google: ang pinakamahabang tumutugmang path ang nananalo. Kung ang magkatugmang panuntunan ng Allow at Disallow ay parehong partikular, ang Allow ang nananalo.
Inaalis ba ng Disallow ang isang page sa Google Search? Hindi. Ang isang hinarang na page ay maaari pa ring lumitaw sa mga resulta ng paghahanap kapag may ibang mga page na naka-link dito. Gumamit ng noindex, access control, o alisin ang page kapag kailangan mo itong ilayo sa paghahanap.