เครื่องมือสร้างและตรวจสอบ Robots.txt

สร้างกฎการไต่ข้อมูลและตรวจสอบว่า Googlebot สามารถเข้าถึงเส้นทางใดได้บ้าง

กฎการไต่ข้อมูล

เริ่มต้นด้วยการระบุบอตไต่ข้อมูล (crawler) ที่ต้องการให้ปฏิบัติตามกฎเหล่านี้

แผนผังเว็บไซต์ (Sitemaps)

robots.txt ที่สร้างขึ้น

0
robots.txt
พร้อมใช้งาน โดยตัวอย่างจะบล็อกเส้นทาง /admin สำหรับบอตไต่ข้อมูลทั้งหมด

การตรวจสอบกฎ

    ทดสอบเส้นทาง

    กฎการไต่ข้อมูลของคุณจะถูกสร้างและตรวจสอบภายในเบราว์เซอร์เท่านั้น ไม่มีการอัปโหลดข้อมูลใดๆ ไปยัง BroBroGo ครับ

    คำถามที่พบบ่อย

    เครื่องมือสร้างนี้สามารถเพิ่มข้อมูลใดลงใน robots.txt ได้บ้าง?

    คุณสามารถเพิ่มกลุ่ม User-agent, กำหนดเส้นทางที่อนุญาต (Allow) และไม่อนุญาต (Disallow) รวมถึงระบุ URL ของแผนผังเว็บไซต์ (Sitemap) ได้อย่างน้อยหนึ่งรายการ โดยตัวอย่างโค้ดจะพร้อมสำหรับการคัดลอกไปใช้ในไฟล์ robots.txt ทันทีครับ

    เครื่องมือตรวจสอบเส้นทางเลือกตัดสินใจตามกฎใด?

    ระบบจะปฏิบัติตามลำดับการจับคู่ของ Google คือกฎที่มีเส้นทางตรงกันยาวที่สุดจะเป็นฝ่ายชนะ และหากกฎ Allow และ Disallow ที่ตรงกันมีความเฉพาะเจาะจงเท่ากัน กฎ Allow จะเป็นฝ่ายชนะครับ

    คำสั่ง Disallow จะช่วยนำหน้าเว็บออกจากผลการค้นหาของ Google หรือไม่?

    ไม่ใช่ครับ หน้าเว็บที่ถูกบล็อกยังคงสามารถปรากฏในผลการค้นหาได้หากมีหน้าเว็บอื่นลิงก์มาหา หากคุณต้องการป้องกันไม่ให้หน้านั้นปรากฏในผลการค้นหาอย่างเด็ดขาด ควรใช้แท็ก noindex, การควบคุมการเข้าถึง (access control) หรือลบหน้านั้นออกไปเลยครับ

    การทำงานและบทบาทของไฟล์ robots.txt

    ไฟล์ robots.txt คือไฟล์ข้อความธรรมดาที่ติดตั้งไว้บนเซิร์ฟเวอร์เพื่อกำหนดแนวทางการเข้าถึงข้อมูลของบอตไต่ข้อมูล (web crawlers) เช่น Googlebot เครื่องมือสร้างและตรวจสอบ Robots.txt ช่วยให้ผู้ดูแลเว็บไซต์และนักพัฒนาสามารถเขียนกฎเกณฑ์เหล่านี้ได้อย่างถูกต้องตามหลักไวยากรณ์ พร้อมทั้งทดสอบเส้นทางของเว็บไซต์เพื่อดูว่าบอตจะถูกบล็อกหรือได้รับอนุญาตให้เข้าถึงข้อมูลในส่วนนั้นๆ

    การประมวลผลข้อมูลทั้งหมดของเครื่องมือนี้เกิดขึ้นภายในเบราว์เซอร์ของผู้ใช้งานโดยตรง ไม่มีการอัปโหลดข้อมูลใดๆ ไปยัง BroBroGo


    การกำหนดค่ากฎการไต่ข้อมูลและโครงสร้างคำสั่ง

    การควบคุมบอตไต่ข้อมูลจำเป็นต้องระบุคำสั่งให้ชัดเจนผ่านอินเทอร์เฟซของเครื่องมือ โดยมีองค์ประกอบสำคัญดังนี้:

    • User-agent: ชื่อของบอตไต่ข้อมูลที่ต้องการกำหนดกฎ หรือใช้เครื่องหมาย * เพื่อบังคับใช้กับบอตทุกตัว โดยชื่อ User-agent ต้องไม่มีช่องว่าง หากระบุชื่อไม่ถูกต้อง ระบบจะแสดงข้อผิดพลาด กรุณาระบุชื่อ User-agent หนึ่งชื่อโดยไม่มีช่องว่าง หรือใช้เครื่องหมาย * สำหรับบอตทั้งหมด
    • เส้นทาง (Path): เส้นทางบนเว็บไซต์ที่ต้องการจัดการ โดยต้องขึ้นต้นด้วยเครื่องหมาย / และไม่มีช่องว่าง หากไม่เป็นไปตามนี้ ระบบจะแจ้งเตือนว่า เส้นทางกฎต้องขึ้นต้นด้วยเครื่องหมาย / และต้องไม่มีช่องว่าง นอกจากนี้ สามารถใช้เครื่องหมาย $ ได้เฉพาะที่ส่วนท้ายของเส้นทางเท่านั้น หากใช้ในตำแหน่งอื่นจะแสดงข้อผิดพลาด ใช้เครื่องหมาย $ เฉพาะที่ส่วนท้ายของเส้นทางกฎเท่านั้น
    • แผนผังเว็บไซต์ (Sitemaps): การระบุ URL ของแผนผังเว็บไซต์เพื่อช่วยให้บอตค้นหาหน้าเว็บได้ง่ายขึ้น โดยต้องใช้ URL ที่สมบูรณ์และขึ้นต้นด้วย http:// หรือ https:// เท่านั้น หากระบุไม่ถูกต้อง ระบบจะแจ้งเตือนว่า URL ของแผนผังเว็บไซต์ต้องเป็นที่อยู่ที่สมบูรณ์ซึ่งขึ้นต้นด้วย http:// หรือ https://

    ค่าเริ่มต้นของเครื่องมือจะกำหนดให้ User-agent: * และ Disallow: /admin


    ข้อจำกัดและกฎการจับคู่ของ Google

    การทำงานของ robots.txt มีกฎเกณฑ์เฉพาะในการประมวลผล ซึ่งเครื่องมือนี้อ้างอิงตามมาตรฐานการทำงานของ Google ดังนี้:

    1. การจับคู่ตามความยาวเส้นทาง: Google จะใช้หลักการจับคู่เส้นทางที่ยาวที่สุดและมีความเฉพาะเจาะจงมากที่สุดเป็นหลักในการตัดสินใจ
    2. กรณีความเฉพาะเจาะจงเท่ากัน: หากกฎ Allow และ Disallow มีความยาวเส้นทางเท่ากันและตรงกับ URL เดียวกัน กฎ Allow จะเป็นฝ่ายชนะ
    3. การรวมกลุ่ม User-agent: หากมีการระบุ User-agent เดียวกันแยกไว้หลายกลุ่ม Google จะรวมกลุ่มเหล่านั้นเข้าด้วยกัน ซึ่งเครื่องมือจะแจ้งเตือนข้อผิดพลาดนี้ด้วยข้อความ Google จะรวมกลุ่มต่างๆ ที่ระบุชื่อ User-agent เดียวกันเข้าด้วยกัน
    4. ขนาดของไฟล์: ไฟล์ robots.txt ต้องมีขนาดไม่เกิน 100,000 ตัวอักษร หากเกินกว่านั้นเครื่องมือจะแสดงข้อความเตือนว่า ไฟล์ robots.txt นี้มีขนาดใหญ่เกินกว่าจะตรวจสอบที่นี่ได้

    การตรวจสอบข้อผิดพลาดและผลลัพธ์การทดสอบ

    เมื่อป้อนกฎและทดสอบเส้นทาง URL เครื่องมือจะวิเคราะห์ไวยากรณ์และแสดงผลลัพธ์การตรวจสอบทันที

    รายการแจ้งเตือนข้อผิดพลาดในกฎ

    • กฎนี้ถูกระบุซ้ำสำหรับ User-agent เดียวกัน
    • มีการใช้เส้นทางเดียวกันใน Allow และ Disallow ทั้งนี้ Google จะใช้กฎ Allow เมื่อทั้งสองกฎมีความเฉพาะเจาะจงเท่ากัน

    ผลลัพธ์การทดสอบเส้นทาง

    เมื่อระบุเส้นทาง URL และเลือกบอตไต่ข้อมูลเพื่อทดสอบ ระบบจะแสดงผลลัพธ์ข้อใดข้อหนึ่งดังต่อไปนี้:

    • อนุญาต — {rule}: เส้นทางนี้สามารถเข้าถึงได้ตามกฎที่ระบุ
    • บล็อก — {rule}: เส้นทางนี้ถูกจำกัดการเข้าถึงตามกฎที่ระบุ
    • ไม่มีกฎที่ตรงกัน โดยค่าเริ่มต้น Google จะอนุญาตให้เข้าถึงเส้นทางนี้

    ข้อจำกัดในการควบคุมการดัชนีข้อมูล

    การใช้คำสั่ง Disallow ใน robots.txt เป็นเพียงการขอความร่วมมือไม่ให้บอตเข้ามาไต่ข้อมูลในเส้นทางนั้น แต่ไม่ได้เป็นการป้องกันไม่ให้หน้าเว็บปรากฏในผลการค้นหาของ Google หากหน้าเว็บดังกล่าวได้รับการเชื่อมโยงลิงก์จากเว็บไซต์อื่น Google ก็ยังสามารถจัดทำดัชนีและแสดงผลในหน้าค้นหาได้

    เครื่องมือนี้ไม่ได้ทำหน้าที่ตรวจสอบแท็ก noindex การควบคุมการเข้าถึง (access control) หรือการลบหน้าเว็บออกจากระบบ หากต้องการบล็อกหน้าเว็บจากการแสดงผลบน Search Engine อย่างสมบูรณ์ ผู้ดูแลเว็บจำเป็นต้องใช้แท็ก noindex หรือตั้งค่าจำกัดสิทธิ์การเข้าถึงในระดับเซิร์ฟเวอร์แทน


    คำถามที่พบบ่อย (FAQ)

    เครื่องมือสร้างนี้สามารถเพิ่มข้อมูลใดลงใน robots.txt ได้บ้าง? คุณสามารถเพิ่มกลุ่ม User-agent, กำหนดเส้นทางที่อนุญาต (Allow) และไม่อนุญาต (Disallow) รวมถึงระบุ URL ของแผนผังเว็บไซต์ (Sitemap) ได้อย่างน้อยหนึ่งรายการ โดยตัวอย่างโค้ดจะพร้อมสำหรับการคัดลอกไปใช้ในไฟล์ robots.txt ทันทีครับ

    เครื่องมือตรวจสอบเส้นทางเลือกตัดสินใจตามกฎใด? ระบบจะปฏิบัติตามลำดับการจับคู่ของ Google คือกฎที่มีเส้นทางตรงกันยาวที่สุดจะเป็นฝ่ายชนะ และหากกฎ Allow และ Disallow ที่ตรงกันมีความเฉพาะเจาะจงเท่ากัน กฎ Allow จะเป็นฝ่ายชนะครับ

    คำสั่ง Disallow จะช่วยนำหน้าเว็บออกจากผลการค้นหาของ Google หรือไม่? ไม่ใช่ครับ หน้าเว็บที่ถูกบล็อกยังคงสามารถปรากฏในผลการค้นหาได้หากมีหน้าเว็บอื่นลิงก์มาหา หากคุณต้องการป้องกันไม่ให้หน้านั้นปรากฏในผลการค้นหาอย่างเด็ดขาด ควรใช้แท็ก noindex, การควบคุมการเข้าถึง (access control) หรือลบหน้านั้นออกไปเลยครับ