Công cụ tạo & kiểm tra Robots.txt

Xây dựng các quy tắc thu thập thông tin và kiểm tra đường dẫn nào Googlebot có thể truy cập.

Quy tắc thu thập thông tin

Bắt đầu với trình thu thập thông tin (crawler) sẽ tuân theo các quy tắc này.

Sitemap

Robots.txt đã tạo

0
robots.txt
Sẵn sàng. Ví dụ mẫu chặn đường dẫn /admin đối với tất cả các trình thu thập.

Kiểm tra quy tắc

    Kiểm tra một đường dẫn

    Các quy tắc thu thập thông tin của bạn được tạo và kiểm tra ngay trong trình duyệt. Không có dữ liệu nào được tải lên BroBroGo.

    Hỏi đáp

    Công cụ tạo này có thể thêm những gì vào robots.txt?

    Thêm một nhóm user-agent, các đường dẫn Allow và Disallow, cùng một hoặc nhiều URL sitemap. Bản xem trước đã sẵn sàng để sao chép vào tệp robots.txt.

    Công cụ kiểm tra đường dẫn lựa chọn quy tắc như thế nào?

    Nó tuân theo thứ tự khớp của Google: đường dẫn khớp dài nhất sẽ thắng. Nếu các quy tắc Allow và Disallow khớp nhau có độ cụ thể bằng nhau, quy tắc Allow sẽ thắng.

    Quy tắc Disallow có xóa trang khỏi Google Tìm kiếm không?

    Không. Một trang bị chặn vẫn có thể xuất hiện trong kết quả tìm kiếm nếu có các trang khác liên kết đến nó. Hãy sử dụng thẻ noindex, kiểm soát quyền truy cập hoặc xóa trang khi bạn muốn giữ trang đó hoàn toàn không xuất hiện trên công cụ tìm kiếm.

    Vai trò và chức năng của tệp robots.txt

    Tệp robots.txt là một tệp văn bản đơn giản được đặt tại thư mục gốc của trang web để hướng dẫn các trình thu thập thông tin (crawler), ví dụ như Googlebot, về các phần mà chúng được phép hoặc không được phép truy cập. Công cụ tạo & kiểm tra Robots.txt hỗ trợ người quản trị trang web và các nhà phát triển xây dựng các quy tắc này một cách chính xác, đồng thời thử nghiệm trực tiếp các đường dẫn cụ thể để xác định khả năng truy cập của trình thu thập thông tin.

    Việc thiết lập robots.txt giúp kiểm soát lưu lượng truy cập của các trình thu thập thông tin đến máy chủ, tránh tình trạng quá tải và ngăn chặn việc quét các khu vực không cần thiết. Tuy nhiên, tệp này hoạt động dựa trên sự tự nguyện của các trình thu thập thông tin tuân thủ tiêu chuẩn.

    Thiết lập chỉ thị User-agent và quy tắc đường dẫn

    Mỗi nhóm quy tắc trong tệp robots.txt bắt đầu bằng việc xác định đối tượng áp dụng thông qua chỉ thị User-agent. Bạn có thể chỉ định một trình thu thập thông tin cụ thể bằng tên của nó hoặc sử dụng ký tự * để áp dụng quy tắc cho tất cả các trình thu thập thông tin.

    Khi cấu hình các quy tắc đường dẫn, có hai chỉ thị chính được sử dụng:

    • Disallow (Không cho phép): Ngăn chặn trình thu thập thông tin truy cập vào một đường dẫn cụ thể.
    • Allow (Cho phép): Cho phép trình thu thập thông tin truy cập vào một đường dẫn con nằm bên trong một thư mục đã bị cấm bởi quy tắc Disallow trước đó.

    Công cụ bắt đầu hoạt động với một cấu hình mặc định sẵn có gồm User-agent: *Disallow: /admin. Khi nhập liệu, tên của User-agent không được chứa khoảng trắng. Mọi đường dẫn quy tắc bắt buộc phải bắt đầu bằng dấu / và không được chứa khoảng trắng. Ký tự $ chỉ được phép sử dụng ở cuối đường dẫn quy tắc để biểu thị điểm kết thúc của một chuỗi đường dẫn.

    Tích hợp URL Sitemap trong robots.txt

    Sitemap (sơ đồ trang web) là tệp chứa danh sách các URL của trang web, giúp các công cụ tìm kiếm phát hiện và thu thập thông tin hiệu quả hơn. Việc khai báo URL Sitemap trực tiếp trong tệp robots.txt là một phương thức chuẩn hóa để chỉ đường cho các trình thu thập thông tin.

    Khi thêm sitemap vào cấu hình, URL sitemap cần một địa chỉ http:// hoặc https:// đầy đủ. Bạn có thể khai báo một hoặc nhiều URL sitemap khác nhau tùy thuộc vào cấu trúc sơ đồ trang web của bạn.

    Nguyên tắc khớp quy tắc của Google

    Khi một trình thu thập thông tin như Googlebot truy cập trang web, nó sẽ đối chiếu đường dẫn URL cần quét với các quy tắc được khai báo trong robots.txt. Quá trình đối chiếu này tuân theo các nguyên tắc xử lý nghiêm ngặt của Google:

    1. Độ dài khớp tối đa: Google áp dụng thứ tự khớp dựa trên độ dài của đường dẫn quy tắc. Quy tắc nào có đường dẫn khớp dài nhất (cụ thể nhất) với URL đang truy cập sẽ được ưu tiên áp dụng.
    2. Xử lý xung đột có độ dài bằng nhau: Trong trường hợp quy tắc Allow và Disallow khớp nhau và có độ cụ thể tương đương (độ dài đường dẫn bằng nhau), Google sẽ ưu tiên áp dụng quy tắc Allow.
    3. Kết hợp nhóm trùng lặp: Nếu cùng một user-agent được khai báo ở nhiều nhóm quy tắc khác nhau trong tệp, Google sẽ kết hợp các nhóm chỉ định cùng một user-agent này lại để xử lý chung.

    Phát hiện lỗi cú pháp và xung đột quy tắc

    Trong quá trình biên soạn, công cụ sẽ tự động phân tích cú pháp và hiển thị số lượng quy tắc thông qua nhãn {count} quy tắc. Nếu phát hiện các vấn đề không tối ưu hoặc sai cú pháp, hệ thống sẽ hiển thị thông báo Có {count} mục cần xem xét và đưa ra các cảnh báo cụ thể:

    • Nhập một tên user-agent không có khoảng trắng, hoặc sử dụng * cho tất cả các trình thu thập.
    • Đường dẫn quy tắc phải bắt đầu bằng dấu / và không được chứa khoảng trắng.
    • Chỉ sử dụng ký tự $ ở cuối đường dẫn quy tắc.
    • Quy tắc này bị lặp lại cho cùng một user-agent.
    • Quy tắc Allow và Disallow sử dụng cùng một đường dẫn. Google sẽ áp dụng Allow khi cả hai có độ cụ thể tương đương.
    • Google sẽ kết hợp các nhóm chỉ định cùng một user-agent.
    • URL sitemap cần một địa chỉ http:// hoặc https:// đầy đủ.
    • Tệp robots.txt này quá lớn để xem xét tại đây. Cảnh báo này xuất hiện nếu tệp robots.txt vượt quá giới hạn kích thước 100.000 ký tự.

    Nếu cấu hình hoàn toàn chuẩn xác, hệ thống sẽ hiển thị thông báo Không tìm thấy lỗi cú pháp hoặc xung đột quy tắc nào.

    Thử nghiệm đường dẫn trực tiếp

    Sau khi thiết lập các quy tắc, bạn có thể kiểm tra khả năng truy cập của một URL cụ thể bằng cách nhập đường dẫn cần kiểm tra và chọn trình thu thập thông tin tương ứng. Kết quả kiểm tra sẽ trả về một trong các trạng thái sau:

    • Được cho phép — {rule}: Đường dẫn kiểm tra được phép truy cập kèm theo quy tắc cụ thể cho phép hành động đó.
    • Bị chặn — {rule}: Đường dẫn kiểm tra bị chặn truy cập kèm theo quy tắc cụ thể ngăn cản hành động đó.
    • Không có quy tắc khớp. Google cho phép đường dẫn này theo mặc định.

    Giới hạn của robots.txt trong việc lập chỉ mục

    Một hiểu lầm phổ biến là việc sử dụng quy tắc Disallow trong robots.txt sẽ xóa hoàn toàn trang web khỏi kết quả tìm kiếm của Google. Thực tế, robots.txt chỉ ngăn chặn việc thu thập thông tin (crawling) chứ không ngăn chặn việc lập chỉ mục (indexing).

    Một trang bị chặn vẫn có thể xuất hiện trong kết quả tìm kiếm nếu có các trang khác liên kết đến nó. Công cụ này không thực hiện kiểm tra các thẻ noindex, các phương thức kiểm soát quyền truy cập (access control) hoặc yêu cầu xóa trang. Để đảm bảo một trang hoàn toàn không xuất hiện trên công cụ tìm kiếm, bạn phải sử dụng thẻ noindex, thiết lập mật khẩu bảo vệ thư mục hoặc thực hiện xóa trang hoàn toàn.

    Quyền riêng tư và xử lý dữ liệu

    Mọi thao tác tạo, chỉnh sửa và kiểm tra quy tắc thu thập thông tin của bạn đều được thực hiện trực tiếp trong trình duyệt web của bạn. Không có bất kỳ dữ liệu cấu hình, đường dẫn hay URL nào được tải lên máy chủ BroBroGo. Điều này đảm bảo cấu trúc thư mục nội bộ và các thử nghiệm của bạn được giữ kín hoàn toàn trên thiết bị cá nhân trong suốt quá trình làm việc.


    Câu hỏi thường gặp (FAQ)

    Công cụ tạo này có thể thêm những gì vào robots.txt?

    Thêm một nhóm user-agent, các đường dẫn Allow và Disallow, cùng một hoặc nhiều URL sitemap. Bản xem trước đã sẵn sàng để sao chép vào tệp robots.txt.

    Công cụ kiểm tra đường dẫn lựa chọn quy tắc như thế nào?

    Nó tuân theo thứ tự khớp của Google: đường dẫn khớp dài nhất sẽ thắng. Nếu các quy tắc Allow và Disallow khớp nhau có độ cụ thể bằng nhau, quy tắc Allow sẽ thắng.

    Quy tắc Disallow có xóa trang khỏi Google Tìm kiếm không?

    Không. Một trang bị chặn vẫn có thể xuất hiện trong kết quả tìm kiếm nếu có các trang khác liên kết đến nó. Hãy sử dụng thẻ noindex, kiểm soát quyền truy cập hoặc xóa trang khi bạn muốn giữ trang đó hoàn toàn không xuất hiện trên công cụ tìm kiếm.

    Kích thước tối đa của tệp robots.txt mà công cụ hỗ trợ kiểm tra là bao nhiêu?

    Công cụ hỗ trợ kiểm tra các tệp robots.txt có kích thước dưới 100.000 ký tự. Nếu vượt quá giới hạn này, hệ thống sẽ hiển thị cảnh báo "Tệp robots.txt này quá lớn để xem xét tại đây."