Robots.txt 產生與驗證

設定檢索規則,檢查 Googlebot 能否存取某個路徑。

檢索規則

先選擇應遵循這組規則的檢索器。

網站地圖

產生的 robots.txt

0
robots.txt
準備就緒。範例會為所有檢索器禁止 /admin。

規則檢查

    測試路徑

    檢索規則會在你的瀏覽器中產生和驗證,不會上傳到 BroBroGo。

    常見問題

    這個工具能寫入哪些 robots.txt 規則?

    你可以加入 User-agent 群組、Allow 和 Disallow 路徑,以及一個或多個 Sitemap 位址。右側內容可直接複製到 robots.txt 檔案。

    路徑檢查如何選擇規則?

    它依 Google 的比對順序判斷:符合路徑最長的規則優先;Allow 和 Disallow 同樣具體時,Allow 優先。

    Disallow 會讓頁面從 Google 搜尋中消失嗎?

    不會。其他頁面仍可連到被禁止檢索的網址,讓它出現在搜尋結果中。需要阻止收錄時,請使用 noindex、存取控制,或刪除頁面。

    Robots.txt 的功能與作用

    Robots.txt 是一個放置於網站根目錄的文字檔案,用於向網絡爬蟲(例如 Googlebot)提供網站的檢索指引。透過設定不同的規則,網站管理員可以控制爬蟲能夠存取或禁止存取網站的哪些部分。

    「Robots.txt 產生與驗證」工具提供了一個直觀的介面,協助網站維護人員、開發人員以及任何需要管理爬蟲存取權限的用戶,建立符合規範的 robots.txt 檔案。用戶除了可以針對不同的檢索器新增特定規則外,還能直接在工具中測試特定的網站路徑,即時驗證該路徑會被允許還是禁止檢索。

    設定 User-agent 指令與路徑規則

    在 robots.txt 中,所有規則都必須歸屬在特定的 User-agent 群組之下。User-agent 代表特定的網絡爬蟲名稱,若要將規則套用到所有爬蟲,則使用星號 * 代替。

    本工具在初始化時,會預設一組基礎規則:

    • User-agent: *
    • Disallow: /admin

    在設定規則時,必須遵守以下語法限制,否則工具會顯示對應的錯誤提示:

    • User-agent 名稱:不能包含空格。若輸入不符,會顯示「請輸入不含空格的 User-agent 名稱;所有檢索器請使用 *。」。
    • 規則路徑:必須以 / 開頭,且不能包含空格。若輸入不符,會顯示「規則路徑必須以 / 開頭,且不能包含空格。」。
    • 特殊字元 $:只能放在規則路徑的結尾,用以指定路徑的結束比對。若放在其他位置,會顯示「$ 只能放在規則路徑的結尾。」。

    網站地圖(Sitemap)的配置

    在 robots.txt 檔案中加入網站地圖網址,能協助搜尋引擎爬蟲更有效率地發現並檢索網站上的所有網頁。

    在填寫網站地圖時,必須提供完整的網址,即必須以 http://https:// 開頭。如果輸入的網址格式不正確,工具會發出警告提示:「網站地圖網址需要完整的 http:// 或 https:// 位址。」。

    規則衝突與 Google 解析機制

    當多條規則同時存在時,爬蟲(特別是 Googlebot)會依據特定的優先順序來決定是否存取某個路徑。本工具內建的驗證功能會偵測以下常見的規則衝突與編寫問題:

    衝突類型 觸發條件 工具提示訊息 Google 處理機制
    重複規則 同一個 User-agent 下設定了完全相同的路徑規則。 同一個 User-agent 下重複了這條規則。 重複的規則不會產生額外效果,應予以清理。
    同路徑衝突 Allow 和 Disallow 規則使用了完全相同的路徑。 Allow 和 Disallow 使用相同路徑。兩者同樣具體時,Google 會採用 Allow。 當兩者同樣具體時,Google 預設會優先採用 Allow 規則。
    重複群組 在多個不同的群組中命名了同一個 User-agent。 Google 會合併名稱相同的 User-agent 群組。 Google 在解析時會自動將這些群組的規則合併處理。

    此外,Google 在比對路徑時,採用「最長路徑比對優先」原則,即符合路徑最長的規則擁有最高優先權。如果遇到長度相同且同時符合的 Allow 和 Disallow 規則,則由 Allow 優先。

    驗證工具的輸出與限制

    當你在工具中輸入 URL 路徑與指定的檢索器進行測試時,系統會即時運算並輸出以下幾種結果之一:

    • 允許存取 — {rule}:表示測試的路徑被允許存取,並顯示允許該路徑的具體規則。
    • 禁止檢索 — {rule}:表示測試的路徑已被封鎖,並顯示阻擋該路徑的具體規則。
    • 沒有符合規則。Google 預設允許存取這個路徑。:表示沒有任何規則適用於該測試路徑,根據 Google 的機制,預設會允許爬蟲存取。

    系統限制與注意事項

    • 檔案大小限制:如果產生的 robots.txt 內容過於龐大,超過 100,000 個字元,工具會顯示「這份 robots.txt 太大,無法在這裡驗證。」。
    • 搜尋收錄限制:必須注意,Disallow 規則只能阻止爬蟲檢索該網頁,但無法保證網頁不會出現在搜尋結果中。如果其他外部網頁連結了該被禁止檢索的網址,Google 仍然可能會將其收錄並顯示在搜尋結果中。
    • 非安全防護工具:本工具僅用於驗證 robots.txt 語法,並不會檢查網頁內部的 noindex 標籤、伺服器存取控制(如密碼保護)或網頁刪除狀態。若要徹底阻止網頁被收錄,應使用 noindex、存取控制或直接刪除網頁。

    私隱與數據處理說明

    本工具的運作完全基於本地端處理。你所輸入的所有檢索規則、網站路徑及測試資料,皆直接在你的瀏覽器中進行產生與驗證,整個過程中不會將任何資料上傳到 BroBroGo 伺服器。


    常見問題

    這個工具能寫入哪些 robots.txt 規則?

    你可以加入 User-agent 群組、Allow 和 Disallow 路徑,以及一個或多個 Sitemap 位址。右側內容可直接複製到 robots.txt 檔案。

    路徑檢查如何選擇規則?

    它依 Google 的比對順序判斷:符合路徑最長的規則優先;Allow 和 Disallow 同樣具體時,Allow 優先。

    Disallow 會讓頁面從 Google 搜尋中消失嗎?

    不會。其他頁面仍可連到被禁止檢索的網址,讓它出現在搜尋結果中。需要阻止收錄時,請使用 noindex、存取控制,或刪除頁面。