建立與驗證 robots.txt 檔案
robots.txt 檔案是網站管理員、開發人員與維護者用來引導網路檢索器(例如 Googlebot)存取網站內容的重要工具。透過設定明確的檢索規則,您可以有效控制檢索器存取網站特定路徑的權限,避免重要頁面被意外阻擋,或防止檢索器消耗資源在不必要的路徑上。
本工具提供直覺的介面,讓您在瀏覽器中直接建立 robots.txt 規則,並針對特定路徑進行檢索測試。所有的檢索規則與驗證程序皆在您的瀏覽器中產生和驗證,不會上傳到 BroBroGo。
檢索規則與 User-agent 指令
在 robots.txt 中,所有的規則都是圍繞著 User-agent(檢索器)展開。您可以為不同的檢索器指定不同的存取權限:
- User-agent:代表特定的網路檢索器名稱,若要套用至所有檢索器,請使用
*。User-agent 名稱中不能包含空格。 - 預設規則:工具啟動時,會預設提供一組
User-agent: *搭配Disallow: /admin的規則。 - 路徑規範:所有規則路徑必須以
/開頭,且不能包含空格。此外,$字元僅能使用於規則路徑的結尾,用以標示路徑的結束。
Allow 與 Disallow 規則的互動與 Google 比對順序
在設定檢索規則時,允許(Allow)與禁止檢索(Disallow)的交互作用決定了檢索器最終能否存取該路徑。本工具在檢查路徑時,完全遵循 Google 的比對順序與邏輯:
- 最長路徑優先:Google 會採用比對長度最長(最為具體)的規則。例如,若同時存在較短與較長的比對路徑,字元數較多、宣告最明確的規則將會勝出。
- 同等具體時 Allow 優先:當 Allow 和 Disallow 規則使用相同路徑,且兩者同樣具體時,Google 會採用 Allow。
網站地圖(Sitemap)的配置
在 robots.txt 中加入網站地圖網址,能協助搜尋引擎檢索器更有效率地發現您網站上的網頁。在填寫網站地圖時,必須提供完整的 http:// 或 https:// 協定與網址格式。
常見語法錯誤與規則衝突
維護 robots.txt 時,不當的設定可能導致檢索器無法正確解讀。本工具會自動偵測並標示以下常見問題:
- 重複的規則:在同一個 User-agent 下重複定義了相同的規則。
- 路徑衝突:Allow 和 Disallow 使用相同路徑。
- 重複的群組:在多個群組中命名了同一個 User-agent。Google 在處理時會合併名稱相同的 User-agent 群組。
- 檔案過大:若產生的 robots.txt 內容超過 100,000 個字元,系統會提示無法在此進行驗證。
搜尋引擎收錄的限制
必須特別注意的是,robots.txt 僅能控制檢索器的「檢索」行為,無法完全控制「索引」(收錄)狀態。即使某個頁面被設定為禁止檢索(Disallow),如果網際網路上有其他網頁建立了指向該網址的連結,該頁面仍然可能會出現在搜尋結果中。
本工具僅針對檢索規則進行語法與路徑測試,並不會檢查 noindex 標記、伺服器存取控制(如密碼保護)或頁面刪除狀態。若要徹底阻止頁面被搜尋引擎收錄,應採用上述其他技術手段。
常見問題
這個工具能寫入哪些 robots.txt 規則?
你可以加入 User-agent 群組、Allow 和 Disallow 路徑,以及一個或多個 Sitemap 位址。右側內容可直接複製到 robots.txt 檔案。
路徑檢查如何選擇規則?
它依 Google 的比對順序判斷:符合路徑最長的規則優先;Allow 和 Disallow 同樣具體時,Allow 優先。
Disallow 會讓頁面從 Google 搜尋中消失嗎?
不會。其他頁面仍可連到被禁止檢索的網址,讓它出現在搜尋結果中。需要阻止收錄時,請使用 noindex、存取控制,或刪除頁面。