Robots.txt 的功能與作用
Robots.txt 是一個放置於網站根目錄的文字檔案,用於向網絡爬蟲(例如 Googlebot)提供網站的檢索指引。透過設定不同的規則,網站管理員可以控制爬蟲能夠存取或禁止存取網站的哪些部分。
「Robots.txt 產生與驗證」工具提供了一個直觀的介面,協助網站維護人員、開發人員以及任何需要管理爬蟲存取權限的用戶,建立符合規範的 robots.txt 檔案。用戶除了可以針對不同的檢索器新增特定規則外,還能直接在工具中測試特定的網站路徑,即時驗證該路徑會被允許還是禁止檢索。
設定 User-agent 指令與路徑規則
在 robots.txt 中,所有規則都必須歸屬在特定的 User-agent 群組之下。User-agent 代表特定的網絡爬蟲名稱,若要將規則套用到所有爬蟲,則使用星號 * 代替。
本工具在初始化時,會預設一組基礎規則:
User-agent: *Disallow: /admin
在設定規則時,必須遵守以下語法限制,否則工具會顯示對應的錯誤提示:
- User-agent 名稱:不能包含空格。若輸入不符,會顯示「請輸入不含空格的 User-agent 名稱;所有檢索器請使用 *。」。
- 規則路徑:必須以
/開頭,且不能包含空格。若輸入不符,會顯示「規則路徑必須以 / 開頭,且不能包含空格。」。 - 特殊字元
$:只能放在規則路徑的結尾,用以指定路徑的結束比對。若放在其他位置,會顯示「$ 只能放在規則路徑的結尾。」。
網站地圖(Sitemap)的配置
在 robots.txt 檔案中加入網站地圖網址,能協助搜尋引擎爬蟲更有效率地發現並檢索網站上的所有網頁。
在填寫網站地圖時,必須提供完整的網址,即必須以 http:// 或 https:// 開頭。如果輸入的網址格式不正確,工具會發出警告提示:「網站地圖網址需要完整的 http:// 或 https:// 位址。」。
規則衝突與 Google 解析機制
當多條規則同時存在時,爬蟲(特別是 Googlebot)會依據特定的優先順序來決定是否存取某個路徑。本工具內建的驗證功能會偵測以下常見的規則衝突與編寫問題:
| 衝突類型 | 觸發條件 | 工具提示訊息 | Google 處理機制 |
|---|---|---|---|
| 重複規則 | 同一個 User-agent 下設定了完全相同的路徑規則。 | 同一個 User-agent 下重複了這條規則。 | 重複的規則不會產生額外效果,應予以清理。 |
| 同路徑衝突 | Allow 和 Disallow 規則使用了完全相同的路徑。 | Allow 和 Disallow 使用相同路徑。兩者同樣具體時,Google 會採用 Allow。 | 當兩者同樣具體時,Google 預設會優先採用 Allow 規則。 |
| 重複群組 | 在多個不同的群組中命名了同一個 User-agent。 | Google 會合併名稱相同的 User-agent 群組。 | Google 在解析時會自動將這些群組的規則合併處理。 |
此外,Google 在比對路徑時,採用「最長路徑比對優先」原則,即符合路徑最長的規則擁有最高優先權。如果遇到長度相同且同時符合的 Allow 和 Disallow 規則,則由 Allow 優先。
驗證工具的輸出與限制
當你在工具中輸入 URL 路徑與指定的檢索器進行測試時,系統會即時運算並輸出以下幾種結果之一:
- 允許存取 —
{rule}:表示測試的路徑被允許存取,並顯示允許該路徑的具體規則。 - 禁止檢索 —
{rule}:表示測試的路徑已被封鎖,並顯示阻擋該路徑的具體規則。 - 沒有符合規則。Google 預設允許存取這個路徑。:表示沒有任何規則適用於該測試路徑,根據 Google 的機制,預設會允許爬蟲存取。
系統限制與注意事項
- 檔案大小限制:如果產生的 robots.txt 內容過於龐大,超過 100,000 個字元,工具會顯示「這份 robots.txt 太大,無法在這裡驗證。」。
- 搜尋收錄限制:必須注意,Disallow 規則只能阻止爬蟲檢索該網頁,但無法保證網頁不會出現在搜尋結果中。如果其他外部網頁連結了該被禁止檢索的網址,Google 仍然可能會將其收錄並顯示在搜尋結果中。
- 非安全防護工具:本工具僅用於驗證 robots.txt 語法,並不會檢查網頁內部的
noindex標籤、伺服器存取控制(如密碼保護)或網頁刪除狀態。若要徹底阻止網頁被收錄,應使用noindex、存取控制或直接刪除網頁。
私隱與數據處理說明
本工具的運作完全基於本地端處理。你所輸入的所有檢索規則、網站路徑及測試資料,皆直接在你的瀏覽器中進行產生與驗證,整個過程中不會將任何資料上傳到 BroBroGo 伺服器。
常見問題
這個工具能寫入哪些 robots.txt 規則?
你可以加入 User-agent 群組、Allow 和 Disallow 路徑,以及一個或多個 Sitemap 位址。右側內容可直接複製到 robots.txt 檔案。
路徑檢查如何選擇規則?
它依 Google 的比對順序判斷:符合路徑最長的規則優先;Allow 和 Disallow 同樣具體時,Allow 優先。
Disallow 會讓頁面從 Google 搜尋中消失嗎?
不會。其他頁面仍可連到被禁止檢索的網址,讓它出現在搜尋結果中。需要阻止收錄時,請使用 noindex、存取控制,或刪除頁面。