Tujuan dan Fungsi Fail Robots.txt
Fail robots.txt ialah fail teks ringkas yang diletakkan pada direktori utama laman web untuk mengawal tingkah laku perayap web (seperti Googlebot) sebelum mereka mengakses mana-mana halaman. Alat Penjana & Pengesah Robots.txt membolehkan pembangun dan penyelenggara laman web membina peraturan rayapan ini dengan tepat, serta menguji sama ada laluan tertentu pada laman web akan dibenarkan atau disekat oleh perayap berdasarkan peraturan yang telah ditetapkan.
Pengurusan fail robots.txt yang betul adalah penting untuk memastikan sumber pelayan tidak dibazirkan oleh aktiviti rayapan yang tidak perlu pada bahagian latar belakang laman web. Alat ini memproses semua data secara langsung di dalam penyemak imbas anda. Peraturan rayapan anda dicipta dan disemak dalam penyemak imbas anda. Tiada apa-apa yang dimuat naik ke BroBroGo.
Memahami Arahan User-agent
Setiap kumpulan peraturan dalam fail robots.txt mesti dimulakan dengan arahan User-agent. Arahan ini menentukan perayap web khusus yang perlu mematuhi peraturan yang ditulis di bawahnya.
- Semua Perayap: Menggunakan tanda asterisk (
*) sebagai nama perayap bermaksud peraturan tersebut terpakai kepada semua ejen pengguna yang melawat laman web anda. Alat ini bermula dengan nilai lalaiUser-agent: *. - Perayap Khusus: Anda boleh menentukan nama perayap tertentu seperti Googlebot. Nama ejen pengguna ini tidak boleh mengandungi ruang kosong. Jika nama ejen pengguna tidak sah, sistem akan memaparkan ralat: "Masukkan satu nama user-agent tanpa ruang kosong, atau gunakan * untuk semua perayap.".
Peraturan Allow dan Disallow
Interaksi antara peraturan Allow (Benarkan) dan Disallow (Jangan benarkan) menentukan sama ada perayap boleh mengakses sesuatu laluan URL.
- Laluan Peraturan: Semua laluan yang dimasukkan mesti bermula dengan aksara
/dan tidak boleh mengandungi ruang kosong. Jika syarat ini tidak dipenuhi, ralat "Laluan peraturan mesti bermula dengan / dan tidak boleh mengandungi ruang kosong." akan dipaparkan. - Penggunaan Aksara Khusus: Aksara
$boleh digunakan untuk menandakan penghujung sesuatu laluan (padanan tepat di hujung URL). Aksara ini hanya boleh diletakkan di bahagian paling akhir laluan peraturan. Jika diletakkan di tempat lain, ralat "Gunakan $ hanya di penghujung laluan peraturan." akan muncul. - Konflik Laluan Sama: Jika anda menetapkan peraturan
AllowdanDisallowuntuk laluan yang sama, alat ini akan mengesan konflik tersebut dan memaparkan amaran: "Allow dan Disallow menggunakan laluan yang sama. Google menggunakan Allow apabila kedua-duanya adalah sama khusus.".
Kepentingan URL Peta Laman (Sitemap)
Menyertakan URL peta laman dalam fail robots.txt membantu perayap web menemui dan mengindeks halaman penting laman web anda dengan lebih cekap.
Peta laman yang dimasukkan mestilah menggunakan alamat URL yang lengkap dan mutlak. Alamat tersebut wajib bermula dengan protokol http:// atau https://. Sekiranya format URL yang dimasukkan tidak lengkap atau salah, alat akan mengeluarkan amaran: "URL peta laman memerlukan alamat http:// atau https:// yang lengkap.".
Logik Padanan Google dan Keutamaan Peraturan
Apabila perayap Googlebot menilai fail robots.txt untuk menentukan akses bagi sesuatu laluan URL, ia mengikut susunan padanan yang spesifik:
- Laluan Terpanjang Menang: Google akan membandingkan semua peraturan yang sepadan dengan URL yang diminta. Peraturan yang mempunyai bilangan aksara laluan paling panjang (paling spesifik) akan diutamakan dan diguna pakai.
- Keutamaan Allow: Jika terdapat peraturan
AllowdanDisallowyang sepadan dan kedua-duanya mempunyai panjang laluan yang sama (sama khusus), peraturanAllowakan menang dan akses akan dibenarkan. - Tiada Peraturan Sepadan: Sekiranya tiada satu pun peraturan dalam fail robots.txt yang sepadan dengan laluan URL yang diuji, Google akan membenarkan akses ke laluan tersebut secara lalai. Alat ini akan memaparkan status: "Tiada peraturan yang sepadan. Google membenarkan laluan ini secara lalai.".
Had dan Ralat Biasa dalam Robots.txt
Bagi memastikan fail robots.txt anda berfungsi tanpa masalah pada enjin carian, alat ini akan mengesahkan struktur fail dan memaparkan beberapa amaran penting jika terdapat ralat sintaksis:
| Jenis Isu / Ralat | Mesej Amaran Alat | Kesan / Tingkah Laku Perayap |
|---|---|---|
| Peraturan Berulang | "Peraturan ini diulang untuk user-agent yang sama." | Menambah saiz fail tanpa keperluan dan menyukarkan penyelenggaraan. |
| Kumpulan Ejen Berulang | "Google menggabungkan kumpulan yang menamakan user-agent yang sama." | Google akan menggabungkan semua peraturan daripada kumpulan-kumpulan tersebut menjadi satu kumpulan besar. |
| Saiz Fail Terlampau Besar | "Fail robots.txt ini terlalu besar untuk disemak di sini." | Berlaku apabila saiz fail robots.txt yang dijana melebihi 100,000 aksara. |
Had Kawalan Indeks Carian
Fail robots.txt direka khusus untuk mengawal aktiviti rayapan (crawling), bukannya kawalan pengindeksan (indexing).
Sekiranya anda menggunakan arahan Disallow untuk menyekat sesuatu halaman, halaman tersebut masih boleh muncul dalam keputusan carian Google. Ini berlaku jika terdapat laman web atau halaman lain yang memaut ke URL yang disekat itu. Fail robots.txt tidak memeriksa atau mengendalikan arahan noindex, sistem kawalan akses (seperti log masuk kata laluan), atau proses pemadaman halaman secara kekal daripada pelayan. Untuk menghalang halaman daripada diindeks sepenuhnya, kaedah lain seperti tag meta noindex atau pengesahan pengguna harus digunakan.
Soalan Lazim (FAQ)
Apakah yang boleh ditambahkan oleh penjana ini ke dalam robots.txt?
Tambahkan kumpulan user-agent, laluan Allow dan Disallow, serta satu atau lebih URL peta laman. Pratonton sedia untuk disalin ke dalam fail robots.txt.
Bagaimanakah penyemak laluan memilih peraturan?
Ia mengikut susunan padanan Google: laluan padanan terpanjang akan menang. Jika peraturan Allow dan Disallow yang sepadan adalah sama khusus, Allow akan menang.
Adakah Disallow mengalih keluar halaman daripada Google Search?
Tidak. Halaman yang disekat masih boleh muncul dalam keputusan carian apabila halaman lain memaut kepadanya. Gunakan noindex, kawalan akses, atau alih keluar halaman tersebut apabila anda mahu ia tidak dipaparkan dalam carian.
Adakah alat ini menyimpan atau memuat naik fail robots.txt saya ke pelayan luar?
Tidak. Semua proses penjanaan, semakan sintaks, dan pengesahan laluan dilakukan secara tempatan di dalam penyemak imbas web anda sendiri. Tiada sebarang data atau peraturan yang anda masukkan akan dihantar atau dimuat naik ke BroBroGo.