Robots.txt Dosyasının Amacı ve İşlevi
Bir web sitesinin kök dizininde yer alan robots.txt dosyası, arama motoru örümceklerinin ve diğer web tarayıcılarının (crawler) siteyi nasıl tarayacağını düzenleyen temel bir kılavuzdur. Bu dosya, hangi dizinlerin veya sayfaların taranabileceğini, hangilerinin ise tarama dışı bırakılması gerektiğini belirten yönergeler içerir.
Robots.txt dosyası, web sunucusunun kaynaklarını korumak ve arama motoru botlarının bütçesini (crawl budget) daha verimli kullanmasını sağlamak amacıyla kullanılır. Doğru yapılandırılmış bir robots.txt dosyası, sitenin taranmasını optimize ederken, hatalı kurallar önemli sayfaların arama motorları tarafından keşfedilmesini engelleyebilir.
User-Agent Yönergeleri ve Tarayıcı Davranışları
Robots.txt dosyasındaki kurallar belirli tarayıcı gruplarına göre düzenlenir. Her kural grubu bir User-agent bildirimi ile başlar.
- Genel Kurallar: Tüm tarayıcıları hedeflemek için
User-agent: *ifadesi kullanılır. - Özel Kurallar: Sadece belirli bir arama motoru botunu (örneğin Googlebot) hedeflemek için ilgili botun adı belirtilir.
User-agent tanımlamalarında boşluk karakteri kullanılamaz. Tarayıcılar kendi adlarına tanımlanmış özel bir grup varsa öncelikle o gruptaki kuralları uygular; kendilerine ait özel bir grup yoksa genel (*) gruptaki kuralları takip eder.
Allow ve Disallow Kurallarının Etkileşimi
Tarama izinleri iki temel kural ile yönetilir: Allow (İzin ver) ve Disallow (Engelle).
- Disallow: Belirtilen yolun tarayıcılar tarafından taranmasını engeller.
- Allow: Engellenmiş bir üst dizinin altındaki belirli bir alt yola veya sayfaya tarama izni vermek için kullanılır.
Bu kuralların tanımlanmasında belirli söz dizimi kuralları geçerlidir:
- Kural yolları her zaman
/karakteri ile başlamalıdır ve boşluk içermemelidir. - Bir yolun tam olarak belirli bir ifadeyle bittiğini belirtmek için kullanılan
$işareti yalnızca kural yolunun sonunda yer alabilir.
Aynı yol için hem Allow hem de Disallow kuralı tanımlandığında çelişki oluşur. Google, her iki kural da eşit derecede spesifik olduğunda varsayılan olarak Allow kuralını uygular.
Google'ın Eşleşme Sırası ve Kural Öncelikleri
Googlebot ve modern arama motoru tarayıcıları, robots.txt dosyasındaki kuralları değerlendirirken belirli bir eşleşme sırasını takip eder. Kuralların dosya içindeki yazım sırası veya alt alta durması önceliklerini belirlemez.
Eşleşme önceliği şu kurallara göre belirlenir:
- En Uzun Eşleşen Yol Kazanır: Karşılaştırılan kurallar arasında, taranmak istenen URL yolu ile en çok karakter eşleşmesi sağlayan (en spesifik olan) kural geçerli olur.
- Eşitlik Durumu: Eğer eşleşen Allow ve Disallow kuralları eşit derecede spesifik ise (karakter uzunlukları eşitse), Allow kuralı kazanır ve taramaya izin verilir.
- Eşleşen Kural Olmaması: Eğer test edilen yol ile eşleşen hiçbir kural bulunamazsa, Google varsayılan olarak bu yola izin verir.
Robots.txt Dosyalarında Sık Yapılan Hatalar
Robots.txt dosyası oluşturulurken yapılan hatalar, arama motorlarının siteyi yanlış taramasına veya önemli uyarıların gözden kaçmasına neden olabilir. Sık karşılaşılan hatalar ve kurallar şunlardır:
- Yinelenen Kurallar: Aynı user-agent grubu altında tamamen aynı kural yolunun birden fazla kez yazılması durumunda "Bu kural aynı user-agent için tekrarlanıyor." uyarısı oluşur.
- Aynı Yol Çelişkisi: Allow ve Disallow kurallarının aynı yolu hedeflemesi durumunda "Allow ve Disallow kuralları aynı yolu kullanıyor. Her ikisi de eşit derecede spesifik olduğunda Google, Allow kuralını uygular." uyarısı verilir.
- Grup Bölünmesi: Aynı user-agent adının farklı kural gruplarında ayrı ayrı tanımlanması durumunda "Google, aynı user-agent'ı belirten grupları birleştirir." uyarısı tetiklenir.
- Geçersiz Site Haritası: Site haritası URL'lerinin eksiksiz bir
http://veyahttps://protokolü ile başlamaması durumunda "Site haritası URL'leri eksiksiz bir http:// veya https:// adresi gerektirir." hatası alınır. - Boyut Sınırı: Oluşturulan robots.txt dosyasının toplam boyutu 100.000 karakteri aşarsa, araç üzerinde "Bu robots.txt dosyası burada incelenemeyecek kadar büyük." uyarısı gösterilir.
Arama Motoru İndeksleme Sınırları
Robots.txt dosyasındaki Disallow kuralları, bir sayfanın arama motoru dizinine (indeksine) eklenmesini kesin olarak engellemez.
Bir sayfa robots.txt üzerinden taramaya kapatılmış olsa dahi, internetteki başka web sayfaları veya site içi diğer sayfalar bu engellenen sayfaya bağlantı (link) veriyorsa, sayfa arama sonuçlarında görünmeye devam edebilir. Robots.txt yalnızca tarama davranışını kontrol eder; indekslemeyi, sayfa erişim yetkilerini veya sayfa kaldırma işlemlerini denetlemez.
Bir sayfanın arama sonuçlarında kesinlikle yer almamasını sağlamak için noindex meta etiketi kullanılmalı, sayfa şifreleme gibi erişim denetimi yöntemleriyle korunmalı veya sayfa sunucudan tamamen kaldırılmalıdır.
Tarayıcı İçi Veri İşleme ve Gizlilik
Robots.txt Oluşturucu ve Doğrulayıcı aracını kullanırken gizliliğiniz korunur. Tanımladığınız tüm tarama kuralları, site haritaları ve test ettiğiniz URL yolları doğrudan kendi web tarayıcınızda işlenir. Girdiğiniz hiçbir veri veya oluşturduğunuz kurallar BroBroGo sunucularına yüklenmez ve harici bir sisteme gönderilmez.
Sıkça Sorulan Sorular
Bu oluşturucu robots.txt dosyasına neler ekleyebilir?
Bir user-agent grubu, Allow ve Disallow yolları ve bir veya daha fazla site haritası URL'si ekleyin. Önizleme, bir robots.txt dosyasına kopyalanmaya hazır hale gelecektir.
Yol denetleyici bir kuralı nasıl seçer?
Google'ın eşleşme sırasını takip eder: en uzun eşleşen yol kazanır. Eşleşen Allow ve Disallow kuralları eşit derecede spesifik ise Allow kuralı geçerli olur.
Disallow kuralı bir sayfayı Google Arama'dan kaldırır mı?
Hayır. Engellenen bir sayfa, diğer sayfalar ona bağlantı verdiğinde arama sonuçlarında görünmeye devam edebilir. Bir sayfanın arama sonuçlarında kesinlikle yer almamasını istiyorsanız noindex etiketini, erişim denetimini kullanın veya sayfayı tamamen kaldırın.