Γεννήτρια & Ελεγκτής Robots.txt

Δημιουργήστε κανόνες ανίχνευσης και ελέγξτε σε ποιες διαδρομές έχει πρόσβαση το Googlebot.

Κανόνες ανίχνευσης

Ξεκινήστε με το crawler που πρέπει να ακολουθεί αυτούς τους κανόνες.

Sitemaps

Παραγόμενο robots.txt

0
robots.txt
Έτοιμο. Το παράδειγμα αποκλείει το /admin για όλα τα crawlers.

Έλεγχος κανόνων

    Δοκιμή διαδρομής

    Οι κανόνες ανίχνευσης δημιουργούνται και ελέγχονται στο πρόγραμμα περιήγησής σας. Τίποτα δεν μεταφορτώνεται στο BroBroGo.

    Συχνές Ερωτήσεις

    Τι μπορεί να προσθέσει αυτή η γεννήτρια στο robots.txt;

    Προσθέστε μια ομάδα user-agent, διαδρομές Allow και Disallow, και ένα ή περισσότερα URL sitemap. Η προεπισκόπηση είναι έτοιμη για αντιγραφή σε ένα αρχείο robots.txt.

    Πώς επιλέγει κανόνα ο ελεγκτής διαδρομής;

    Ακολουθεί τη σειρά αντιστοίχισης της Google: η μεγαλύτερη αντίστοιχη διαδρομή κερδίζει. Εάν οι κανόνες Allow και Disallow που ταιριάζουν είναι εξίσου συγκεκριμένοι, κερδίζει το Allow.

    Καταργεί το Disallow μια σελίδα από την Αναζήτηση Google;

    Όχι. Μια αποκλεισμένη σελίδα μπορεί να εξακολουθεί να εμφανίζεται στα αποτελέσματα αναζήτησης όταν άλλοι ιστότοποι συνδέονται με αυτήν. Χρησιμοποιήστε noindex, έλεγχο πρόσβασης ή καταργήστε τη σελίδα όταν θέλετε να την κρατήσετε εκτός αναζήτησης.

    Ο σκοπός και η λειτουργία του αρχείου robots.txt

    Το αρχείο robots.txt είναι ένα αρχείο κειμένου που τοποθετείται στον ριζικό κατάλογο ενός ιστότοπου για να καθοδηγήσει τα προγράμματα ρομπότ (web crawlers), όπως το Googlebot, σχετικά με το ποιες σελίδες ή φακέλους επιτρέπεται ή δεν επιτρέπεται να επισκεφθούν. Η σωστή διαμόρφωση αυτού του αρχείου είναι κρίσιμη για τη διαχείριση του εύρους ζώνης του διακομιστή και τη βελτιστοποίηση του τρόπου με τον οποίο οι μηχανές αναζήτησης ανιχνεύουν το περιεχόμενο.

    Το εργαλείο «Γεννήτρια & Ελεγκτής Robots.txt» σας επιτρέπει να δημιουργήσετε κανόνες ανίχνευσης και να ελέγξετε σε ποιες διαδρομές έχει πρόσβαση το Googlebot. Μέσω της διεπαφής, μπορείτε να εισαγάγετε συγκεκριμένες οδηγίες, να εντοπίσετε συντακτικά σφάλματα και να δοκιμάσετε τη συμπεριφορά των crawlers σε πραγματικό χρόνο.

    Οδηγίες User-agent και ο ρόλος τους στον έλεγχο των crawlers

    Κάθε ομάδα κανόνων στο αρχείο robots.txt ξεκινά με τη δήλωση User-agent, η οποία προσδιορίζει το συγκεκριμένο πρόγραμμα ανίχνευσης στο οποίο αναφέρονται οι επόμενες οδηγίες.

    • Καθολικοί κανόνες: Χρησιμοποιώντας τον χαρακτήρα * ως όνομα crawler, οι κανόνες εφαρμόζονται σε όλα τα ρομπότ που επισκέπτονται τον ιστότοπο.
    • Συγκεκριμένοι crawlers: Μπορείτε να στοχεύσετε συγκεκριμένα ρομπότ εισάγοντας το ακριβές όνομά τους (για παράδειγμα, Googlebot).

    Κατά τη χρήση του εργαλείου, το όνομα του User-agent δεν πρέπει να περιέχει κενά διαστήματα. Εάν εισαχθεί μη έγκυρο όνομα, εμφανίζεται το σφάλμα: «Εισαγάγετε ένα όνομα user-agent χωρίς κενά, ή χρησιμοποιήστε * για όλα τα crawlers.». Επιπλέον, εάν ορίσετε τον ίδιο crawler σε διαφορετικές ομάδες κανόνων, το εργαλείο θα εμφανίσει την προειδοποίηση: «Η Google συνδυάζει ομάδες που ονομάζουν το ίδιο user-agent.».

    Κανόνες Allow και Disallow: Αλληλεπίδραση και περιορισμοί

    Οι οδηγίες Allow και Disallow καθορίζουν την άδεια ή την απαγόρευση πρόσβασης σε συγκεκριμένες διαδρομές του ιστότοπου.

    • Διαδρομές: Κάθε διαδρομή κανόνα πρέπει υποχρεωτικά να ξεκινά με τον χαρακτήρα / και απαγορεύεται να περιέχει κενά διαστήματα. Σε αντίθετη περίπτωση, το εργαλείο εμφανίζει το σφάλμα: «Οι διαδρομές κανόνων πρέπει να ξεκινούν με / και δεν μπορούν να περιέχουν κενά.».
    • Χρήση του χαρακτήρα $: Ο χαρακτήρας $ χρησιμοποιείται για να δηλώσει το ακριβές τέλος μιας διαδρομής. Η χρήση του επιτρέπεται αποκλειστικά στο τέλος της διαδρομής του κανόνα. Αν τοποθετηθεί σε άλλο σημείο, εμφανίζεται η ένδειξη: «Χρησιμοποιήστε το $ μόνο στο τέλος μιας διαδρομής κανόνα.».
    • Διπλότυποι κανόνες: Εάν εισαχθεί ο ίδιος ακριβώς κανόνας για τον ίδιο crawler, το εργαλείο εμφανίζει την προειδοποίηση: «Αυτός ο κανόνας επαναλαμβάνεται για το ίδιο user-agent.».
    • Συγκρούσεις: Όταν ένας κανόνας Allow και ένας κανόνας Disallow αναφέρονται στην ίδια ακριβώς διαδρομή, προκύπτει σύγκρουση. Το εργαλείο επισημαίνει αυτή την κατάσταση με το μήνυμα: «Τα Allow και Disallow χρησιμοποιούν την ίδια διαδρομή. Η Google εφαρμόζει το Allow όταν και τα δύο είναι εξίσου συγκεκριμένα.».

    Η σημασία των Sitemaps στο robots.txt

    Το Sitemap (χάρτης ιστότοπου) βοηθά τις μηχανές αναζήτησης να ανακαλύψουν και να ευρετηριάσουν αποτελεσματικά τις σελίδες του ιστοτόπου σας. Η δήλωση της τοποθεσίας του sitemap μέσα στο robots.txt επιτρέπει σε όλα τα προγράμματα ανίχνευσης να εντοπίσουν άμεσα αυτό το αρχείο.

    Στο πεδίο εισαγωγής του εργαλείου, κάθε URL sitemap πρέπει να αποτελεί μια πλήρη και έγκυρη διεύθυνση που ξεκινά με το πρωτόκολλο http:// ή https://. Εάν η διεύθυνση δεν είναι πλήρης, το εργαλείο εμφανίζει το σφάλμα: «Τα URL των sitemaps απαιτούν μια πλήρη διεύθυνση http:// ή https://.».

    Πώς λειτουργεί η σειρά αντιστοίχισης κανόνων της Google

    Όταν το Googlebot ή άλλοι συμβατοί crawlers αξιολογούν τους κανόνες του robots.txt για να αποφασίσουν αν θα επισκεφθούν μια συγκεκριμένη διαδρομή URL, ακολουθούν συγκεκριμένους κανόνες προτεραιότητας:

    1. Μήκος διαδρομής: Ισχύει ο κανόνας της μεγαλύτερης αντιστοίχισης. Η πιο συγκεκριμένη (μεγαλύτερη σε χαρακτήρες) διαδρομή που ταιριάζει με το URL υπερισχύει των συντομότερων κανόνων.
    2. Ισοπαλία προδιαγραφών: Εάν ένας κανόνας Allow και ένας κανόνας Disallow ταιριάζουν στο URL και έχουν ακριβώς το ίδιο μήκος (είναι εξίσου συγκεκριμένοι), ο κανόνας Allow υπερισχύει.

    Κατά τη δοκιμή μιας διαδρομής στο εργαλείο, το αποτέλεσμα της αξιολόγησης εμφανίζεται με μία από τις εξής ενδείξεις:

    • «Επιτρέπεται — {rule}»
    • «Αποκλείεται — {rule}»
    • «Δεν υπάρχει αντίστοιχος κανόνας. Η Google επιτρέπει αυτήν τη διαδρομή από προεπιλογή.»

    Περιορισμοί του robots.txt στην ευρετηρίαση

    Είναι σημαντικό να κατανοήσετε ότι το robots.txt δεν αποτελεί εργαλείο ασφάλειας ή απόλυτου αποκλεισμού περιεχομένου από τα αποτελέσματα αναζήτησης.

    • Εμφάνιση στα αποτελέσματα: Μια σελίδα που έχει αποκλειστεί μέσω Disallow μπορεί να εξακολουθεί να εμφανίζεται στα αποτελέσματα αναζήτησης εάν άλλοι ιστότοποι ή εσωτερικές σελίδες συνδέονται με αυτήν.
    • Τι δεν ελέγχει το εργαλείο: Η εφαρμογή δεν πραγματοποιεί ελέγχους για την οδηγία noindex, για συστήματα ελέγχου πρόσβασης (access control) ή για την οριστική κατάργηση σελίδων. Για την πλήρη απόκρυψη περιεχομένου απαιτείται η χρήση ετικετών noindex ή προστασία με κωδικό πρόσβασης.

    Λειτουργία και επεξεργασία δεδομένων

    Η χρήση του εργαλείου πραγματοποιείται με γνώμονα την ιδιωτικότητα των δεδομένων σας. Οι κανόνες ανίχνευσης δημιουργούνται και ελέγχονται στο πρόγραμμα περιήγησής σας. Τίποτα δεν μεταφορτώνεται στο BroBroGo.

    Το εργαλείο ξεκινά αυτόματα με μια προκαθορισμένη ρύθμιση: User-agent: * και Disallow: /admin. Εάν το μέγεθος του παραγόμενου αρχείου υπερβεί τους 100.000 χαρακτήρες, εμφανίζεται η προειδοποίηση: «Αυτό το robots.txt είναι πολύ μεγάλο για να ελεγχθεί εδώ.».


    Συχνές Ερωτήσεις (FAQ)

    Τι μπορεί να προσθέσει αυτή η γεννήτρια στο robots.txt;

    Προσθέστε μια ομάδα user-agent, διαδρομές Allow και Disallow, και ένα ή περισσότερα URL sitemap. Η προεπισκόπηση είναι έτοιμη για αντιγραφή σε ένα αρχείο robots.txt.

    Πώς επιλέγει κανόνα ο ελεγκτής διαδρομής;

    Ακολουθεί τη σειρά αντιστοίχισης της Google: η μεγαλύτερη αντίστοιχη διαδρομή κερδίζει. Εάν οι κανόνες Allow και Disallow που ταιριάζουν είναι εξίσου συγκεκριμένοι, κερδίζει το Allow.

    Καταργεί το Disallow μια σελίδα από την Αναζήτηση Google;

    Όχι. Μια αποκλεισμένη σελίδα μπορεί να εξακολουθεί να εμφανίζεται στα αποτελέσματα αναζήτησης όταν άλλοι ιστότοποι συνδέονται με αυτήν. Χρησιμοποιήστε noindex, έλεγχο πρόσβασης ή καταργήστε τη σελίδα όταν θέλετε να την κρατήσετε εκτός αναζήτησης.

    Πού αποθηκεύονται οι κανόνες που εισάγω στο εργαλείο;

    Οι κανόνες ανίχνευσης δημιουργούνται και ελέγχονται στο πρόγραμμα περιήγησής σας. Τίποτα δεν μεταφορτώνεται στο BroBroGo, διασφαλίζοντας την τοπική επεξεργασία των δεδομένων σας.