Κέντρο βοήθειας
Εκπαίδευση του chatbot σας

Πώς να μειώσετε τους χαρακτήρες εκπαίδευσης κατά τη σάρωση ενός ιστότοπου

Τελευταία ενημέρωση:

Όταν εκπαιδεύετε το chatbot σας σε έναν ιστότοπο, ο περιορισμός του όγκου των σαρωμένων δεδομένων στα πιο χρήσιμα στοιχεία βοηθά στη μείωση της χρήσης χαρακτήρων, επιταχύνει την εκπαίδευση και βελτιώνει την ποιότητα των απαντήσεων εστιάζοντας μόνο σε σχετικό περιεχόμενο.

Αυτός ο οδηγός εξηγεί πώς να βελτιστοποιήσετε τη σάρωσή σας χρησιμοποιώντας τις ρυθμίσεις Advanced settings (Σύνθετες ρυθμίσεις) στο παράθυρο εκπαίδευσης ιστοτόπου (Training > Links > Add New Training: Website [Εκπαίδευση > Σύνδεσμοι > Προσθήκη νέας εκπαίδευσης: Ιστότοπος]).


Γιατί η λιγότερη εκπαίδευση μπορεί να είναι καλύτερη

Το ChatLab χρησιμοποιεί αρχιτεκτονική RAG (Retrieval-Augmented Generation). Αντί να απομνημονεύει όλο το περιεχόμενο του ιστοτόπου, η AI αναζητά τα πιο σχετικά τμήματα πληροφοριών τη στιγμή της κάθε ερώτησης του χρήστη και τα χρησιμοποιεί για να δημιουργήσει μια απάντηση.

Το πρόβλημα με τα υπερβολικά πολλά δεδομένα

Περισσότερα δεδομένα δεν σημαίνουν πάντα καλύτερες απαντήσεις. Η προσθήκη άσχετου ή περιττού περιεχομένου μπορεί να προκαλέσει σύγχυση στη διαδικασία ανάκτησης:

  • Το RAG αξιολογεί τμήματα περιεχομένου ως προς τη συνάφειά τους με την ερώτηση του χρήστη. Εάν ο ιστότοπός σας περιέχει πολλές σελίδες με επαναλαμβανόμενο, ασαφές ή γενικόλογο κείμενο (μενού, υποσέλιδα, δελτία τύπου, σελίδες ετικετών ιστολογίου), αυτά αποδυναμώνουν την ποιότητα των αποτελεσμάτων αναζήτησης.
  • Όταν το chatbot ανακτά πολλαπλά τμήματα χαμηλής αξίας που μοιράζονται λέξεις-κλειδιά αλλά στερούνται χρήσιμου πλαισίου, ενδέχεται να δημιουργήσει ανακριβείς, υπερβολικά γενικές ή εκτός θέματος απαντήσεις.
  • Για παράδειγμα: Εάν το υποσέλιδό σας περιέχει συνδέσμους όπως "Αρχική", "Επικοινωνία", "Απόρρητο", "FAQ" σε κάθε σελίδα, το bot μπορεί να απαντήσει με μια γενική παράγραφο από το υποσέλιδο αντί για έναν χρήσιμο αριθμό τηλεφώνου ή email όταν ένας χρήστης ρωτά "Πώς μπορώ να επικοινωνήσω μαζί σας;".

Υψηλό σήμα, χαμηλός θόρυβος = Καλύτερες απαντήσεις

Σαρώνοντας μόνο χρήσιμο περιεχόμενο, βοηθάτε την AI να ανακτά σαφές, συγκεκριμένο και υψηλής ποιότητας πλαίσιο για κάθε ερώτηση. Εστιάστε σε:

  • Περιγραφές προϊόντων
  • Σελίδες συχνών ερωτήσεων (FAQ)
  • Άρθρα υποστήριξης
  • Έγγραφα πολιτικών
  • Βασικές σελίδες προορισμού (landing pages)

Χρησιμοποιήστε Sitemap αντί για πλήρη σάρωση ιστοτόπου

Συνιστάται: Χρησιμοποιήστε την επιλογή sitemap (χάρτης ιστοτόπου) όποτε είναι δυνατόν.

Η πλήρης σάρωση ιστοτόπου ακολουθεί όλους τους ορατούς συνδέσμους στη σελίδα, συμπεριλαμβανομένων των συνδέσμων από υποσέλιδα, μενού και πλευρικές στήλες, γεγονός που συχνά οδηγεί στη σάρωση επαναλαμβανόμενου περιεχομένου ή περιεχομένου χωρίς αξία. Αυτές οι ενότητες συνήθως υπάρχουν σε κάθε σελίδα και σπάνια περιλαμβάνουν μοναδικές πληροφορίες χρήσιμες για τις απαντήσεις των συνομιλιών.

Χρησιμοποιώντας ένα sitemap (που συνήθως βρίσκεται στη διεύθυνση https://yourdomain.com/sitemap.xml):

  • Αποφεύγετε την ανίχνευση περιττών σελίδων (π.χ. νομικές σελίδες, συνδέσμους κοινωνικών δικτύων, επαναλαμβανόμενες ετικέτες ιστολογίου)
  • Ελέγχετε ακριβώς ποιες διευθύνσεις URL σαρώνονται
  • Αποτρέπετε την τυχαία υπερβολική χρήση χαρακτήρων από μενού, υποσέλιδα και κεφαλίδες

Επισκόπηση σύνθετων ρυθμίσεων

Για να αποκτήσετε πρόσβαση στις σύνθετες ρυθμίσεις, κάντε κλικ στο Add New Training: Website στην καρτέλα Training (Εκπαίδευση) και, στη συνέχεια, αναπτύξτε την ενότητα Advanced settings. Οι ρυθμίσεις είναι οργανωμένες σε τέσσερις κατηγορίες:

  • URL Filtering (Φιλτράρισμα URL) - Ελέγξτε ποιες διευθύνσεις URL θα συμπεριληφθούν ή θα εξαιρεθούν
  • Query Parameters (Παράμετροι ερωτήματος) - Διαχειριστείτε τις παραμέτρους URL
  • Content Filtering (Φιλτράρισμα περιεχομένου) - Φιλτράρετε συγκεκριμένα στοιχεία της σελίδας
  • Scraping Behavior (Συμπεριφορά εξαγωγής περιεχομένου) - Διαμορφώστε τον τρόπο εξαγωγής του περιεχομένου

URL Filtering

Επιλογές φιλτραρίσματος URL

Συμπερίληψη μόνο συγκεκριμένων URL

Πεδίο: Advanced Settings > URL Filtering > Include only URLs that contain (Να συμπεριλαμβάνονται μόνο τα URL που περιέχουν)

Προσθέστε λέξεις-κλειδιά διαχωρισμένες με ελληνικό ερωτηματικό για να συμπεριλάβετε μόνο συγκεκριμένες διευθύνσεις URL στη σάρωση.

Παράδειγμα: Για να σαρώσετε μόνο τις αγγλικές σελίδες βοήθειας:

/en;/help

Αυτό σαρώνει μόνο σελίδες που περιέχουν το /en ή το help στο URL, εξοικονομώντας χαρακτήρες παραλείποντας μη σχετικές ενότητες.

Εξαίρεση μη σχετικών URL

Πεδίο: Advanced Settings > URL Filtering > Exclude URLs that contain (Εξαίρεση των URL που περιέχουν)

Προσθέστε λέξεις-κλειδιά διαχωρισμένες με ελληνικό ερωτηματικό για να παραλείψετε ενότητες όπως ιστολόγια, εικόνες ή νέα.

Παράδειγμα:

/news;/pictures;/press

Αυτό αποτρέπει τη σάρωση ενοτήτων με βαρύ περιεχόμενο αλλά άσχετων με το chatbot, όπως ειδήσεις ή συλλογές εικόνων.


Query Parameters

Επιλογές παραμέτρων ερωτήματος

Αγνοήστε όλες τις παραμέτρους ερωτήματος

Πεδίο: Advanced Settings > Query Parameters > Ignore all query parameters (Αγνόηση όλων των παραμέτρων ερωτήματος)

Ενεργοποιήστε αυτό το πλαίσιο ελέγχου για να αντιμετωπίζονται οι διευθύνσεις URL με διαφορετικές παραμέτρους ερωτήματος ως η ίδια σελίδα. Αυτό αποτρέπει τη σάρωση διπλότυπου περιεχομένου.

Αγνοήστε συγκεκριμένες παραμέτρους ερωτήματος

Πεδίο: Advanced Settings > Query Parameters > Ignore specific query parameters (Αγνόηση συγκεκριμένων παραμέτρων ερωτήματος)

Προσθέστε ονόματα παραμέτρων διαχωρισμένα με ελληνικό ερωτηματικό για να αγνοήσετε συγκεκριμένες παραμέτρους παρακολούθησης ή φιλτραρίσματος.

Παράδειγμα:

ref;source;campaign;utm_source

Αυτό αντιμετωπίζει τα page.html?ref=email και page.html?ref=social ως το ίδιο URL.


Content Filtering

Επιλογές φιλτραρίσματος περιεχομένου

Συμπερίληψη συγκεκριμένων στοιχείων

Πεδίο: Advanced Settings > Content Filtering > Include element IDs (Συμπερίληψη αναγνωριστικών στοιχείων)

Προσθέστε αναγνωριστικά στοιχείων διαχωρισμένα με ελληνικό ερωτηματικό για να σαρώσετε μόνο συγκεκριμένα τμήματα της σελίδας. Χρησιμοποιήστε #id για τα ID στοιχείων, .classname για κλάσεις και αγκύλες για γνωρίσματα (attributes): το [data-id="82874db"] αντιστοιχεί σε στοιχεία με τη συγκεκριμένη ακριβώς τιμή γνωρίσματος, ενώ το [data-content] αντιστοιχεί σε κάθε στοιχείο που διαθέτει το γνώρισμα γενικά.

Παράδειγμα:

#main-content;.article-body;[data-section="product"]

Αυτό σαρώνει μόνο την κύρια περιοχή περιεχομένου, τα σώματα των άρθρων και τις ενότητες προϊόντων, αγνοώντας οτιδήποτε άλλο.

Ακολουθήστε μόνο συνδέσμους σε συμπεριλαμβανόμενα στοιχεία

Πεδίο: Advanced Settings > Content Filtering > Follow only links in included elements (Ακολούθηση μόνο συνδέσμων στα συμπεριλαμβανόμενα στοιχεία)

Αυτός ο διακόπτης εμφανίζεται όταν ορίζετε το πεδίο Include element IDs. Όταν είναι ενεργοποιημένος, το πρόγραμμα ανίχνευσης (crawler) θα ακολουθεί μόνο συνδέσμους που βρίσκονται μέσα στα συμπεριλαμβανόμενα στοιχεία. Αυτό είναι χρήσιμο όταν θέλετε να περιορίσετε την ανίχνευση σε συγκεκριμένες ενότητες του ιστοτόπου, όπως περιοχές περιεχομένου άρθρων, αγνοώντας τα μενού πλοήγησης σε κεφαλίδες ή υποσέλιδα.

Προεπιλογή: Απενεργοποιημένο (ακολουθούνται όλοι οι σύνδεσμοι στη σελίδα)

Εξαίρεση στοιχείων σελίδας

Πεδίο: Advanced Settings > Content Filtering > Exclude element IDs (Εξαίρεση αναγνωριστικών στοιχείων)

Αποτρέψτε τη σάρωση κεφαλίδων, υποσέλιδων και άλλων στοιχείων διάταξης. Ισχύει η ίδια σύνταξη επιλογέων: header και footer χωρίς πρόθεμα, #id, .classname, ή ένα γνώρισμα σε αγκύλες, όπως [data-id="82874db"] ή [data-nosnippet]. Οι επιλογείς γνωρισμάτων είναι πρακτικοί όταν το στοιχείο που θέλετε να παραλείψετε δεν έχει σταθερό id ή class, αλλά φέρει ένα γνώρισμα data-* που μπορείτε να αντιγράψετε από τα εργαλεία προγραμματιστή του προγράμματος περιήγησης.

Παράδειγμα:

header;footer;#navigation;.sidebar;[data-nosnippet]

Αυτό αφαιρεί μπλοκ HTML που επαναλαμβάνονται σε κάθε σελίδα και γενικά δεν περιέχουν χρήσιμο περιεχόμενο για το chatbot σας.

Ακολουθήστε συνδέσμους σε εξαιρούμενα στοιχεία

Πεδίο: Advanced Settings > Content Filtering > Follow links in excluded elements (Ακολούθηση συνδέσμων στα εξαιρούμενα στοιχεία)

Αυτός ο διακόπτης εμφανίζεται όταν ορίζετε το πεδίο Exclude element IDs. Όταν είναι ενεργοποιημένος, το πρόγραμμα ανίχνευσης θα εξακολουθεί να ακολουθεί συνδέσμους που βρίσκονται μέσα σε εξαιρούμενα στοιχεία (όπως μενού πλοήγησης σε κεφαλίδες), παρόλο που το ίδιο το περιεχόμενο εξαιρείται από την εκπαίδευση.

Προεπιλογή: Απενεργοποιημένο (οι σύνδεσμοι στα εξαιρούμενα στοιχεία δεν ακολουθούνται)

Περίπτωση χρήσης: Ενεργοποιήστε το όταν θέλετε να εξαιρέσετε το περιεχόμενο της κεφαλίδας/του υποσέλιδου από την εκπαίδευση, αλλά εξακολουθείτε να χρειάζεστε το πρόγραμμα ανίχνευσης να εντοπίζει σελίδες μέσω των συνδέσμων πλοήγησης σε αυτές τις περιοχές. Αυτό σας προσφέρει τα καλύτερα και από τους δύο κόσμους: καθαρά δεδομένα εκπαίδευσης χωρίς την ακαταστασία των μενού, ενώ παράλληλα ανιχνεύεται ολόκληρος ο ιστότοπός σας.

Σημαντικό: Εάν χρησιμοποιείτε πλήρη σάρωση ιστοτόπου και εξαιρείτε στοιχεία όπως το header χωρίς να ενεργοποιήσετε την επιλογή "Follow links in excluded elements", ο σαρωτής ενδέχεται να μην εντοπίσει βαθύτερους συνδέσμους (τα μενού βρίσκονται συχνά μέσα σε κεφαλίδες). Σε αυτήν την περίπτωση, είτε ενεργοποιήστε τον διακόπτη είτε χρησιμοποιήστε ένα sitemap για την ασφαλέστερη και πιο αποτελεσματική μέθοδο.


Scraping Behavior

Επιλογές συμπεριφοράς εξαγωγής περιεχομένου

Εξαγωγή εγγράφων

Πεδίο: Advanced Settings > Scraping Behavior > Scrape documents (Εξαγωγή εγγράφων)

Όταν είναι ενεργοποιημένο, το σύστημα εξάγει και επεξεργάζεται περιεχόμενο εγγράφων που εντοπίζονται στον ιστότοπο. Προς το παρόν υποστηρίζει αρχεία PDF.

Εξαίρεση συνδέσμων εικόνων

Πεδίο: Advanced Settings > Scraping Behavior > Exclude image links (Εξαίρεση συνδέσμων εικόνων)

Ενεργοποιήστε αυτόν τον διακόπτη για να εξαιρέσετε όλους τους συνδέσμους εικόνων από το σύνολο δεδομένων εκπαίδευσης. Από προεπιλογή, το σύστημα εξάγει όλους τους συνδέσμους εικόνων, γεγονός που μπορεί να αυξήσει σημαντικά τον αριθμό των χαρακτήρων.

Η ενεργοποίηση αυτής της επιλογής μπορεί να μειώσει ουσιαστικά τον αριθμό των χαρακτήρων σας.

Εξαγωγή κρυφού περιεχομένου

Πεδίο: Advanced Settings > Scraping Behavior > Scrape hidden contents (Εξαγωγή κρυφού περιεχομένου)

Όταν είναι ενεργοποιημένο (προεπιλογή), το σύστημα εξάγει περιεχόμενο από κρυφά στοιχεία HTML (στοιχεία με display:none, visibility:hidden ή παρόμοιες ιδιότητες CSS).

Προεπιλογή: Ενεργοποιημένο

Πότε να το απενεργοποιήσετε: Απενεργοποιήστε αυτήν την επιλογή για να παραλείψετε το κρυφό περιεχόμενο και να εξαγάγετε μόνο ορατά στοιχεία. Αυτό είναι χρήσιμο όταν οι ιστότοποι περιέχουν κρυφό περιεχόμενο όπως:

  • Σεπτυγμένες ενότητες ακορντεόν (accordions)
  • Περιεχόμενο μόνο για κινητά ή μόνο για υπολογιστές
  • Κρυφά πεδία φορμών
  • Σχόλια προγραμματιστών ή πληροφορίες εντοπισμού σφαλμάτων

Η απενεργοποίηση αυτής της επιλογής μπορεί να μειώσει τον αριθμό χαρακτήρων και να αποτρέψει την εισαγωγή μη σχετικού κρυφού περιεχομένου στα δεδομένα εκπαίδευσής σας.

Καθυστέρηση μεταξύ σελίδων

Πεδίο: Advanced Settings > Scraping Behavior > Delay between pages (Καθυστέρηση μεταξύ σελίδων)

Προσθέστε μια καθυστέρηση (σε δευτερόλεπτα) μεταξύ της σάρωσης κάθε σελίδας για να αποφύγετε την υπερφόρτωση του διακομιστή σας. Χρήσιμο για ιστότοπους με περιορισμούς ρυθμού αιτημάτων (rate limiting).

Προσομοίωση επίσκεψης από συγκεκριμένη χώρα

Πεδίο: Advanced Settings > Scraping Behavior > Country code (Κωδικός χώρας)

Εάν ο ιστότοπός σας εμφανίζει διαφορετικό περιεχόμενο ανάλογα με την τοποθεσία του επισκέπτη, εισαγάγετε έναν 2-γράμματο κωδικό χώρας (π.χ. US, PL, DE) για να προσομοιώσετε τη σάρωση από τη συγκεκριμένη τοποθεσία.


Προτεινόμενη διαμόρφωση για τους περισσότερους ιστοτόπους

Για τους περισσότερους ιστοτόπους, η ακόλουθη διαμόρφωση παρέχει την καλύτερη ισορροπία μεταξύ πλήρους περιεχομένου και μειωμένου αριθμού χαρακτήρων:

  1. Χρησιμοποιήστε sitemap όταν είναι διαθέσιμο για ακριβή έλεγχο των URL
  2. Exclude element IDs: header;footer;#navigation;.sidebar
  3. Ενεργοποιήστε το "Exclude image links" για να καταργήσετε τις διευθύνσεις URL εικόνων από την εκπαίδευση
  4. Απενεργοποιήστε το "Scrape hidden contents" εάν ο ιστότοπός σας έχει πολλά κρυφά στοιχεία
  5. Εξετάστε το ενδεχόμενο χρήσης του "Follow links in excluded elements" εάν χρησιμοποιείτε πλήρη σάρωση με εξαιρούμενες κεφαλίδες

Αυτή η διαμόρφωση συνήθως μειώνει τον αριθμό των χαρακτήρων κατά 20-40%, διατηρώντας παράλληλα όλο το πολύτιμο περιεχόμενο.


Σύνοψη: Βέλτιστες πρακτικές

  • Χρησιμοποιήστε sitemap αντί για πλήρη σάρωση για ακριβή έλεγχο
  • Συμπεριλάβετε URL (Include URLs) για να στοχεύσετε μόνο σε πολύτιμο περιεχόμενο
  • Εξαιρέστε URL (Exclude URLs) για να παραλείψετε μη σχετικές ή βαριές σελίδες
  • Αγνοήστε τις παραμέτρους ερωτήματος για να αποφύγετε το διπλότυπο περιεχόμενο
  • Εξαιρέστε αναγνωριστικά στοιχείων (Exclude element IDs) για να καταργήσετε επαναλαμβανόμενα μέρη της σελίδας, όπως κεφαλίδες και υποσέλιδα
  • Ελέγξτε την παρακολούθηση συνδέσμων με τα "Follow only links in included elements" ή "Follow links in excluded elements" για λεπτομερή έλεγχο ανίχνευσης
  • Εξαιρέστε τους συνδέσμους εικόνων για να μειώσετε σημαντικά τον αριθμό των χαρακτήρων
  • Απενεργοποιήστε την εξαγωγή κρυφού περιεχομένου (scrape hidden contents) εάν ο ιστότοπός σας περιέχει περιττά κρυφά στοιχεία
  • Εστιάστε σε χρήσιμο περιεχόμενο για το bot σας (FAQ, σελίδες προϊόντων, άρθρα υποστήριξης)