Centru de ajutor
Trenarea chatbotului dumneavoastră

Cum să reduceți numărul de caractere de antrenare la scanarea unui site web

Ultima actualizare:

Atunci când antrenați chatbotul dumneavoastră pe un site web, limitarea volumului de date scanate la ceea ce este cel mai util ajută la reducerea consumului de caractere, accelerează antrenarea și îmbunătățește calitatea răspunsurilor, concentrându-se doar pe conținutul relevant.

Acest ghid explică modul în care vă puteți optimiza scanarea folosind secțiunea Advanced settings (Setări avansate) din fereastra modală de antrenare pe site web (Training > Links > Add New Training: Website [Antrenare > Linkuri > Adaugă o nouă antrenare: Site web]).


De ce mai puțină antrenare poate fi o alegere mai bună

ChatLab folosește arhitectura RAG (Retrieval-Augmented Generation). În loc să memoreze tot conținutul site-ului web, AI-ul caută cele mai relevante fragmente de informație în momentul fiecărei întrebări adresate de utilizator și le utilizează pentru a genera un răspuns.

Problema unui volum prea mare de date

Mai multe date nu înseamnă întotdeauna răspunsuri mai bune. Adăugarea de conținut irelevant sau redundant poate perturba procesul de căutare a informațiilor:

  • RAG evaluează fragmentele de conținut în funcție de relevanța lor pentru întrebarea utilizatorului. Dacă site-ul dumneavoastră conține multe pagini cu text repetitiv, vag sau generic (meniuri, subsoluri, comunicate de presă, pagini cu etichete de blog), acestea diluează calitatea rezultatelor căutării.
  • Când chatbotul extrage mai multe fragmente de slabă valoare, care au cuvinte-cheie comune, dar sunt lipsite de un context util, acesta poate genera răspunsuri inexacte, excesiv de generale sau în afara subiectului.
  • De exemplu: Dacă subsolul dumneavoastră conține linkuri precum „Acasă”, „Contact”, „Confidențialitate”, „Întrebări frecvente” pe fiecare pagină, botul ar putea răspunde cu un paragraf generic din subsol în loc de un număr util de telefon sau o adresă de e-mail atunci când un utilizator întreabă „Cum vă pot contacta?”.

Semnal puternic, zgomot redus = răspunsuri mai bune

Scanând doar conținutul util, ajutați AI-ul să găsească un context clar, specific și de înaltă calitate pentru fiecare întrebare. Concentrați-vă pe:

  • Descrieri de produse
  • Pagini cu întrebări frecvente (FAQ)
  • Articole de asistență
  • Documente cu politici și regulamente
  • Pagini principale de destinație (landing pages)

Utilizați sitemap-ul în locul scanării complete a site-ului

Recomandat: Utilizați opțiunea de sitemap ori de câte ori este posibil.

Scanarea completă a site-ului web urmărește toate linkurile vizibile de pe pagină, inclusiv linkurile din subsoluri, meniuri și bare laterale, ceea ce duce adesea la scanarea unui conținut repetitiv sau lipsit de valoare. Aceste secțiuni sunt prezente de obicei pe fiecare pagină și rareori conțin informații unice utile pentru răspunsurile de pe chat.

Folosind un sitemap (aflat de obicei la adresa https://yourdomain.com/sitemap.xml), dumneavoastră:

  • Evitați indexarea paginilor inutile (de exemplu, pagini juridice, linkuri către rețele sociale, etichete de blog repetate)
  • Controlați cu exactitate ce adrese URL sunt scanate
  • Preveniți consumul accidental și excesiv de caractere din meniuri, subsoluri și antete

Prezentare generală a setărilor avansate (Advanced Settings)

Pentru a accesa setările avansate, apăsați pe Add New Training: Website în fila Training, apoi extindeți secțiunea Advanced settings. Setările sunt organizate în patru categorii:

  • URL Filtering (Filtrare URL) - Controlați ce adrese URL să includeți sau să excludeți
  • Query Parameters (Parametri de interogare) - Gestionați parametrii URL
  • Content Filtering (Filtrare conținut) - Filtrați elemente specifice din pagină
  • Scraping Behavior (Comportament de extragere) - Configurați modul în care este extras conținutul

Filtrare URL (URL Filtering)

Opțiuni pentru URL Filtering

Includeți doar anumite adrese URL

Câmp: Advanced Settings > URL Filtering > Include only URLs that contain (Include doar URL-urile care conțin)

Adăugați cuvinte-cheie separate prin punct și virgulă pentru a include în scanare doar anumite adrese URL.

Exemplu: Pentru a scana doar paginile de asistență în limba engleză:

/en;/help

Această setare scanează doar paginile care conțin /en sau help în URL, economisind caractere prin omiterea secțiunilor irelevante.

Excludeți adresele URL irelevante

Câmp: Advanced Settings > URL Filtering > Exclude URLs that contain (Exclude URL-urile care conțin)

Adăugați cuvinte-cheie separate prin punct și virgulă pentru a omite secțiuni precum bloguri, imagini sau știri.

Exemplu:

/news;/pictures;/press

Astfel se evită scanarea secțiunilor bogate în conținut, dar irelevante pentru chatbot, cum ar fi știrile sau galeriile de imagini.


Parametri de interogare (Query Parameters)

Opțiuni pentru Query Parameters

Ignorați toți parametrii de interogare

Câmp: Advanced Settings > Query Parameters > Ignore all query parameters (Ignoră toți parametrii de interogare)

Bifați această casetă pentru a trata adresele URL cu parametri de interogare diferiți ca fiind aceeași pagină. Acest lucru previne scanarea conținutului duplicat.

Ignorați anumiți parametri de interogare

Câmp: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignoră anumiți parametri de interogare)

Adăugați denumiri de parametri separate prin punct și virgulă pentru a ignora parametrii specifici de urmărire sau de filtrare.

Exemplu:

ref;source;campaign;utm_source

Această setare tratează page.html?ref=email și page.html?ref=social ca fiind același URL.


Filtrare conținut (Content Filtering)

Opțiuni pentru Content Filtering

Includeți elemente specifice

Câmp: Advanced Settings > Content Filtering > Include element IDs (Include identificatori de elemente)

Adăugați identificatori de elemente separați prin punct și virgulă pentru a scana doar anumite părți ale paginii. Folosiți #id pentru ID-urile de elemente, .classname pentru clase și paranteze drepte pentru atribute: [data-id="82874db"] se potrivește cu elementele care au exact acea valoare de atribut, iar [data-content] se potrivește cu fiecare element care are atributul respectiv, indiferent de valoare.

Exemplu:

#main-content;.article-body;[data-section="product"]

Astfel se scanează doar zona principală de conținut, corpul articolelor și secțiunile de produse, ignorând restul elementelor.

Urmăriți doar linkurile din elementele incluse

Câmp: Advanced Settings > Content Filtering > Follow only links in included elements (Urmărește doar linkurile din elementele incluse)

Acest comutator apare atunci când specificați Include element IDs. Când este activat, crawlerul va urmări doar linkurile găsite în interiorul elementelor incluse. Acest lucru este util atunci când doriți să limitați indexarea la secțiuni specifice ale site-ului, cum ar fi zonele de conținut ale articolelor, ignorând în același timp meniurile de navigare din antete sau subsoluri.

Implicit: Dezactivat (sunt urmărite toate linkurile de pe pagină)

Excludeți elemente din pagină

Câmp: Advanced Settings > Content Filtering > Exclude element IDs (Exclude identificatori de elemente)

Preveniți scanarea antetelor, a subsolurilor și a altor elemente de structură. Se aplică aceeași sintaxă de selectare: header și footer fără prefix, #id, .classname sau un atribut între paranteze drepte, cum ar fi [data-id="82874db"] ori [data-nosnippet]. Selectorii de atribute sunt foarte utili atunci când elementul pe care doriți să îl eliminați nu are un id sau o clasă stabilă, dar conține un atribut data-* pe care îl puteți copia din instrumentele pentru dezvoltatori ale browserului.

Exemplu:

header;footer;#navigation;.sidebar;[data-nosnippet]

Această setare elimină blocurile HTML care se repetă pe fiecare pagină și care, în general, nu conțin informații utile pentru chatbotul dumneavoastră.

Urmăriți linkurile din elementele excluse

Câmp: Advanced Settings > Content Filtering > Follow links in excluded elements (Urmărește linkurile din elementele excluse)

Acest comutator apare atunci când specificați Exclude element IDs. Când este activat, crawlerul va continua să urmărească linkurile găsite în interiorul elementelor excluse (cum ar fi meniurile de navigare din antet), chiar dacă acel conținut în sine este exclus de la antrenare.

Implicit: Dezactivat (linkurile din elementele excluse nu sunt urmărite)

Caz de utilizare: Activați această opțiune atunci când doriți să excludeți conținutul din antet/subsol de la antrenare, dar aveți în continuare nevoie ca crawlerul să descopere pagini prin intermediul linkurilor de navigare din acele zone. Astfel obțineți ce este mai bun din ambele abordări: date curate de antrenare, fără elemente inutile de meniu, parcurgând totuși întregul site.

Important: Dacă folosiți scanarea completă a site-ului web și excludeți elemente precum antetul fără a activa opțiunea „Follow links in excluded elements”, scanerul ar putea să nu descopere linkurile mai profunde (meniurile se află adesea în interiorul antetelor). În acest caz, fie activați comutatorul, fie folosiți un sitemap pentru cea mai sigură și eficientă metodă.


Comportament de extragere (Scraping Behavior)

Opțiuni pentru Scraping Behavior

Extrageți documente

Câmp: Advanced Settings > Scraping Behavior > Scrape documents (Extrage documente)

Când este activat, sistemul extrage și procesează conținutul documentelor găsite pe site-ul web. În prezent sunt acceptate fișierele PDF.

Excludeți linkurile către imagini

Câmp: Advanced Settings > Scraping Behavior > Exclude image links (Exclude linkurile către imagini)

Activați acest comutator pentru a exclude toate linkurile către imagini din setul de date pentru antrenare. În mod implicit, sistemul extrage toate linkurile către imagini, ceea ce poate crește semnificativ numărul de caractere.

Activarea acestei opțiuni vă poate reduce substanțial consumul de caractere.

Extrageți conținutul ascuns

Câmp: Advanced Settings > Scraping Behavior > Scrape hidden contents (Extrage conținutul ascuns)

Când este activat (implicit), sistemul extrage conținutul din elementele HTML ascunse (elemente cu proprietăți CSS precum display:none, visibility:hidden sau similare).

Implicit: Activat

Când să dezactivați: Dezactivați această opțiune pentru a omite conținutul ascuns și a extrage doar elementele vizibile. Acest lucru este util atunci când site-urile web conțin elemente ascunse precum:

  • Secțiuni de tip acordeon restrânse
  • Conținut exclusiv pentru dispozitive mobile sau doar pentru desktop
  • Câmpuri ascunse de formular
  • Comentarii pentru dezvoltatori sau informații de depanare

Dezactivarea acestei opțiuni poate reduce numărul de caractere și împiedică introducerea conținutului ascuns irelevant în datele dumneavoastră de antrenare.

Pauză între pagini

Câmp: Advanced Settings > Scraping Behavior > Delay between pages (Pauză între pagini)

Adăugați o pauză (în secunde) între scanarea fiecărei pagini pentru a preveni supraîncărcarea serverului dumneavoastră. Util pentru site-urile web care impun limite privind frecvența cererilor (rate limiting).

Simulați vizita dintr-o anumită țară

Câmp: Advanced Settings > Scraping Behavior > Country code (Cod de țară)

Dacă site-ul dumneavoastră afișează conținut diferit în funcție de locația vizitatorului, introduceți un cod de țară format din două litere (de exemplu, US, PL, DE) pentru a simula scanarea din acea locație.


Configurație recomandată pentru majoritatea site-urilor web

Pentru majoritatea site-urilor web, următoarea configurație oferă cel mai bun echilibru între un conținut complet și un consum redus de caractere:

  1. Utilizați un sitemap atunci când este disponibil, pentru un control precis al adreselor URL
  2. Exclude element IDs: header;footer;#navigation;.sidebar
  3. Activați „Exclude image links” pentru a elimina adresele URL ale imaginilor din antrenare
  4. Dezactivați „Scrape hidden contents” dacă site-ul dumneavoastră conține multe elemente ascunse
  5. Luați în considerare „Follow links in excluded elements” dacă folosiți scanarea completă cu antete excluse

Această configurație reduce de obicei consumul de caractere cu 20-40%, păstrând în același timp tot conținutul valoros.


Rezumat: Bune practici

  • Utilizați sitemap-ul în locul scanării complete pentru un control riguros
  • Includeți adrese URL pentru a viza doar conținutul valoros
  • Excludeți adrese URL pentru a omite paginile irelevante sau încărcate inutil
  • Ignorați parametrii de interogare pentru a evita conținutul duplicat
  • Excludeți identificatorii de elemente pentru a elimina părțile repetitive ale paginilor, precum antetele și subsolurile
  • Controlați urmărirea linkurilor cu opțiunile „Follow only links in included elements” sau „Follow links in excluded elements” pentru un control detaliat al indexării
  • Excludeți linkurile către imagini pentru a reduce semnificativ numărul de caractere
  • Dezactivați extragerea conținutului ascuns dacă site-ul dumneavoastră are elemente ascunse care nu sunt necesare
  • Concentrați-vă pe conținutul util pentru botul dumneavoastră (întrebări frecvente, pagini de produse, articole de asistență)