Kada trenirate svog chatbota na veb-sajtu, ograničavanje količine skeniranih podataka na ono što je najkorisnije pomaže u smanjenju potrošnje karaktera, ubrzava treniranje i poboljšava kvalitet odgovora fokusiranjem isključivo na relevantan sadržaj.
Ovaj vodič objašnjava kako da optimizujete skeniranje koristeći Advanced settings (Napredna podešavanja) u prozoru za treniranje putem veb-sajta (Training > Links > Add New Training: Website).
Zašto manje treniranja može biti bolje
ChatLab koristi RAG (Retrieval-Augmented Generation) arhitekturu. Umesto da pamti ceo sadržaj veb-sajta, AI pretražuje najrelevantnije delove informacija u trenutku svakog korisničkog pitanja i koristi ih za generisanje odgovora.
Problem sa previše podataka
Više podataka ne znači uvek bolje odgovore. Dodavanje nerelevantnog ili suvišnog sadržaja može zbuniti proces pronalaženja informacija:
- RAG ocenjuje delove sadržaja prema relevantnosti za korisničko pitanje. Ako Vaš sajt sadrži mnogo stranica sa tekstom koji se ponavlja, neodređenim ili generičkim tekstom (meniji, podnožja, saopštenja za javnost, stranice sa oznakama na blogu), oni razvodnjavaju kvalitet rezultata pretrage.
- Kada chatbot preuzme više delova niske vrednosti koji dele ključne reči, ali nemaju koristan kontekst, može generisati netačne, previše opšte odgovore ili odgovore van teme.
- Na primer: Ako Vaše podnožje (footer) na svakoj stranici sadrži linkove poput „Početna", „Kontakt", „Privatnost", „Česta pitanja", bot bi mogao da odgovori generičkim pasusom iz podnožja umesto korisnim brojem telefona ili e-mailom kada korisnik pita „Kako mogu da stupim u kontakt sa vama?"
Jak signal, malo šuma = bolji odgovori
Skeniranjem isključivo korisnog sadržaja pomažete AI-ju da pronađe jasan, specifičan i visokokvalitetan kontekst za svako pitanje. Fokusirajte se na:
- Opise proizvoda
- Stranice sa čestim pitanjima (FAQ)
- Članke podrške
- Dokumenta o pravilima poslovanja
- Ključne odredišne stranice (landing pages)
Koristite Sitemap umesto kompletnog skeniranja veb-sajta
Preporučeno: Koristite opciju sitemap (mapa sajta) kad god je to moguće.
Kompletno skeniranje veb-sajta prati sve vidljive linkove na stranici, uključujući linkove iz podnožja, menija i bočnih traka, što često dovodi do skeniranja sadržaja koji se ponavlja ili nema vrednost. Ovi odeljci su obično prisutni na svakoj stranici i retko sadrže jedinstvene informacije korisne za odgovore u četu.
Korišćenjem mape sajta (koja se obično nalazi na https://yourdomain.com/sitemap.xml):
- Izbegavate indeksiranje nepotrebnih stranica (npr. pravne stranice, linkovi ka društvenim mrežama, ponovljene oznake na blogu)
- Precizno kontrolišete koje se URL adrese skeniraju
- Sprečavate slučajno prekomerno trošenje karaktera na menije, podnožja i zaglavlja
Pregled naprednih podešavanja
Da biste pristupili naprednim podešavanjima, kliknite na Add New Training: Website (Dodaj novo treniranje: Veb-sajt) u kartici Training, a zatim proširite odeljak Advanced settings. Podešavanja su organizovana u četiri kategorije:
- URL Filtering (Filtriranje URL adresa) - Kontrolišite koje URL adrese treba uključiti ili isključiti
- Query Parameters (Parametri upita) - Upravljajte parametrima unutar URL adresa
- Content Filtering (Filtriranje sadržaja) - Filtrirajte specifične elemente stranice
- Scraping Behavior (Ponašanje ekstrakcije) - Konfigurišite način izvlačenja sadržaja
URL Filtering
Uključivanje samo specifičnih URL adresa
Polje: Advanced Settings > URL Filtering > Include only URLs that contain (Uključi samo URL adrese koje sadrže)
Dodajte ključne reči odvojene tačkom i zarezom da biste u skeniranje uključili samo određene URL adrese.
Primer: Za skeniranje samo stranica za pomoć na engleskom jeziku:
/en;/help
Ovo skenira samo stranice koje u URL adresi sadrže /en ili help, štedeći karaktere preskakanjem nerelevantnih odeljaka.
Isključivanje nerelevantnih URL adresa
Polje: Advanced Settings > URL Filtering > Exclude URLs that contain (Isključi URL adrese koje sadrže)
Dodajte ključne reči odvojene tačkom i zarezom da biste preskočili odeljke kao što su blogovi, slike ili vesti.
Primer:
/news;/pictures;/press
Ovim se izbegava skeniranje odeljaka bogatih sadržajem koji nisu relevantni za chatbota, kao što su vesti ili galerije slika.
Query Parameters
Ignorisanje svih parametara upita
Polje: Advanced Settings > Query Parameters > Ignore all query parameters (Ignoriši sve parametre upita)
Označite ovo polje da bi se URL adrese sa različitim parametrima upita tretirale kao ista stranica. Ovo sprečava skeniranje dupliranog sadržaja.
Ignorisanje specifičnih parametara upita
Polje: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignoriši specifične parametre upita)
Dodajte nazive parametara odvojene tačkom i zarezom da biste ignorisali određene parametre za praćenje ili filtriranje.
Primer:
ref;source;campaign;utm_source
Ovo tretira page.html?ref=email i page.html?ref=social kao istu URL adresu.
Content Filtering
Uključivanje specifičnih elemenata
Polje: Advanced Settings > Content Filtering > Include element IDs (Uključi ID-jeve elemenata)
Dodajte identifikatore elemenata odvojene tačkom i zarezom da biste skenirali samo određene delove stranice. Koristite #id za ID-jeve elemenata, .classname za klase i uglaste zagrade za atribute: [data-id="82874db"] odgovara elementima sa tom tačnom vrednošću atributa, dok [data-content] odgovara svakom elementu koji uopšte ima taj atribut.
Primer:
#main-content;.article-body;[data-section="product"]
Ovo skenira samo oblast glavnog sadržaja, tekstove članaka i odeljke o proizvodima, ignorišući sve ostalo.
Praćenje linkova samo u uključenim elementima
Polje: Advanced Settings > Content Filtering > Follow only links in included elements (Prati samo linkove u uključenim elementima)
Ovaj prekidač se pojavljuje kada navedete Include element IDs. Kada je omogućen, program za indeksiranje će pratiti samo linkove pronađene unutar uključenih elemenata. Ovo je korisno kada želite da ograničite indeksiranje na određene delove veb-sajta, poput oblasti sa sadržajem članaka, dok ignorišete navigacione menije u zaglavljima ili podnožjima.
Podrazumevano: Onemogućeno (prate se svi linkovi na stranici)
Isključivanje elemenata stranice
Polje: Advanced Settings > Content Filtering > Exclude element IDs (Isključi ID-jeve elemenata)
Sprečite skeniranje zaglavlja, podnožja i drugih strukturnih elemenata stranice. Primenjuje se ista sintaksa selektora: header i footer bez prefiksa, #id, .classname ili atribut u uglastim zagradama poput [data-id="82874db"] ili [data-nosnippet]. Selektori atributa su praktični kada element koji želite da uklonite nema stabilan id ili class, ali ima data-* atribut koji možete kopirati iz razvojnih alata pregledača.
Primer:
header;footer;#navigation;.sidebar;[data-nosnippet]
Ovim se uklanjaju HTML blokovi koji se ponavljaju na svakoj stranici i generalno ne sadrže koristan sadržaj za Vašeg chatbota.
Praćenje linkova u isključenim elementima
Polje: Advanced Settings > Content Filtering > Follow links in excluded elements (Prati linkove u isključenim elementima)
Ovaj prekidač se pojavljuje kada navedete Exclude element IDs. Kada je omogućen, program za indeksiranje će i dalje pratiti linkove pronađene unutar isključenih elemenata (poput navigacionih menija u zaglavljima), iako je sam sadržaj isključen iz treniranja.
Podrazumevano: Onemogućeno (linkovi u isključenim elementima se ne prate)
Primer upotrebe: Omogućite ovo kada želite da isključite sadržaj zaglavlja/podnožja iz treniranja, ali Vam je i dalje potrebno da program za indeksiranje otkrije stranice putem navigacionih linkova u tim delovima. Ovo Vam pruža najbolje iz oba sveta: čiste podatke za treniranje bez pretrpanosti menijima, uz istovremeno indeksiranje celog sajta.
Važno: Ako koristite kompletno skeniranje veb-sajta i isključite elemente poput header-a bez omogućavanja opcije „Follow links in excluded elements", skener možda neće otkriti dublje linkove (meniji se često nalaze unutar zaglavlja). U tom slučaju, ili omogućite ovaj prekidač ili koristite mapu sajta kao najsigurniji i najefikasniji metod.
Scraping Behavior
Ekstrakcija dokumenata
Polje: Advanced Settings > Scraping Behavior > Scrape documents (Preuzmi sadržaj dokumenata)
Kada je omogućeno, sistem izvlači i obrađuje sadržaj dokumenata pronađenih na veb-sajtu. Trenutno podržava PDF datoteke.
Isključivanje linkova ka slikama
Polje: Advanced Settings > Scraping Behavior > Exclude image links (Isključi linkove ka slikama)
Omogućite ovaj prekidač da biste isključili sve linkove ka slikama iz skupa podataka za treniranje. Sistem podrazumevano izvlači sve linkove ka slikama, što može značajno povećati broj karaktera.
Omogućavanje ove opcije može znatno smanjiti Vaš broj karaktera.
Ekstrakcija skrivenog sadržaja
Polje: Advanced Settings > Scraping Behavior > Scrape hidden contents (Preuzmi skriveni sadržaj)
Kada je omogućeno (podrazumevano), sistem izvlači sadržaj iz skrivenih HTML elemenata (elementi sa svojstvima display:none, visibility:hidden ili sličnim CSS svojstvima).
Podrazumevano: Omogućeno
Kada onemogućiti: Onemogućite ovu opciju da biste preskočili skriveni sadržaj i izdvajali samo vidljive elemente. Ovo je korisno kada veb-sajtovi sadrže skriveni sadržaj kao što su:
- Skupljeni harmonika (accordion) odeljci
- Sadržaj namenjen isključivo mobilnim ili desktop uređajima
- Skrivena polja obrazaca
- Komentari programera ili informacije za otklanjanje grešaka (debug)
Onemogućavanje ovoga može smanjiti broj karaktera i sprečiti da nerelevantan skriveni sadržaj uđe u Vaše podatke za treniranje.
Pauza između stranica
Polje: Advanced Settings > Scraping Behavior > Delay between pages (Pauza između stranica)
Dodajte pauzu (u sekundama) između skeniranja svake stranice kako biste sprečili preopterećenje servera. Korisno za veb-sajtove sa ograničenjem brzine zahteva (rate limiting).
Simulacija posete iz određene zemlje
Polje: Advanced Settings > Scraping Behavior > Country code (Kod zemlje)
Ako Vaš sajt prikazuje različit sadržaj u zavisnosti od lokacije posetioca, unesite dvoslovni kod zemlje (npr. US, PL, DE) kako biste simulirali skeniranje sa te lokacije.
Preporučena konfiguracija za većinu veb-sajtova
Za većinu veb-sajtova sledeća konfiguracija pruža najbolji balans između sveobuhvatnog sadržaja i smanjene potrošnje karaktera:
- Koristite sitemap kada je dostupna radi precizne kontrole URL adresa
- Exclude element IDs:
header;footer;#navigation;.sidebar - Omogućite „Exclude image links" da biste uklonili URL adrese slika iz treniranja
- Onemogućite „Scrape hidden contents" ako Vaš sajt ima mnogo skrivenih elemenata
- Razmislite o opciji „Follow links in excluded elements" ako koristite kompletno skeniranje sa isključenim zaglavljima
Ova konfiguracija obično smanjuje broj karaktera za 20-40% uz zadržavanje celokupnog vrednog sadržaja.
Rezime: Najbolje prakse
- Koristite sitemap umesto kompletnog skeniranja radi precizne kontrole
- Uključite URL adrese da biste ciljali samo vredan sadržaj
- Isključite URL adrese da biste preskočili nerelevantne ili preobimne stranice
- Ignorišite parametre upita da biste izbegli duplirani sadržaj
- Isključite ID-jeve elemenata da biste uklonili delove stranice koji se ponavljaju, poput zaglavlja i podnožja
- Kontrolišite praćenje linkova pomoću opcija „Follow only links in included elements" ili „Follow links in excluded elements" radi detaljne kontrole indeksiranja
- Isključite linkove ka slikama da biste značajno smanjili broj karaktera
- Onemogućite ekstrakciju skrivenog sadržaja ako Vaš sajt sadrži nepotrebne skrivene elemente
- Fokusirajte se na koristan sadržaj za Vašeg bota (česta pitanja, stranice proizvoda, članci podrške)