Dodavanje veb-sajt izvora omogućava Vašem chatbotu da uči direktno iz sadržaja Vašeg veb-sajta. Bilo da se radi o detaljima o proizvodima, najčešćim pitanjima (FAQ) ili objavama na blogu, skeniranje Vašeg veb-sajta osigurava da chatbot pruža tačne i ažurne odgovore na osnovu stvarnog sadržaja Vašeg sajta.
Gde pronaći treniranje putem veb-sajta
Izaberite svog chatbota, a zatim pređite na karticu Training (Treniranje). U levoj bočnoj traci izaberite Links (Linkovi). Ovde upravljate svim izvorima za treniranje koji se zasnivaju na veb-sajtu.
Kliknite na Add New Training: Website (Dodaj novo treniranje: Veb-sajt) da biste otvorili obrazac za treniranje.
Opcije skeniranja
Obrazac za treniranje pruža dva načina za dodavanje sadržaja veb-sajta, razdvojena oznakom OR (ILI).
Scan website contents (Skeniraj sadržaj veb-sajta) - Unesite URL u polje Address (Adresa) i izaberite između sledećih opcija:
- Whole website (Ceo veb-sajt) - Pregleda sve dostupne stranice počevši od URL-a koji navedete
- Single address (Pojedinačna adresa) - Skenira samo određenu stranicu koju unesete
Use sitemap (Koristi sitemap) - Unesite URL Vaše mape sajta (npr. https://www.yourdomain.com/sitemap.xml) u polje Sitemap (Mapa sajta). Ovim se skeniraju samo stranice navedene u Vašoj sitemap datoteci.
Kada koristite sitemap, polje Address se automatski onemogućava (i obrnuto), jer po jednom zadatku treniranja možete koristiti samo jedan metod.
Treniranje na celom veb-sajtu
- Unesite osnovni URL Vašeg veb-sajta u polje Address (npr.
https://www.yourdomain.com) - Iz padajućeg menija ispod polja za adresu izaberite Whole website
- Kliknite na Start scanning the website (Započni skeniranje veb-sajta)
Sistem će pretražiti Vaš veb-sajt, prateći linkove radi otkrivanja svih stranica. Napredak možete pratiti u kartici Trainings (Treniranja), gde ćete u realnom vremenu videti broj skeniranih linkova i prikupljenih karaktera za treniranje.
Treniranje na pojedinačnoj stranici
- Unesite URL određene stranice u polje Address (npr.
https://www.yourdomain.com/pricing) - Iz padajućeg menija izaberite Single address
- Kliknite na Start scanning the website
Ovo je korisno kada u bazu znanja svog chatbota treba da dodate samo jednu određenu stranicu, na primer novooobjavljeni članak ili ažuriranu stranicu sa čestim pitanjima.
Treniranje pomoću sitemap-a
- Unesite URL Vaše mape sajta u polje Sitemap (npr.
https://www.yourdomain.com/sitemap.xml) - Kliknite na Start scanning the website
Skeniranje putem mape sajta pruža Vam preciznu kontrolu nad time koje stranice su uključene, jer obrađuje samo one URL-ove koji su navedeni u Vašoj sitemap datoteci.
Izbor pojedinačnih stranica za treniranje
Pre pokretanja skeniranja, možete uključiti opciju I want to select individual urls for training after scanning the website (Želim da izaberem pojedinačne URL-ove za treniranje nakon skeniranja veb-sajta). Ova opcija je dostupna samo pri skeniranju celog veb-sajta (ne i za režim pojedinačne adrese).
Kada je uključena:
- Sistem skenira Vaš veb-sajt i pronalazi sve stranice
- Nakon završetka skeniranja, vidite strukturu stabla sa svim pronađenim stranicama i njihovim brojem karaktera
- Označite ili odznačite stranice da biste ih uključili u treniranje ili isključili iz njega
- Kliknite na Start the Training (Započni treniranje) da biste započeli treniranje na izabranim stranicama
Ovo je korisno kada Vaš veb-sajt sadrži stranice iz kojih ne želite da chatbot uči, kao što su stranice za prijavljivanje, administratorski delovi ili irelevantni odeljci.
Skeniranje jezika veb-sajta
Ako je Vaš veb-sajt objavljen na više jezika, ChatLab tokom skeniranja detektuje dostupne jezike i omogućava Vam da odlučite koje od njih želite da uključite u bazu znanja svog chatbota. Ove kontrole ćete pronaći u odeljku Languages (Jezici) u obrascu za treniranje, neposredno iznad opcije Advanced settings (Napredna podešavanja).
Opseg jezika
Padajući meni Language scope (Opseg jezika) kontroliše koliki deo višejezičnog sajta se skenira:
- Main website language (recommended) (Glavni jezik veb-sajta - preporučeno) - podrazumevana opcija. Skenira se samo glavni jezik sajta. Ostale jezičke verzije se preskaču. Ovo omogućava da podaci za treniranje ostanu sažeti i fokusirani, i troši manje kapaciteta za treniranje.
- All languages (Svi jezici) - skenira svaku jezičku verziju sajta. Ovo obuhvata sve Vaše lokalizovane stranice, ali prikuplja više sadržaja i troši više kapaciteta za treniranje.
- Selected language (Izabrani jezik) - skenira jedan jezik koji sami izaberete među jezicima detektovanim na sajtu.
ChatLab automatski detektuje glavni jezik Vašeg veb-sajta i koristi ga kao podrazumevani. Kada odaberete Selected language, detektovani glavni jezik je već unapred izabran i označen kao "main" na listi. Možete ga promeniti u bilo koji drugi detektovani jezik.
Detekcija jezika je dostupna na svim planovima, uključujući i besplatni plan. Na besplatnom planu jezik stranice se i dalje detektuje, pri čemu se skenira samo glavni jezik, osim ako ne promenite opseg na All languages.
Metod detekcije jezika
Kada je opseg podešen na Main website language ili Selected language, pomoću padajućeg menija Language detection method (Metod detekcije jezika) možete odabrati kako ChatLab prepoznaje jezičke verzije na Vašem sajtu:
- Hreflang attributes (recommended) (Hreflang atributi - preporučeno) - podrazumevana opcija. Koristi oznake
hreflangilangkoje većina višejezičnih sajtova već poseduje radi međusobnog povezivanja svojih jezičkih verzija. - URL path prefix (/en/, /de/, ...) (Prefiks URL putanje) - za sajtove koji svaku jezičku verziju drže u okviru segmenta putanje kao što su
/en/,/de/ili/fr/, bezhreflangoznaka.
Ako ChatLab ne može automatski da detektuje jezike, i dalje možete skenirati glavni jezik ili sve jezike. Kada birate Selected language, prvo unesite adresu veb-sajta u gornja polja, a zatim ponovo izaberite tu opciju kako bi sajt mogao da se analizira.
Za pregled toga kako Vaš chatbot zatim koristi ove jezičke verzije pri davanju odgovora, pogledajte članke Višejezični chatbotovi i Podešavanje jezika chatbota. Tamo opisani režimi jezika u bazi znanja oslanjaju se na izvore koji su skenirani uz detekciju jezika, pa će starije izvore možda biti potrebno ponovo istrenirati kako biste ih u potpunosti iskoristili.
Napredna podešavanja
Kliknite na dugme Advanced settings u obrascu za treniranje da biste pristupili detaljnim kontrolama skeniranja.
Napredna podešavanja su organizovana u četiri odeljka:
URL Filtering (Filtriranje URL-ova)
- Include only URLs that contain (Uključi samo URL-ove koji sadrže) - Skenira samo URL-ove koji odgovaraju ovim obrascima (razdvojeni tačkom i zarezom, npr.
/en;/help) - Exclude URLs that contain (Isključi URL-ove koji sadrže) - Preskače URL-ove koji odgovaraju ovim obrascima (npr.
/news;/pictures). Uobičajeni obrasci kao što su/wp-admin/,/feed/i stranice korpe su podrazumevano isključeni
Query Parameters (Parametri upita)
- Ignore all query parameters (Zanemari sve parametre upita) - Tretira URL-ove sa različitim parametrima upita kao istu stranicu (npr.
/page?id=1i/page?id=2postaju/page) - Ignore specific query parameters (Zanemari određene parametre upita) - Zanemaruje samo određene parametre (uobičajeni parametri za praćenje kao što su
utm_source,fbclid,gclidse automatski zanemaruju)
Content Filtering (Filtriranje sadržaja)
- Include element IDs (Uključi ID-jeve elemenata) - Izdvaja sadržaj samo iz određenih HTML elemenata (koristite
#idza ID-jeve,.classnameza klase,[data-id="82874db"]za elemente sa zadatim atributom, razdvojene tačkom i zarezom) - Exclude element IDs (Isključi ID-jeve elemenata) - Preskače sadržaj iz određenih HTML elemenata (npr.
footer;header;#navigation;[data-nosnippet]) - Kada su podešeni elementi za uključivanje/isključivanje, pojavljuju se uslovni prekidači koji Vam omogućavaju da kontrolišete da li crawler prati linkove pronađene unutar tih elemenata
Scraping Behavior (Ponašanje pri prikupljanju podataka)
- Scrape documents (Preuzmi dokumente) - Takođe izdvaja sadržaj iz PDF datoteka pronađenih na veb-sajtu
- Exclude image links (Isključi linkove slika) - Izostavlja URL-ove slika iz skupa podataka za treniranje
- Scrape hidden contents (Preuzmi skriveni sadržaj) - Uključuje sadržaj iz skrivenih HTML elemenata (podrazumevano omogućeno)
- Delay between pages (Zadrška između stranica) - Dodaje kašnjenje u sekundama između zahteva za stranice radi smanjenja opterećenja servera
- Country code (Kod zemlje) - Usmerava prikupljanje podataka preko proksi servera u određenoj zemlji (dvoslovni kod, npr.
us)
Obaveštenja putem e-pošte
Prekidač Email me when training is finished or needs my attention (Pošalji mi e-poštu kada se treniranje završi ili zahteva moju pažnju) podrazumevano je uključen. Kada je aktivan, dobijate obaveštenje putem e-pošte kada:
- Treniranje se uspešno završi
- Sistemu je potreban Vaš unos (npr. izbor stranica nakon skeniranja)
- Tokom treniranja dođe do bilo kakvih problema
Adresu e-pošte za obaveštenja možete promeniti u polju pored prekidača.
Praćenje napretka treniranja
Nakon pokretanja skeniranja, pređite na karticu Trainings da biste pratili napredak. Svaki zadatak treniranja prikazuje:
- Izvorni URL
- Trenutni status (Scanning links, Awaiting links selection, Training, Training completed)
- Traku napretka tokom aktivnog skeniranja ili treniranja
- Datum poslednjeg ažuriranja
Kliknite na More details (Više detalja) da biste videli sve parametre korišćene za određeni zadatak treniranja, uključujući i sva napredna podešavanja koja su bila konfigurisana.
Upravljanje istreniranim linkovima
Nakon završetka treniranja, sve skenirane stranice se prikazuju u kartici Links. Za svaki link se prikazuje:
- Naslov stranice i URL
- Broj karaktera (veličina podataka za treniranje)
- Status treniranja
- Datum poslednjeg ažuriranja
Za svaki link možete:
- Retrain (Ponovo istreniraj) - Ponovo skenirati i ažurirati sadržaj za ovu konkretnu stranicu
- View (Pregledaj) - Videti tačan sadržaj koji je izdvojen sa te stranice
- Delete (Obriši) - Ukloniti ovu stranicu iz baze znanja Vašeg chatbota
Koristite polje za potvrdu Select all (Izaberi sve) i dugmad za masovne radnje da biste istovremeno ponovo istrenirali ili obrisali više linkova.
Pregled skeniranog sadržaja
Kliknite na dugme View pored bilo kog istreniranog linka da biste videli tačno koji je sadržaj izdvojen sa te stranice.
Modalni prozor za pregled izvora prikazuje naslov stranice, URL, broj karaktera, datum poslednjeg ažuriranja i pun tekstualni sadržaj na kojem je Vaš chatbot treniran. Ovo Vam pomaže da proverite da li je zabeležen pravi sadržaj i da bolje razumete bazu znanja svog chatbota.
Povezani članci
- Treniranje u pozadini - Saznajte kako treniranje funkcioniše u pozadini
- Ponovno treniranje chatbota - Kako da ažurirate svog chatbota svežim sadržajem
- Kako smanjiti broj karaktera za treniranje prilikom skeniranja veb-sajta - Saveti za optimizaciju veličine podataka za treniranje
- Treniranje chatbota: osnove i ograničenja - Razumevanje ograničenja podataka za treniranje