Pridanie zdrojov z webovej stránky umožňuje vášmu chatbotovi učiť sa priamo z obsahu vášho webu. Či už ide o podrobnosti o produktoch, často kladené otázky (FAQ) alebo blogové príspevky, skenovanie vašej webovej stránky zabezpečí, že chatbot dokáže poskytovať presné a aktuálne odpovede založené na skutočnom obsahu vášho webu.
Kde nájsť trénovanie z webovej stránky
Vyberte svojho chatbota a potom prejdite na kartu Training (Trénovanie). V ľavom bočnom paneli vyberte možnosť Links (Odkazy). Tu spravujete všetky trénovacie zdroje založené na webových stránkach.
Kliknutím na Add New Training: Website (Pridať nové trénovanie: Webová stránka) otvorte formulár trénovania.
Možnosti skenovania
Formulár trénovania vám ponúka dva spôsoby pridania obsahu z webovej stránky, oddelené deliacou čiarou OR (ALEBO).
Scan website contents (Skenovať obsah webovej stránky) - zadajte URL adresu do poľa Address (Adresa) a vyberte si z možností:
- Whole website (Celá webová stránka) - prejde všetky vyhľadateľné stránky začínajúc od zadanej URL adresy
- Single address (Jedna adresa) - naskenuje iba konkrétnu zadanú stránku
Use sitemap (Použiť mapu stránok) - do poľa Sitemap (Mapa stránok) zadajte URL adresu svojej mapy stránok (napr. https://www.yourdomain.com/sitemap.xml). Týmto spôsobom sa naskenujú iba stránky uvedené vo vašom súbore sitemap.
Pri použití mapy stránok sa pole Address automaticky deaktivuje (a naopak), pretože pre jednu trénovaciu úlohu môžete použiť iba jednu metódu.
Trénovanie na celej webovej stránke
- Do poľa Address zadajte koreňovú URL adresu svojej webovej stránky (napr.
https://www.yourdomain.com) - V rozbaľovacom zozname pod poľom adresy vyberte Whole website
- Kliknite na Start scanning the website (Spustiť skenovanie webovej stránky)
Systém prejde vašu webovú stránku a podľa odkazov vyhľadá všetky stránky. Priebeh môžete sledovať na karte Trainings (Trénovania), kde v reálnom čase uvidíte počet naskenovaných odkazov a zhromaždených trénovacích znakov.
Trénovanie na jednej stránke
- Do poľa Address zadajte konkrétnu URL adresu stránky (napr.
https://www.yourdomain.com/pricing) - V rozbaľovacom zozname vyberte Single address
- Kliknite na Start scanning the website
To je užitočné, keď potrebujete do znalostnej bázy chatbota pridať iba jednu konkrétnu stránku, napríklad novovydaný článok alebo aktualizovanú stránku s často kladenými otázkami.
Trénovanie na mape stránok (sitemap)
- Do poľa Sitemap zadajte URL adresu svojej mapy stránok (napr.
https://www.yourdomain.com/sitemap.xml) - Kliknite na Start scanning the website
Skenovanie mapy stránok vám poskytuje presnú kontrolu nad tým, ktoré stránky sa zahrnú, pretože spracováva iba URL adresy uvedené vo vašom súbore sitemap.
Výber jednotlivých stránok na trénovanie
Pred spustením skenovania môžete zapnúť prepínač I want to select individual urls for training after scanning the website (Po naskenovaní webovej stránky chcem vybrať jednotlivé URL adresy na trénovanie). Táto možnosť je k dispozícii iba pri skenovaní celej webovej stránky (nie v režime jednej adresy).
Keď je táto možnosť zapnutá:
- Systém naskenuje vašu webovú stránku a vyhľadá všetky stránky
- Po dokončení skenovania sa zobrazí stromové zobrazenie všetkých nájdených stránok s počtom ich znakov
- Začiarknutím alebo zrušením začiarknutia stránok ich zahrniete do trénovania alebo vylúčite z neho
- Kliknutím na Start the Training (Spustiť trénovanie) spustite trénovanie na vybraných stránkach
Je to užitočné, keď vaša webová stránka obsahuje stránky, z ktorých sa chatbot nemá učiť, ako sú prihlasovacie stránky, administrátorské sekcie alebo irelevantný obsah.
Skenovanie jazykov webovej stránky
Ak je vaša webová stránka publikovaná vo viacerých jazykoch, ChatLab počas skenovania rozpozná dostupné jazyky a umožní vám rozhodnúť, ktoré z nich zahrniete do znalostnej bázy chatbota. Tieto ovládacie prvky nájdete v časti Languages (Jazyky) vo formulári trénovania, hneď nad položkou Advanced settings (Rozšírené nastavenia).
Rozsah jazykov (Language scope)
Rozbaľovací zoznam Language scope riadi, aká časť viacjazyčného webu sa naskenuje:
- Main website language (recommended) (Hlavný jazyk webovej stránky (odporúčané)) - predvolená možnosť. Naskenuje sa iba hlavný jazyk stránky. Ostatné jazykové verzie sa preskočia. Vďaka tomu zostanú vaše trénovacie dáta prehľadné a cielené a spotrebuje sa menej trénovacej kapacity.
- All languages (Všetky jazyky) - naskenuje každú jazykovú verziu stránky. Týmto spôsobom zachytíte všetky svoje lokalizované stránky, zhromaždí sa však viac obsahu a spotrebuje sa viac trénovacej kapacity.
- Selected language (Vybraný jazyk) - naskenuje jeden jazyk, ktorý si vyberiete z jazykov zistených na stránke.
ChatLab automaticky rozpozná hlavný jazyk vašej webovej stránky a použije ho ako predvolený. Keď vyberiete možnosť Selected language, zistený hlavný jazyk sa automaticky predvolí a v zozname sa označí ako "main". Môžete ho zmeniť na akýkoľvek iný zistený jazyk.
Rozpoznávanie jazykov je dostupné vo všetkých plánoch vrátane bezplatného plánu. V bezplatnom pláne sa jazyk stránky naďalej rozpoznáva a skenuje sa iba hlavný jazyk, pokiaľ rozsah neprepnete na All languages.
Metóda detekcie jazyka (Language detection method)
Keď je rozsah nastavený na Main website language alebo Selected language, pomocou rozbaľovacieho zoznamu Language detection method môžete vybrať, ako ChatLab rozpoznáva jazykové verzie na vašom webe:
- Hreflang attributes (recommended) (Atribúty hreflang (odporúčané)) - predvolená možnosť. Používa označenia
hreflangalang, ktoré väčšina viacjazyčných stránok už obsahuje na prepojenie svojich jazykových verzií. - URL path prefix (/en/, /de/, ...) (Predpona cesty URL (/en/, /de/, ...)) - pre weby, ktoré uchovávajú jednotlivé jazyky v segmente cesty, ako napríklad
/en/,/de/alebo/fr/, bez akéhokoľvek označeniahreflang.
Ak ChatLab nedokáže rozpoznať jazyky automaticky, stále môžete naskenovať hlavný jazyk alebo všetky jazyky. Keď vyberiete Selected language, najprv zadajte adresu svojej webovej stránky do polí vyššie a potom túto možnosť vyberte znova, aby bolo možné web analyzovať.
Prehľad o tom, ako váš chatbot tieto jazykové verzie následne využíva pri odpovedaní, nájdete v článkoch Viacjazyčné chatboty a Nastavenie jazyka chatbota. Režimy jazyka znalostnej bázy, ktoré sú tam opísané, sa spoliehajú na zdroje naskenované s detekciou jazyka, takže staršie zdroje môže byť potrebné znovu natrénovať, aby ste ich mohli naplno využiť.
Rozšírené nastavenia (Advanced settings)
Kliknutím na tlačidlo Advanced settings vo formulári trénovania získate prístup k podrobným ovládacím prvkom skenovania.
Rozšírené nastavenia sú usporiadané do štyroch sekcií:
Filtrovanie URL adries (URL Filtering)
- Include only URLs that contain (Zahrnúť iba URL adresy obsahujúce) - naskenuje iba URL adresy zodpovedajúce týmto vzorom (oddelené bodkočiarkou, napr.
/en;/help) - Exclude URLs that contain (Vylúčiť URL adresy obsahujúce) - preskočí URL adresy zodpovedajúce týmto vzorom (napr.
/news;/pictures). Bežné vzory ako/wp-admin/,/feed/a stránky košíka sú predvolene vylúčené
Parametre dopytu (Query Parameters)
- Ignore all query parameters (Ignorovať všetky parametre dopytu) - považuje URL adresy s rôznymi parametrami dopytu za rovnakú stránku (napr.
/page?id=1aj/page?id=2sa stanú/page) - Ignore specific query parameters (Ignorovať konkrétne parametre dopytu) - ignoruje iba určité parametre (bežné sledovacie parametre ako
utm_source,fbclid,gclidsa ignorujú automaticky)
Filtrovanie obsahu (Content Filtering)
- Include element IDs (Zahrnúť ID prvkov) - extrahuje obsah iba z konkrétnych prvkov HTML (pre ID použite
#id, pre triedy.classname, pre prvky s daným atribútom[data-id="82874db"], oddelené bodkočiarkami) - Exclude element IDs (Vylúčiť ID prvkov) - preskočí obsah z konkrétnych prvkov HTML (napr.
footer;header;#navigation;[data-nosnippet]) - Pri nastavení zahrnutia alebo vylúčenia prvkov sa zobrazia podmienené prepínače, ktoré vám umožňujú určiť, či má crawler sledovať odkazy nájdené v týchto prvkoch
Správanie pri sťahovaní obsahu (Scraping Behavior)
- Scrape documents (Sťahovať dokumenty) - extrahuje aj obsah zo súborov PDF nájdených na webovej stránke
- Exclude image links (Vylúčiť odkazy na obrázky) - vynechá URL adresy obrázkov z trénovacieho datasetu
- Scrape hidden contents (Sťahovať skrytý obsah) - zahrnie obsah zo skrytých prvkov HTML (predvolene povolené)
- Delay between pages (Oneskorenie medzi stránkami) - pridá oneskorenie v sekundách medzi požiadavkami na stránky s cieľom znížiť zaťaženie servera
- Country code (Kód krajiny) - smeruje sťahovanie obsahu cez proxy server v konkrétnej krajine (dvojpísmenový kód, napr.
us)
E-mailové upozornenia
Prepínač Email me when training is finished or needs my attention (Poslať mi e-mail po dokončení trénovania alebo keď je potrebná moja pozornosť) je predvolene zapnutý. Keď je aktívny, dostanete e-mailové upozornenie v týchto prípadoch:
- Trénovanie sa úspešne dokončí
- Systém vyžaduje váš vstup (napr. výber stránok po skenovaní)
- Počas trénovania sa vyskytnú akékoľvek problémy
E-mailovú adresu pre upozornenia môžete zmeniť v poli vedľa prepínača.
Sledovanie priebehu trénovania
Po spustení skenovania prejdite na kartu Trainings, kde môžete sledovať priebeh. Každá trénovacia úloha zobrazuje:
- Zdrojovú URL adresu
- Aktuálny stav (Scanning links, Awaiting links selection, Training, Training completed)
- Ukazovateľ priebehu počas aktívneho skenovania alebo trénovania
- Dátum poslednej aktualizácie
Kliknutím na More details (Ďalšie podrobnosti) zobrazíte všetky parametre použité pre konkrétnu trénovaciu úlohu vrátane všetkých nakonfigurovaných rozšírených nastavení.
Správa natrénovaných odkazov
Po dokončení trénovania sa všetky naskenované stránky zobrazia na karte Links. Každý odkaz zobrazuje:
- Názov stránky a URL adresu
- Počet znakov (veľkosť trénovacích dát)
- Stav trénovania
- Dátum poslednej aktualizácie
Pri každom odkaze môžete:
- Retrain (Znova natrénovať) - znova naskenovať a aktualizovať obsah pre túto konkrétnu stránku
- View (Zobraziť) - zobraziť presný obsah, ktorý bol zo stránky extrahovaný
- Delete (Vymazať) - odstrániť túto stránku zo znalostnej bázy chatbota
Pomocou začiarkavacieho políčka Select all (Vybrať všetko) a tlačidiel hromadných akcií môžete znova natrénovať alebo vymazať viacero odkazov naraz.
Prezeranie naskenovaného obsahu
Kliknutím na tlačidlo View vedľa ľubovoľného natrénovaného odkazu zobrazíte presný obsah, ktorý bol z danej stránky extrahovaný.
Modálne okno zobrazenia zdroja zobrazuje názov stránky, URL adresu, počet znakov, dátum poslednej aktualizácie a úplný textový obsah, na ktorom bol váš chatbot natrénovaný. Pomôže vám to overiť, či bol zachytený správny obsah, a pochopiť znalostnú bázu vášho chatbota.
Súvisiace články
- Trénovanie na pozadí - zistite, ako funguje trénovanie na pozadí
- Opätovné trénovanie chatbota - ako aktualizovať chatbota čerstvým obsahom
- Ako znížiť počet trénovacích znakov pri skenovaní webovej stránky - tipy na optimalizáciu veľkosti vašich trénovacích dát
- Trénovanie chatbota: základy a limity - oboznámte sa s limitmi trénovacích dát