Centrum nápovědy
Trénování chatbota

Přidání nových webových zdrojů

Poslední aktualizace:

Přidání webových zdrojů umožňuje vašemu chatbotovi učit se přímo z obsahu vašeho webu. Ať už jde o podrobnosti o produktech, nejčastější dotazy (FAQ) nebo příspěvky na blogu, skenování webu zajistí, že chatbot bude poskytovat přesné a aktuální odpovědi založené na skutečném obsahu vašeho webu.

Kde najít trénování z webu

Vyberte svého chatbota a poté přejděte na záložku Training (Trénování). V levém postranním panelu zvolte Links (Odkazy). Zde spravujete všechny trénovací zdroje založené na webových stránkách.

Kliknutím na Add New Training: Website (Přidat nové trénování: Web) otevřete trénovací formulář.

Seznam odkazů pro trénování se zvýrazněným tlačítkem Add New Training

Možnosti skenování

Trénovací formulář nabízí dva způsoby přidání obsahu webu, oddělené přepínačem OR (NEBO).

Scan website contents (Skenovat obsah webu) - zadejte URL do pole Address (Adresa) a zvolte mezi:

  • Whole website (Celý web) - projde všechny dohledatelné stránky počínaje zadanou URL
  • Single address (Jedna adresa) - naskenuje pouze konkrétní zadanou stránku

Use sitemap (Použít soubor sitemap) - zadejte URL vašeho souboru sitemap (např. https://www.yourdomain.com/sitemap.xml) do pole Sitemap. Tímto způsobem se naskenují pouze stránky uvedené v souboru sitemap.

Při použití souboru sitemap se pole Address automaticky deaktivuje (a naopak), protože pro jednu trénovací úlohu lze použít pouze jednu metodu.

Modální okno nového trénování zobrazující pole Address, rozbalovací nabídku režimu skenování a možnost sitemap

Trénování na celém webu

  1. Zadejte kořenovou URL vašeho webu do pole Address (např. https://www.yourdomain.com)
  2. Z rozbalovací nabídky pod polem adresy vyberte Whole website
  3. Klikněte na Start scanning the website (Zahájit skenování webu)

Systém projde váš web a podle odkazů vyhledá všechny stránky. Průběh můžete sledovat v záložce Trainings (Trénování), kde v reálném čase uvidíte počet naskenovaných odkazů a shromážděných trénovacích znaků.

Modální okno nového trénování se zvýrazněným tlačítkem Start scanning the website

Trénování na jedné stránce

  1. Zadejte URL konkrétní stránky do pole Address (např. https://www.yourdomain.com/pricing)
  2. Z rozbalovací nabídky vyberte Single address
  3. Klikněte na Start scanning the website

To je užitečné, když potřebujete do znalostní báze chatbota přidat pouze jednu konkrétní stránku, například nově publikovaný článek nebo aktualizovanou stránku s častými dotazy.

Trénování pomocí sitemap

  1. Zadejte URL vašeho souboru sitemap do pole Sitemap (např. https://www.yourdomain.com/sitemap.xml)
  2. Klikněte na Start scanning the website

Skenování pomocí souboru sitemap vám dává přesnou kontrolu nad tím, které stránky budou zahrnuty, protože zpracovává pouze URL uvedené v tomto souboru.

Výběr jednotlivých stránek pro trénování

Před zahájením skenování můžete aktivovat přepínač I want to select individual urls for training after scanning the website (Chci po naskenování webu vybrat jednotlivé URL adresy pro trénování). Tato možnost je k dispozici pouze při skenování celého webu (nikoli pro režim jedné adresy).

Když je tato možnost aktivní:

  1. Systém naskenuje váš web a vyhledá všechny stránky
  2. Po dokončení skenování se zobrazí stromové zobrazení všech nalezených stránek s počtem znaků
  3. Zaškrtnutím nebo zrušením zaškrtnutí stránek je zahrnete do trénování nebo je vyloučíte
  4. Kliknutím na Start the Training (Zahájit trénování) spustíte trénování na vybraných stránkách

To pomůže v situaci, kdy váš web obsahuje stránky, ze kterých nechcete, aby se chatbot učil, jako jsou přihlašovací stránky, administrátorské sekce nebo nerelevantní části webu.

Skenování jazyků webu

Pokud je váš web publikován ve více jazycích, ChatLab během skenování rozpozná dostupné jazyky a umožní vám rozhodnout, které z nich zahrnout do znalostní báze chatbota. Tyto ovládací prvky najdete v sekci Languages (Jazyky) v trénovacím formuláři přímo nad Advanced settings (Pokročilá nastavení).

Sekce Languages v trénovacím formuláři zobrazující rozsah jazyků a možnosti metody detekce

Jazykový rozsah

Rozbalovací nabídka Language scope (Jazykový rozsah) určuje, jaká část vícejazyčného webu se naskenuje:

  • Main website language (recommended) (Hlavní jazyk webu - doporučeno) - výchozí možnost. Naskenuje se pouze hlavní jazyk webu. Ostatní jazykové verze se přeskočí. Vaše trénovací data tak zůstanou přehledná, zacílená a spotřebují méně vaší trénovací kapacity.
  • All languages (Všechny jazyky) - naskenuje každou jazykovou verzi webu. Zahrne všechny vaše lokalizované stránky, ale shromáždí více obsahu a spotřebuje více trénovací kapacity.
  • Selected language (Vybraný jazyk) - naskenuje jeden konkrétní jazyk, který si vyberete z jazyků zjištěných na webu.

ChatLab automaticky rozpozná hlavní jazyk vašeho webu a použije jej jako výchozí. Když zvolíte Selected language, rozpoznaný hlavní jazyk se automaticky předvybere a v seznamu se označí jako „main“. Můžete jej změnit na libovolný jiný zjištěný jazyk.

Detekce jazyka je k dispozici v každém tarifu, včetně bezplatného plánu FREE. V plánu FREE se jazyk stránky stále detekuje a skenuje se pouze hlavní jazyk, pokud nepřepnete rozsah na All languages.

Metoda detekce jazyka

Když je rozsah nastaven na Main website language nebo Selected language, můžete v rozbalovací nabídce Language detection method (Metoda detekce jazyka) zvolit, jak ChatLab rozpoznává jazykové verze na vašem webu:

  • Hreflang attributes (recommended) (Atributy hreflang - doporučeno) - výchozí možnost. Využívá značky hreflang a lang, které většina vícejazyčných webů již obsahuje k propojení svých jazykových verzí.
  • URL path prefix (/en/, /de/, ...) (Prefix cesty URL (/en/, /de/, ...)) - pro weby, které mají jednotlivé jazyky oddělené v segmentu cesty jako /en/, /de/ nebo /fr/ bez značek hreflang.

Pokud ChatLab nedokáže jazyky rozpoznat automaticky, stále můžete naskenovat hlavní jazyk nebo všechny jazyky. Pokud zvolíte Selected language, zadejte nejprve adresu webu do polí výše a poté tuto možnost zvolte znovu, aby mohl systém web analyzovat.

Přehled toho, jak chatbot tyto jazykové verze následně využívá při odpovídání, najdete v článcích Vícejazyční chatboti a Nastavení jazyka chatbota. Zde popsané jazykové režimy znalostní báze spoléhají na zdroje naskenované s detekcí jazyka, takže starší zdroje může být nutné znovu přetrénovat, abyste tyto funkce mohli plně využít.

Pokročilá nastavení

Kliknutím na tlačítko Advanced settings (Pokročilá nastavení) v trénovacím formuláři získáte přístup k podrobným možnostem nastavení skenování.

Modální okno nového trénování se zvýrazněným panelem Advanced settings

Pokročilá nastavení jsou uspořádána do čtyř sekcí:

URL Filtering (Filtrování URL)

  • Include only URLs that contain (Zahrnout pouze URL obsahující) - naskenuje pouze URL odpovídající těmto vzorům (oddělené středníkem, např. /en;/help)
  • Exclude URLs that contain (Vyloučit URL obsahující) - přeskočí URL odpovídající těmto vzorům (např. /news;/pictures). Běžné vzory jako /wp-admin/, /feed/ a stránky košíku jsou ve výchozím nastavení vyloučeny

Query Parameters (Parametry dotazu)

  • Ignore all query parameters (Ignorovat všechny parametry dotazu) - považuje URL s různými parametry dotazu za stejnou stránku (např. /page?id=1 i /page?id=2 se převedou na /page)
  • Ignore specific query parameters (Ignorovat konkrétní parametry dotazu) - ignoruje pouze vybrané parametry (běžné sledovací parametry jako utm_source, fbclid, gclid se ignorují automaticky)

Content Filtering (Filtrování obsahu)

  • Include element IDs (Zahrnout ID elementů) - extrahuje obsah pouze z konkrétních HTML elementů (použijte #id pro identifikátory, .classname pro třídy, [data-id="82874db"] pro elementy s daným atributem, oddělené středníky)
  • Exclude element IDs (Vyloučit ID elementů) - přeskočí obsah z konkrétních HTML elementů (např. footer;header;#navigation;[data-nosnippet])
  • Po nastavení zahrnutí či vyloučení elementů se zobrazí podmíněné přepínače umožňující určit, zda má crawler sledovat odkazy nalezené uvnitř těchto elementů

Scraping Behavior (Chování scrapingu)

  • Scrape documents (Scrapovat dokumenty) - extrahuje obsah také ze souborů PDF nalezených na webu
  • Exclude image links (Vyloučit odkazy na obrázky) - vynechá URL obrázků z trénovací datové sady
  • Scrape hidden contents (Scrapovat skrytý obsah) - zahrne obsah ze skrytých HTML elementů (ve výchozím nastavení zapnuto)
  • Delay between pages (Prodleva mezi stránkami) - přidá prodlevu v sekundách mezi požadavky na jednotlivé stránky pro snížení zátěže serveru
  • Country code (Kód země) - směruje scraping přes proxy server v konkrétní zemi (dvoupísmenný kód, např. us)

E-mailová oznámení

Přepínač Email me when training is finished or needs my attention (Upozornit e-mailem na dokončení trénování nebo potřebu mé pozornosti) je ve výchozím nastavení aktivní. Když je zapnutý, obdržíte e-mailové upozornění, když:

  • Trénování se úspěšně dokončí
  • Systém vyžaduje váš zásah (např. výběr stránek po naskenování)
  • Během trénování se vyskytnou jakékoli potíže

E-mailovou adresu pro oznámení můžete změnit v poli vedle přepínače.

Sledování průběhu trénování

Po spuštění skenování přejděte na záložku Trainings a sledujte průběh. U každé trénovací úlohy se zobrazuje:

  • Zdrojová URL
  • Aktuální stav (Scanning links, Awaiting links selection, Training, Training completed)
  • Ukazatel průběhu během aktivního skenování nebo trénování
  • Datum poslední aktualizace

Záložka Trainings zobrazující dokončenou trénovací úlohu se zvýrazněnou záložkou Trainings

Kliknutím na More details (Více podrobností) zobrazíte všechny parametry použité pro konkrétní trénovací úlohu včetně veškerých nastavených pokročilých parametrů.

Rozbalené podrobnosti trénování zobrazující všechny parametry

Správa natrénovaných odkazů

Po dokončení trénování se všechny naskenované stránky zobrazí v záložce Links. Každý odkaz obsahuje:

  • Název stránky a URL
  • Počet znaků (velikost trénovacích dat)
  • Stav trénování
  • Datum poslední aktualizace

U každého odkazu můžete:

  • Retrain (Znovu trénovat) - znovu naskenovat a aktualizovat obsah této konkrétní stránky
  • View (Zobrazit) - prohlédnout si přesný obsah, který byl ze stránky extrahován
  • Delete (Smazat) - odstranit tuto stránku ze znalostní báze chatbota

Pomocí zaškrtávacího políčka Select all (Vybrat vše) a tlačítek pro hromadné akce můžete hromadně znovu trénovat nebo mazat více odkazů najednou.

Prohlížení naskenovaného obsahu

Kliknutím na tlačítko View u libovolného natrénovaného odkazu si můžete prohlédnout přesný obsah, který byl z dané stránky získán.

Seznam odkazů se zvýrazněným tlačítkem View

Modální okno pro zobrazení zdroje ukazuje název stránky, URL, počet znaků, datum poslední aktualizace a úplný textový obsah, na kterém byl váš chatbot natrénován. To vám pomůže ověřit, zda byl zaznamenán správný obsah, a lépe porozumět znalostní bázi vašeho chatbota.

Modální okno zobrazení zdroje s extrahovaným obsahem stránky

Související články