Při trénování chatbota na webových stránkách vám omezení množství skenovaných dat na to nejužitečnější pomůže snížit spotřebu znaků, zrychlit trénování a zlepšit kvalitu odpovědí tím, že se zaměříte pouze na relevantní obsah.
Tento průvodce vysvětluje, jak optimalizovat skenování pomocí nabídky Advanced settings (Pokročilá nastavení) v okně pro trénování z webu (Training > Links > Add New Training: Website (Trénování > Odkazy > Přidat nové trénování: Web)).
Proč může být méně trénování lepší
ChatLab využívá architekturu RAG (Retrieval-Augmented Generation). Místo toho, aby si umělá inteligence pamatovala veškerý obsah webu, vyhledá při každé otázce uživatele nejrelevantnější části informací a použije je k vygenerování odpovědi.
Problém s příliš velkým množstvím dat
Více dat nemusí vždy znamenat lepší odpovědi. Přidání nerelevantního nebo nadbytečného obsahu může proces vyhledávání zmást:
- RAG hodnotí relevanci jednotlivých úseků obsahu vzhledem k otázce uživatele. Pokud váš web obsahuje mnoho stránek s opakujícím se, vágním nebo obecným textem (menu, patičky, tiskové zprávy, stránky se štítky blogu), snižuje se tím kvalita výsledků vyhledávání.
- Když chatbot načte několik málo hodnotných úseků, které sice sdílejí klíčová slova, ale postrádají užitečný kontext, může generovat nepřesné, příliš obecné nebo zcela scestné odpovědi.
- Příklad: Pokud vaše zápatí obsahuje na každé stránce odkazy jako „Domů", „Kontakt", „Soukromí", „FAQ", bot může na otázku uživatele „Jak vás mohu kontaktovat?" odpovědět obecným odstavcem ze zápatí místo užitečného telefonního čísla nebo e-mailu.
Silný signál, málo šumu = lepší odpovědi
Skenováním pouze užitečného obsahu pomáháte AI získat jasný, konkrétní a vysoce kvalitní kontext pro každou otázku. Zaměřte se na:
- Popisy produktů
- Stránky s často kladenými dotazy (FAQ)
- Články nápovědy a podpory
- Dokumenty se zásadami a podmínkami
- Klíčové vstupní stránky (landing pages)
Místo úplného skenování webu použijte soubor sitemap
Doporučeno: Kdykoli je to možné, použijte možnost sitemap.
Úplné skenování webu prochází všechny viditelné odkazy na stránce, včetně odkazů ze zápatí, nabídek a postranních panelů, což často vede ke skenování opakujícího se nebo bezcenného obsahu. Tyto části se obvykle nacházejí na každé stránce a zřídka obsahují jedinečné informace užitečné pro odpovědi na chatu.
Použitím souboru sitemap (obvykle umístěného na adrese https://yourdomain.com/sitemap.xml):
- Zabráníte procházení zbytečných stránek (např. právních stránek, odkazů na sociální sítě, opakujících se štítků blogu)
- Máte přesnou kontrolu nad tím, které URL adresy se skenují
- Předejdete nechtěnému plýtvání znaky z nabídek, zápatí a záhlaví
Přehled pokročilých nastavení
Chcete-li otevřít pokročilá nastavení, klikněte na kartě Training na Add New Training: Website a poté rozbalte sekci Advanced settings. Nastavení jsou uspořádána do čtyř kategorií:
- URL Filtering (Filtrování URL) - Nastavení, které URL adresy zahrnout nebo vyloučit
- Query Parameters (Parametry dotazu) - Zpracování parametrů URL
- Content Filtering (Filtrování obsahu) - Filtrování konkrétních prvků stránky
- Scraping Behavior (Chování scrapingu) - Konfigurace způsobu extrakce obsahu
URL Filtering (Filtrování URL)
Zahrnout pouze konkrétní URL adresy
Pole: Advanced Settings > URL Filtering > Include only URLs that contain (Zahrnout pouze URL obsahující)
Přidejte klíčová slova oddělená středníkem, chcete-li do skenování zahrnout pouze konkrétní URL adresy.
Příklad: Pro skenování pouze anglických stránek nápovědy:
/en;/help
Tím se naskenují pouze stránky obsahující v adrese URL /en nebo help, což ušetří znaky přeskočením nerelevantních sekcí.
Vyloučit nerelevantní URL adresy
Pole: Advanced Settings > URL Filtering > Exclude URLs that contain (Vyloučit URL obsahující)
Přidejte klíčová slova oddělená středníkem pro přeskočení sekcí, jako jsou blogy, obrázky nebo novinky.
Příklad:
/news;/pictures;/press
Tím zabráníte skenování sekcí s velkým objemem obsahu, které jsou pro chatbota irelevantní, jako jsou aktuality nebo fotogalerie.
Query Parameters (Parametry dotazu)
Ignorovat všechny parametry dotazu
Pole: Advanced Settings > Query Parameters > Ignore all query parameters (Ignorovat všechny parametry dotazu)
Zaškrtnutím tohoto políčka se bude s adresami URL s různými parametry dotazu zacházet jako se stejnou stránkou. Zabráníte tím skenování duplicitního obsahu.
Ignorovat konkrétní parametry dotazu
Pole: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignorovat konkrétní parametry dotazu)
Přidejte názvy parametrů oddělené středníkem, chcete-li ignorovat konkrétní měřicí nebo filtrační parametry.
Příklad:
ref;source;campaign;utm_source
Tím se s adresami page.html?ref=email a page.html?ref=social zachází jako se stejnou adresou URL.
Content Filtering (Filtrování obsahu)
Zahrnout konkrétní prvky
Pole: Advanced Settings > Content Filtering > Include element IDs (Zahrnout ID prvků)
Přidejte identifikátory prvků oddělené středníkem, chcete-li skenovat pouze konkrétní části stránky. Použijte #id pro ID prvků, .classname pro třídy a hranaté závorky pro atributy: [data-id="82874db"] odpovídá prvkům s touto přesnou hodnotou atributu, [data-content] odpovídá každému prvku, který daný atribut vůbec obsahuje.
Příklad:
#main-content;.article-body;[data-section="product"]
Tím se naskenuje pouze hlavní oblast obsahu, těla článků a produktové sekce, zatímco vše ostatní se ignoruje.
Sledovat odkazy pouze v zahrnutých prvcích
Pole: Advanced Settings > Content Filtering > Follow only links in included elements (Sledovat odkazy pouze v zahrnutých prvcích)
Tento přepínač se zobrazí, když vyplníte Include element IDs. Když je zapnutý, crawler bude sledovat pouze odkazy nalezené uvnitř zahrnutých prvků. To je užitečné, pokud chcete omezit procházení na konkrétní části webu, například oblasti obsahu článků, a zároveň ignorovat navigační nabídky v záhlaví nebo zápatí.
Výchozí nastavení: Vypnuto (sledují se všechny odkazy na stránce)
Vyloučit prvky stránky
Pole: Advanced Settings > Content Filtering > Exclude element IDs (Vyloučit ID prvků)
Zabraňte skenování záhlaví, zápatí a dalších prvků rozvržení stránky. Platí stejná syntaxe selektorů: header a footer bez předpony, #id, .classname nebo atribut v hranatých závorkách, například [data-id="82874db"] nebo [data-nosnippet]. Selektory atributů se hodí, když prvek, který chcete vynechat, nemá stabilní ID ani třídu, ale nese atribut data-*, který můžete zkopírovat z vývojářských nástrojů prohlížeče.
Příklad:
header;footer;#navigation;.sidebar;[data-nosnippet]
Tím se odstraní bloky HTML, které se opakují na každé stránce a obecně neobsahují žádný užitečný obsah pro vašeho chatbota.
Sledovat odkazy ve vyloučených prvcích
Pole: Advanced Settings > Content Filtering > Follow links in excluded elements (Sledovat odkazy ve vyloučených prvcích)
Tento přepínač se zobrazí, když vyplníte Exclude element IDs. Když je zapnutý, crawler bude i nadále sledovat odkazy nalezené ve vyloučených prvcích (například navigační menu v záhlaví), i když samotný obsah je z trénování vyloučen.
Výchozí nastavení: Vypnuto (odkazy ve vyloučených prvcích se nesledují)
Případ použití: Tuto možnost zapněte, když chcete z trénování vyloučit obsah záhlaví/zápatí, ale přesto potřebujete, aby crawler objevoval stránky prostřednictvím navigačních odkazů v těchto oblastech. Získáte tak to nejlepší z obou světů: čistá trénovací data bez balastu z menu a zároveň projití celého webu.
Důležité: Pokud používáte úplné skenování webu a vyloučíte prvky jako záhlaví bez zapnutí možnosti „Follow links in excluded elements", skener nemusí objevit hlouběji umístěné odkazy (nabídky jsou často uvnitř záhlaví). V takovém případě buď přepínač zapněte, nebo použijte sitemap jako nejbezpečnější a nejefektivnější metodu.
Scraping Behavior (Chování scrapingu)
Skenovat dokumenty
Pole: Advanced Settings > Scraping Behavior > Scrape documents (Skenovat dokumenty)
Když je tato možnost zapnutá, systém extrahuje a zpracovává obsah dokumentů nalezených na webu. V současné době podporuje soubory PDF.
Vyloučit odkazy na obrázky
Pole: Advanced Settings > Scraping Behavior > Exclude image links (Vyloučit odkazy na obrázky)
Zapnutím tohoto přepínače vyloučíte z trénovací datové sady všechny odkazy na obrázky. Ve výchozím nastavení systém extrahuje všechny odkazy na obrázky, což může výrazně zvýšit počet znaků.
Aktivace této možnosti může podstatně snížit počet využitých znaků.
Skenovat skrytý obsah
Pole: Advanced Settings > Scraping Behavior > Scrape hidden contents (Skenovat skrytý obsah)
Když je tato možnost zapnutá (výchozí stav), systém extrahuje obsah ze skrytých prvků HTML (prvky s vlastnostmi display:none, visibility:hidden nebo podobnými vlastnostmi CSS).
Výchozí nastavení: Zapnuto
Kdy vypnout: Tuto možnost vypněte, pokud chcete přeskočit skrytý obsah a skenovat pouze viditelné prvky. To je užitečné, pokud webové stránky obsahují skrytý obsah, jako například:
- Sbalené sekce akordeonů
- Obsah určený pouze pro mobily nebo pouze pro počítače
- Skrytá formulářová pole
- Komentáře vývojářů nebo ladicí informace
Vypnutím této možnosti můžete snížit počet znaků a zabránit tomu, aby se do trénovacích dat dostal irelevantní skrytý obsah.
Zpoždění mezi stránkami
Pole: Advanced Settings > Scraping Behavior > Delay between pages (Zpoždění mezi stránkami)
Přidejte zpoždění (v sekundách) mezi skenováním jednotlivých stránek, abyste zabránili přetížení serveru. Užitečné pro weby s omezením četnosti požadavků (rate limiting).
Simulovat návštěvu z konkrétní země
Pole: Advanced Settings > Scraping Behavior > Country code (Kód země)
Pokud váš web zobrazuje různý obsah v závislosti na poloze návštěvníka, zadejte dvoupísmenný kód země (např. US, PL, DE) a simulujte skenování z dané lokality.
Doporučená konfigurace pro většinu webů
U většiny webových stránek poskytuje následující konfigurace nejlepší rovnováhu mezi uceleným obsahem a sníženou spotřebou znaků:
- Použijte sitemap, je-li k dispozici, pro přesnou kontrolu nad adresami URL
- Vylučte ID prvků (Exclude element IDs):
header;footer;#navigation;.sidebar - Zapněte „Exclude image links", abyste z trénování odstranili URL adresy obrázků
- Vypněte „Scrape hidden contents", pokud váš web obsahuje mnoho skrytých prvků
- Zvažte zapnutí „Follow links in excluded elements", pokud používáte úplné skenování s vyloučeným záhlavím
Tato konfigurace obvykle snižuje počet znaků o 20-40 % a zároveň zachovává veškerý hodnotný obsah.
Shrnutí: Osvědčené postupy
- Používejte sitemap místo úplného skenování pro přesnou kontrolu
- Zahrnujte URL adresy, abyste cílili pouze na hodnotný obsah
- Vylučujte URL adresy, abyste přeskočili nerelevantní nebo datově náročné stránky
- Ignorujte parametry dotazu, abyste předešli duplicitnímu obsahu
- Vylučujte ID prvků, abyste odstranili opakující se části stránek, jako jsou záhlaví a zápatí
- Řiďte sledování odkazů pomocí voleb „Follow only links in included elements" nebo „Follow links in excluded elements" pro detailní kontrolu nad procházením webu
- Vylučujte odkazy na obrázky, čímž výrazně snížíte počet znaků
- Vypněte skenování skrytého obsahu, pokud váš web obsahuje zbytečné skryté prvky
- Zaměřte se na užitečný obsah pro vašeho bota (FAQ, produktové stránky, články podpory)