Pri trénovaní chatbota na webovej stránke pomáha obmedzenie množstva skenovaných údajov na to najužitočnejšie znížiť spotrebu znakov, zrýchľuje trénovanie a zlepšuje kvalitu odpovedí tým, že sa zameriava iba na relevantný obsah.
Tento návod vysvetľuje, ako optimalizovať skenovanie pomocou sekcie Advanced settings (Rozšírené nastavenia) v modálnom okne trénovania z webu (Training > Links > Add New Training: Website).
Prečo môže byť menej trénovania lepšie
ChatLab využíva architektúru RAG (Retrieval-Augmented Generation). Namiesto memorovania celého obsahu webu vyhľadáva umelá inteligencia pri každej otázke používateľa tie najrelevantnejšie časti informácií a na ich základe generuje odpoveď.
Problém s príliš veľkým množstvom údajov
Viac údajov nemusí vždy znamenať lepšie odpovede. Pridanie nerelevantného alebo nadbytočného obsahu môže proces vyhľadávania zmiasť:
- RAG hodnotí relevanciu jednotlivých úsekov obsahu vzhľadom na otázku používateľa. Ak váš web obsahuje množstvo stránok s opakujúcim sa, vágnym alebo všeobecným textom (menu, pätičky, tlačové správy, stránky so štítkami blogu), znižuje to kvalitu výsledkov vyhľadávania.
- Keď chatbot načíta viacero úsekov s nízkou hodnotou, ktoré síce obsahujú kľúčové slová, ale chýba im užitočný kontext, môže vygenerovať nepresné, príliš všeobecné alebo od veci odpovede.
- Príklad: Ak vaša pätička na každej stránke obsahuje odkazy ako "Domov", "Kontakt", "Súkromie", "FAQ", bot môže na otázku používateľa "Ako vás môžem kontaktovať?" odpovedať všeobecným odsekom z pätičky namiesto užitočného telefónneho čísla alebo e-mailu.
Vysoký signál, nízky šum = lepšie odpovede
Skenovaním výhradne užitočného obsahu pomáhate umelej inteligencii získať pre každú otázku jasný, špecifický a kvalitný kontext. Zamerajte sa na:
- Popisy produktov
- Stránky s často kladenými otázkami (FAQ)
- Články podpory
- Dokumenty so zásadami a pravidlami
- Kľúčové vstupné stránky (landing pages)
Používajte sitemap namiesto úplného skenovania webu
Odporúčané: Vždy, keď je to možné, použite možnosť sitemap.
Úplné skenovanie webu sleduje všetky viditeľné odkazy na stránke vrátane odkazov z pätičiek, menu a bočných panelov, čo často vedie k skenovaniu opakujúceho sa alebo bezcenného obsahu. Tieto sekcie sa zvyčajne nachádzajú na každej stránke a málokedy obsahujú jedinečné informácie užitočné pre odpovede v chate.
Použitím súboru sitemap (zvyčajne umiestneného na https://yourdomain.com/sitemap.xml):
- Predídete prechádzaniu nepotrebných stránok (napr. právne informácie, sociálne siete, opakujúce sa štítky blogu)
- Máte presnú kontrolu nad tým, ktoré adresy URL sa skenujú
- Zabránite nechcenému plytvaniu znakmi z menu, pätičiek a hlavičiek
Prehľad pokročilých nastavení
Ak chcete získať prístup k pokročilým nastaveniam, kliknite na záložke Training (Trénovanie) na možnosť Add New Training: Website (Pridať nové trénovanie: Webová stránka) a potom rozbaľte sekciu Advanced settings (Rozšírené nastavenia). Nastavenia sú usporiadané do štyroch kategórií:
- URL Filtering (Filtrovanie URL) - Určenie, ktoré adresy URL zahrnúť alebo vylúčiť
- Query Parameters (Parametre dopytu) - Správa parametrov URL
- Content Filtering (Filtrovanie obsahu) - Filtrovanie konkrétnych prvkov stránky
- Scraping Behavior (Správanie scrapingu) - Konfigurácia spôsobu extrakcie obsahu
URL Filtering
Zahrnúť iba konkrétne adresy URL
Pole: Advanced Settings > URL Filtering > Include only URLs that contain (Zahrnúť iba URL obsahujúce)
Pridajte kľúčové slová oddelené bodkočiarkou, aby sa do skenovania zahrnuli iba konkrétne adresy URL.
Príklad: Pre skenovanie iba anglických stránok nápovedy:
/en;/help
Týmto sa naskenujú iba stránky obsahujúce v adrese URL /en alebo help, čo šetrí znaky preskočením nerelevantných sekcií.
Vylúčiť nerelevantné adresy URL
Pole: Advanced Settings > URL Filtering > Exclude URLs that contain (Vylúčiť URL obsahujúce)
Pridajte kľúčové slová oddelené bodkočiarkou, aby ste vynechali sekcie ako blogy, obrázky alebo novinky.
Príklad:
/news;/pictures;/press
Tým sa vyhnete skenovaniu sekcií bohatých na obsah, ktoré sú však pre chatbota nepodstatné, ako sú novinky alebo galérie obrázkov.
Query Parameters
Ignorovať všetky parametre dopytu
Pole: Advanced Settings > Query Parameters > Ignore all query parameters (Ignorovať všetky parametre dopytu)
Začiarknutím tohto políčka sa adresy URL s rôznymi parametrami dopytu budú považovať za rovnakú stránku. Tým sa zabráni skenovaniu duplicitného obsahu.
Ignorovať konkrétne parametre dopytu
Pole: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignorovať konkrétne parametre dopytu)
Pridajte názvy parametrov oddelené bodkočiarkou, aby sa ignorovali konkrétne sledovacie alebo filtračné parametre.
Príklad:
ref;source;campaign;utm_source
Týmto sa adresy page.html?ref=email a page.html?ref=social budú považovať za rovnakú adresu URL.
Content Filtering
Zahrnúť konkrétne prvky
Pole: Advanced Settings > Content Filtering > Include element IDs (Zahrnúť ID prvkov)
Pridajte identifikátory prvkov oddelené bodkočiarkou, aby sa skenovali iba konkrétne časti stránky. Pre identifikátory prvkov použite #id, pre triedy .classname a pre atribúty hranaté zátvorky: [data-id="82874db"] vyhľadá prvky s touto presnou hodnotou atribútu, [data-content] vyhľadá každý prvok, ktorý tento atribút vôbec obsahuje.
Príklad:
#main-content;.article-body;[data-section="product"]
Týmto sa naskenuje iba oblasť hlavného obsahu, telá článkov a produktové sekcie, pričom všetko ostatné sa ignoruje.
Sledovať iba odkazy v zahrnutých prvkoch
Pole: Advanced Settings > Content Filtering > Follow only links in included elements (Sledovať iba odkazy v zahrnutých prvkoch)
Tento prepínač sa zobrazí, keď zadáte hodnoty v poli Include element IDs. Keď je zapnutý, crawler bude sledovať iba odkazy nájdené v zahrnutých prvkoch. To je užitočné, ak chcete prechádzanie obmedziť na konkrétne sekcie webu, napríklad na oblasti s obsahom článkov, a zároveň ignorovať navigačné menu v hlavičkách alebo pätičkách.
Predvolené nastavenie: Vypnuté (sledujú sa všetky odkazy na stránke)
Vylúčiť prvky stránky
Pole: Advanced Settings > Content Filtering > Exclude element IDs (Vylúčiť ID prvkov)
Zabráňte skenovaniu hlavičiek, pätičiek a ďalších prvkov rozloženia stránky. Platí rovnaká syntax selektorov: header a footer bez prefixu, #id, .classname alebo atribút v hranatých zátvorkách ako [data-id="82874db"] či [data-nosnippet]. Selektory atribútov sú praktické vtedy, keď prvok, ktorý chcete odstrániť, nemá stabilné id ani triedu, ale nesie atribút data-*, ktorý môžete skopírovať z vývojárskych nástrojov prehliadača.
Príklad:
header;footer;#navigation;.sidebar;[data-nosnippet]
Týmto odstránite bloky HTML, ktoré sa opakujú na každej stránke a spravidla neobsahujú žiadny užitočný obsah pre vášho chatbota.
Sledovať odkazy vo vylúčených prvkoch
Pole: Advanced Settings > Content Filtering > Follow links in excluded elements (Sledovať odkazy vo vylúčených prvkoch)
Tento prepínač sa zobrazí, keď zadáte hodnoty v poli Exclude element IDs. Keď je zapnutý, crawler bude stále sledovať odkazy nachádzajúce sa vo vylúčených prvkoch (ako sú navigačné menu v hlavičkách), hoci samotný obsah je z trénovania vylúčený.
Predvolené nastavenie: Vypnuté (odkazy vo vylúčených prvkoch sa nesledujú)
Prípad použitia: Zapnite túto možnosť, ak chcete z trénovania vylúčiť obsah hlavičky/pätičky, ale stále potrebujete, aby crawler objavoval stránky prostredníctvom navigačných odkazov v týchto oblastiach. Získate tak to najlepšie z oboch svetov: čisté trénovacie dáta bez zbytočností z menu a zároveň prechádzanie celého webu.
Dôležité: Ak použijete úplné skenovanie webu a vylúčite prvky ako hlavička bez zapnutia možnosti "Follow links in excluded elements", skener nemusí objaviť hlbšie odkazy (menu sa často nachádzajú vo vnútri hlavičiek). V takom prípade buď zapnite tento prepínač, alebo použite sitemap ako najbezpečnejšiu a najefektívnejšiu metódu.
Scraping Behavior
Získavať obsah dokumentov
Pole: Advanced Settings > Scraping Behavior > Scrape documents (Scrapovať dokumenty)
Keď je táto možnosť zapnutá, systém extrahuje a spracúva obsah dokumentov nájdených na webe. V súčasnosti podporuje súbory PDF.
Vylúčiť odkazy na obrázky
Pole: Advanced Settings > Scraping Behavior > Exclude image links (Vylúčiť odkazy na obrázky)
Zapnutím tohto prepínača vylúčite všetky odkazy na obrázky z trénovacieho datasetu. Systém predvolene extrahuje všetky odkazy na obrázky, čo môže výrazne zvýšiť počet znakov.
Zapnutie tejto možnosti môže podstatne znížiť spotrebu znakov.
Získavať skrytý obsah
Pole: Advanced Settings > Scraping Behavior > Scrape hidden contents (Scrapovať skrytý obsah)
Keď je táto možnosť zapnutá (predvolené nastavenie), systém extrahuje obsah zo skrytých prvkov HTML (prvky s vlastnosťami display:none, visibility:hidden alebo podobnými vlastnosťami CSS).
Predvolené nastavenie: Zapnuté
Kedy vypnúť: Túto možnosť vypnite, ak chcete skrytý obsah preskočiť a scrapovať iba viditeľné prvky. To je užitočné v prípade, že webové stránky obsahujú skrytý obsah ako:
- Zbalené sekcie harmoniky (akordeóny)
- Obsah určený iba pre mobilné zariadenia alebo iba pre počítače
- Skryté polia formulárov
- Komentáre vývojárov alebo ladiace informácie
Vypnutie tejto funkcie môže znížiť počet znakov a zabrániť tomu, aby sa nerelevantný skrytý obsah dostal do vašich trénovacích dát.
Oneskorenie medzi stránkami
Pole: Advanced Settings > Scraping Behavior > Delay between pages (Oneskorenie medzi stránkami)
Pridajte oneskorenie (v sekundách) medzi skenovaním jednotlivých stránok, aby ste predišli preťaženiu servera. Užitočné pre weby s obmedzením počtu požiadaviek (rate limiting).
Simulovať návštevu z konkrétnej krajiny
Pole: Advanced Settings > Scraping Behavior > Country code (Kód krajiny)
Ak váš web zobrazuje rôzny obsah v závislosti od polohy návštevníka, zadajte dvojmiestny kód krajiny (napr. US, PL, DE), aby sa simulovalo skenovanie z danej lokality.
Odporúčaná konfigurácia pre väčšinu webov
Pre väčšinu webových stránok poskytuje nasledujúca konfigurácia najlepšiu rovnováhu medzi uceleným obsahom a zníženou spotrebou znakov:
- Používajte sitemap, ak je k dispozícii, pre presnú kontrolu nad adresami URL
- Exclude element IDs:
header;footer;#navigation;.sidebar - Zapnite "Exclude image links", aby sa z trénovania odstránili adresy URL obrázkov
- Vypnite "Scrape hidden contents", ak váš web obsahuje veľa skrytých prvkov
- Zvážte zapnutie "Follow links in excluded elements", ak používate úplné skenovanie s vylúčenými hlavičkami
Táto konfigurácia zvyčajne zníži počet znakov o 20-40 % pri zachovaní všetkého hodnotného obsahu.
Zhrnutie: Osvedčené postupy
- Používajte sitemap namiesto úplného skenovania pre presnú kontrolu
- Filtrujte adresy pomocou Include URLs, aby ste zacielili iba na hodnotný obsah
- Vylučujte adresy pomocou Exclude URLs, aby ste preskočili nerelevantné alebo dátovo náročné stránky
- Ignorujte parametre dopytu, aby ste predišli duplicitnému obsahu
- Vylučujte ID prvkov, aby ste odstránili opakujúce sa časti stránok, ako sú hlavičky a pätičky
- Riaďte sledovanie odkazov pomocou "Follow only links in included elements" alebo "Follow links in excluded elements" pre detailnú kontrolu nad prechádzaním webu
- Vylúčte odkazy na obrázky, čím výrazne znížite počet znakov
- Vypnite získavanie skrytého obsahu, ak váš web obsahuje nepotrebné skryté prvky
- Zamerajte sa na užitočný obsah pre vášho bota (FAQ, produktové stránky, články podpory)