Centrum pomoci
Trénovanie chatbota

Ako znížiť počet trénovacích znakov pri skenovaní webovej stránky

Posledná aktualizácia:

Pri trénovaní chatbota na webovej stránke pomáha obmedzenie množstva skenovaných údajov na to najužitočnejšie znížiť spotrebu znakov, zrýchľuje trénovanie a zlepšuje kvalitu odpovedí tým, že sa zameriava iba na relevantný obsah.

Tento návod vysvetľuje, ako optimalizovať skenovanie pomocou sekcie Advanced settings (Rozšírené nastavenia) v modálnom okne trénovania z webu (Training > Links > Add New Training: Website).


Prečo môže byť menej trénovania lepšie

ChatLab využíva architektúru RAG (Retrieval-Augmented Generation). Namiesto memorovania celého obsahu webu vyhľadáva umelá inteligencia pri každej otázke používateľa tie najrelevantnejšie časti informácií a na ich základe generuje odpoveď.

Problém s príliš veľkým množstvom údajov

Viac údajov nemusí vždy znamenať lepšie odpovede. Pridanie nerelevantného alebo nadbytočného obsahu môže proces vyhľadávania zmiasť:

  • RAG hodnotí relevanciu jednotlivých úsekov obsahu vzhľadom na otázku používateľa. Ak váš web obsahuje množstvo stránok s opakujúcim sa, vágnym alebo všeobecným textom (menu, pätičky, tlačové správy, stránky so štítkami blogu), znižuje to kvalitu výsledkov vyhľadávania.
  • Keď chatbot načíta viacero úsekov s nízkou hodnotou, ktoré síce obsahujú kľúčové slová, ale chýba im užitočný kontext, môže vygenerovať nepresné, príliš všeobecné alebo od veci odpovede.
  • Príklad: Ak vaša pätička na každej stránke obsahuje odkazy ako "Domov", "Kontakt", "Súkromie", "FAQ", bot môže na otázku používateľa "Ako vás môžem kontaktovať?" odpovedať všeobecným odsekom z pätičky namiesto užitočného telefónneho čísla alebo e-mailu.

Vysoký signál, nízky šum = lepšie odpovede

Skenovaním výhradne užitočného obsahu pomáhate umelej inteligencii získať pre každú otázku jasný, špecifický a kvalitný kontext. Zamerajte sa na:

  • Popisy produktov
  • Stránky s často kladenými otázkami (FAQ)
  • Články podpory
  • Dokumenty so zásadami a pravidlami
  • Kľúčové vstupné stránky (landing pages)

Používajte sitemap namiesto úplného skenovania webu

Odporúčané: Vždy, keď je to možné, použite možnosť sitemap.

Úplné skenovanie webu sleduje všetky viditeľné odkazy na stránke vrátane odkazov z pätičiek, menu a bočných panelov, čo často vedie k skenovaniu opakujúceho sa alebo bezcenného obsahu. Tieto sekcie sa zvyčajne nachádzajú na každej stránke a málokedy obsahujú jedinečné informácie užitočné pre odpovede v chate.

Použitím súboru sitemap (zvyčajne umiestneného na https://yourdomain.com/sitemap.xml):

  • Predídete prechádzaniu nepotrebných stránok (napr. právne informácie, sociálne siete, opakujúce sa štítky blogu)
  • Máte presnú kontrolu nad tým, ktoré adresy URL sa skenujú
  • Zabránite nechcenému plytvaniu znakmi z menu, pätičiek a hlavičiek

Prehľad pokročilých nastavení

Ak chcete získať prístup k pokročilým nastaveniam, kliknite na záložke Training (Trénovanie) na možnosť Add New Training: Website (Pridať nové trénovanie: Webová stránka) a potom rozbaľte sekciu Advanced settings (Rozšírené nastavenia). Nastavenia sú usporiadané do štyroch kategórií:

  • URL Filtering (Filtrovanie URL) - Určenie, ktoré adresy URL zahrnúť alebo vylúčiť
  • Query Parameters (Parametre dopytu) - Správa parametrov URL
  • Content Filtering (Filtrovanie obsahu) - Filtrovanie konkrétnych prvkov stránky
  • Scraping Behavior (Správanie scrapingu) - Konfigurácia spôsobu extrakcie obsahu

URL Filtering

URL Filtering options

Zahrnúť iba konkrétne adresy URL

Pole: Advanced Settings > URL Filtering > Include only URLs that contain (Zahrnúť iba URL obsahujúce)

Pridajte kľúčové slová oddelené bodkočiarkou, aby sa do skenovania zahrnuli iba konkrétne adresy URL.

Príklad: Pre skenovanie iba anglických stránok nápovedy:

/en;/help

Týmto sa naskenujú iba stránky obsahujúce v adrese URL /en alebo help, čo šetrí znaky preskočením nerelevantných sekcií.

Vylúčiť nerelevantné adresy URL

Pole: Advanced Settings > URL Filtering > Exclude URLs that contain (Vylúčiť URL obsahujúce)

Pridajte kľúčové slová oddelené bodkočiarkou, aby ste vynechali sekcie ako blogy, obrázky alebo novinky.

Príklad:

/news;/pictures;/press

Tým sa vyhnete skenovaniu sekcií bohatých na obsah, ktoré sú však pre chatbota nepodstatné, ako sú novinky alebo galérie obrázkov.


Query Parameters

Query Parameters options

Ignorovať všetky parametre dopytu

Pole: Advanced Settings > Query Parameters > Ignore all query parameters (Ignorovať všetky parametre dopytu)

Začiarknutím tohto políčka sa adresy URL s rôznymi parametrami dopytu budú považovať za rovnakú stránku. Tým sa zabráni skenovaniu duplicitného obsahu.

Ignorovať konkrétne parametre dopytu

Pole: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignorovať konkrétne parametre dopytu)

Pridajte názvy parametrov oddelené bodkočiarkou, aby sa ignorovali konkrétne sledovacie alebo filtračné parametre.

Príklad:

ref;source;campaign;utm_source

Týmto sa adresy page.html?ref=email a page.html?ref=social budú považovať za rovnakú adresu URL.


Content Filtering

Content Filtering options

Zahrnúť konkrétne prvky

Pole: Advanced Settings > Content Filtering > Include element IDs (Zahrnúť ID prvkov)

Pridajte identifikátory prvkov oddelené bodkočiarkou, aby sa skenovali iba konkrétne časti stránky. Pre identifikátory prvkov použite #id, pre triedy .classname a pre atribúty hranaté zátvorky: [data-id="82874db"] vyhľadá prvky s touto presnou hodnotou atribútu, [data-content] vyhľadá každý prvok, ktorý tento atribút vôbec obsahuje.

Príklad:

#main-content;.article-body;[data-section="product"]

Týmto sa naskenuje iba oblasť hlavného obsahu, telá článkov a produktové sekcie, pričom všetko ostatné sa ignoruje.

Sledovať iba odkazy v zahrnutých prvkoch

Pole: Advanced Settings > Content Filtering > Follow only links in included elements (Sledovať iba odkazy v zahrnutých prvkoch)

Tento prepínač sa zobrazí, keď zadáte hodnoty v poli Include element IDs. Keď je zapnutý, crawler bude sledovať iba odkazy nájdené v zahrnutých prvkoch. To je užitočné, ak chcete prechádzanie obmedziť na konkrétne sekcie webu, napríklad na oblasti s obsahom článkov, a zároveň ignorovať navigačné menu v hlavičkách alebo pätičkách.

Predvolené nastavenie: Vypnuté (sledujú sa všetky odkazy na stránke)

Vylúčiť prvky stránky

Pole: Advanced Settings > Content Filtering > Exclude element IDs (Vylúčiť ID prvkov)

Zabráňte skenovaniu hlavičiek, pätičiek a ďalších prvkov rozloženia stránky. Platí rovnaká syntax selektorov: header a footer bez prefixu, #id, .classname alebo atribút v hranatých zátvorkách ako [data-id="82874db"] či [data-nosnippet]. Selektory atribútov sú praktické vtedy, keď prvok, ktorý chcete odstrániť, nemá stabilné id ani triedu, ale nesie atribút data-*, ktorý môžete skopírovať z vývojárskych nástrojov prehliadača.

Príklad:

header;footer;#navigation;.sidebar;[data-nosnippet]

Týmto odstránite bloky HTML, ktoré sa opakujú na každej stránke a spravidla neobsahujú žiadny užitočný obsah pre vášho chatbota.

Sledovať odkazy vo vylúčených prvkoch

Pole: Advanced Settings > Content Filtering > Follow links in excluded elements (Sledovať odkazy vo vylúčených prvkoch)

Tento prepínač sa zobrazí, keď zadáte hodnoty v poli Exclude element IDs. Keď je zapnutý, crawler bude stále sledovať odkazy nachádzajúce sa vo vylúčených prvkoch (ako sú navigačné menu v hlavičkách), hoci samotný obsah je z trénovania vylúčený.

Predvolené nastavenie: Vypnuté (odkazy vo vylúčených prvkoch sa nesledujú)

Prípad použitia: Zapnite túto možnosť, ak chcete z trénovania vylúčiť obsah hlavičky/pätičky, ale stále potrebujete, aby crawler objavoval stránky prostredníctvom navigačných odkazov v týchto oblastiach. Získate tak to najlepšie z oboch svetov: čisté trénovacie dáta bez zbytočností z menu a zároveň prechádzanie celého webu.

Dôležité: Ak použijete úplné skenovanie webu a vylúčite prvky ako hlavička bez zapnutia možnosti "Follow links in excluded elements", skener nemusí objaviť hlbšie odkazy (menu sa často nachádzajú vo vnútri hlavičiek). V takom prípade buď zapnite tento prepínač, alebo použite sitemap ako najbezpečnejšiu a najefektívnejšiu metódu.


Scraping Behavior

Scraping Behavior options

Získavať obsah dokumentov

Pole: Advanced Settings > Scraping Behavior > Scrape documents (Scrapovať dokumenty)

Keď je táto možnosť zapnutá, systém extrahuje a spracúva obsah dokumentov nájdených na webe. V súčasnosti podporuje súbory PDF.

Vylúčiť odkazy na obrázky

Pole: Advanced Settings > Scraping Behavior > Exclude image links (Vylúčiť odkazy na obrázky)

Zapnutím tohto prepínača vylúčite všetky odkazy na obrázky z trénovacieho datasetu. Systém predvolene extrahuje všetky odkazy na obrázky, čo môže výrazne zvýšiť počet znakov.

Zapnutie tejto možnosti môže podstatne znížiť spotrebu znakov.

Získavať skrytý obsah

Pole: Advanced Settings > Scraping Behavior > Scrape hidden contents (Scrapovať skrytý obsah)

Keď je táto možnosť zapnutá (predvolené nastavenie), systém extrahuje obsah zo skrytých prvkov HTML (prvky s vlastnosťami display:none, visibility:hidden alebo podobnými vlastnosťami CSS).

Predvolené nastavenie: Zapnuté

Kedy vypnúť: Túto možnosť vypnite, ak chcete skrytý obsah preskočiť a scrapovať iba viditeľné prvky. To je užitočné v prípade, že webové stránky obsahujú skrytý obsah ako:

  • Zbalené sekcie harmoniky (akordeóny)
  • Obsah určený iba pre mobilné zariadenia alebo iba pre počítače
  • Skryté polia formulárov
  • Komentáre vývojárov alebo ladiace informácie

Vypnutie tejto funkcie môže znížiť počet znakov a zabrániť tomu, aby sa nerelevantný skrytý obsah dostal do vašich trénovacích dát.

Oneskorenie medzi stránkami

Pole: Advanced Settings > Scraping Behavior > Delay between pages (Oneskorenie medzi stránkami)

Pridajte oneskorenie (v sekundách) medzi skenovaním jednotlivých stránok, aby ste predišli preťaženiu servera. Užitočné pre weby s obmedzením počtu požiadaviek (rate limiting).

Simulovať návštevu z konkrétnej krajiny

Pole: Advanced Settings > Scraping Behavior > Country code (Kód krajiny)

Ak váš web zobrazuje rôzny obsah v závislosti od polohy návštevníka, zadajte dvojmiestny kód krajiny (napr. US, PL, DE), aby sa simulovalo skenovanie z danej lokality.


Odporúčaná konfigurácia pre väčšinu webov

Pre väčšinu webových stránok poskytuje nasledujúca konfigurácia najlepšiu rovnováhu medzi uceleným obsahom a zníženou spotrebou znakov:

  1. Používajte sitemap, ak je k dispozícii, pre presnú kontrolu nad adresami URL
  2. Exclude element IDs: header;footer;#navigation;.sidebar
  3. Zapnite "Exclude image links", aby sa z trénovania odstránili adresy URL obrázkov
  4. Vypnite "Scrape hidden contents", ak váš web obsahuje veľa skrytých prvkov
  5. Zvážte zapnutie "Follow links in excluded elements", ak používate úplné skenovanie s vylúčenými hlavičkami

Táto konfigurácia zvyčajne zníži počet znakov o 20-40 % pri zachovaní všetkého hodnotného obsahu.


Zhrnutie: Osvedčené postupy

  • Používajte sitemap namiesto úplného skenovania pre presnú kontrolu
  • Filtrujte adresy pomocou Include URLs, aby ste zacielili iba na hodnotný obsah
  • Vylučujte adresy pomocou Exclude URLs, aby ste preskočili nerelevantné alebo dátovo náročné stránky
  • Ignorujte parametre dopytu, aby ste predišli duplicitnému obsahu
  • Vylučujte ID prvkov, aby ste odstránili opakujúce sa časti stránok, ako sú hlavičky a pätičky
  • Riaďte sledovanie odkazov pomocou "Follow only links in included elements" alebo "Follow links in excluded elements" pre detailnú kontrolu nad prechádzaním webu
  • Vylúčte odkazy na obrázky, čím výrazne znížite počet znakov
  • Vypnite získavanie skrytého obsahu, ak váš web obsahuje nepotrebné skryté prvky
  • Zamerajte sa na užitočný obsah pre vášho bota (FAQ, produktové stránky, články podpory)