Kai apmokote savo pokalbių robotą (chatbot) naudodami svetainę, nuskaitomų duomenų kiekio apribojimas iki naudingiausio padeda sumažinti simbolių sunaudojimą, pagreitina apmokymą ir pagerina atsakymų kokybę, nes dėmesys sutelkiamas tik į aktualų turinį.
Šiame vadove paaiškinama, kaip optimizuoti nuskaitymą naudojant Advanced settings (išplėstinius nustatymus) svetainės apmokymo lange (Training > Links > Add New Training: Website [Apmokymas > Nuorodos > Pridėti naują apmokymą: Svetainė]).
Kodėl mažiau apmokymo duomenų gali būti geriau
ChatLab naudoja RAG (Retrieval-Augmented Generation) architektūrą. Užuot įsiminęs visą svetainės turinį, dirbtinis intelektas kiekvieno naudotojo klausimo metu ieško aktualiausių informacijos fragmentų ir naudoja juos atsakymui sugeneruoti.
Per didelio duomenų kiekio problema
Daugiau duomenų ne visada reiškia geresnius atsakymus. Pridėjus neaktualaus ar perteklinio turinio, paieškos procesas gali tapti netikslus:
- RAG vertina turinio fragmentų aktualumą pagal naudotojo klausimą. Jei jūsų svetainėje yra daug puslapių su pasikartojančiu, neaiškiu ar bendro pobūdžio tekstu (meniu, poraštės, pranešimai spaudai, tinklaraščio žymų puslapiai), jie sumenkina paieškos rezultatų kokybę.
- Kai pokalbių robotas randa kelis mažos vertės fragmentus, kurie turi tuos pačius raktinius žodžius, bet neturi naudingos informacijos, jis gali sugeneruoti netikslius, pernelyg bendrus arba su tema nesusijusius atsakymus.
- Pavyzdžiui: jei jūsų poraštėje kiekviename puslapyje yra nuorodos, tokios kaip „Pradžia“, „Kontaktai“, „Privatumas“, „DUK“, naudotojui paklausus „Kaip galiu su jumis susisiekti?“, robotas gali pateikti bendrą pastraipą iš poraštės, o ne naudingą telefono numerį ar el. pašto adresą.
Stiprus signalas, mažai triukšmo = geresni atsakymai
Nuskaitant tik naudingą turinį, padedate DI rasti aiškų, konkretų ir kokybišką kontekstą kiekvienam klausimui. Sutelkite dėmesį į:
- Produktų aprašymus
- DUK puslapius
- Pagalbos straipsnius
- Taisyklių ir politikos dokumentus
- Svarbiausius nukreipimo puslapius (landing pages)
Naudokite svetainės schemą (sitemap) vietoje viso puslapio nuskaitymo
Rekomenduojama: kai tik įmanoma, naudokite sitemap parinktį.
Visos svetainės nuskaitymas seka visas puslapyje matomas nuorodas, įskaitant nuorodas iš poraščių, meniu ir šoninių juostų, todėl dažnai nuskaitomas pasikartojantis ar bevertis turinys. Šios skiltys paprastai yra kiekviename puslapyje ir retai turi unikalios informacijos, naudingos pokalbio atsakymams.
Naudodami svetainės schemą (dažniausiai pasiekiamą adresu https://yourdomain.com/sitemap.xml):
- Išvengsite nereikalingų puslapių nuskaitymo (pvz., teisinių puslapių, socialinių tinklų nuorodų, pasikartojančių tinklaraščio žymų)
- Tiksliai valdysite, kurie URL adresai bus nuskaitomi
- Apsisaugosite nuo atsitiktinio perteklinio simbolių sunaudojimo iš meniu, poraščių ir antraščių
Išplėstinių nustatymų apžvalga
Norėdami pasiekti išplėstinius nustatymus, skirtuke Training (Apmokymas) spustelėkite Add New Training: Website (Pridėti naują apmokymą: Svetainė), tada išskleiskite skiltį Advanced settings. Nustatymai suskirstyti į keturias kategorijas:
- URL Filtering (URL filtravimas) - valdykite, kuriuos URL įtraukti arba neįtraukti
- Query Parameters (Užklausos parametrai) - tvarkykite URL parametrus
- Content Filtering (Turinio filtravimas) - filtruokite konkrečius puslapio elementus
- Scraping Behavior (Nuskaitymo elgsena) - konfigūruokite, kaip išgaunamas turinys
URL Filtering
Įtraukti tik konkrečius URL
Laukas: Advanced Settings > URL Filtering > Include only URLs that contain (Įtraukti tik URL, kuriuose yra)
Įveskite kabliataškiu atskirtus raktinius žodžius, kad į nuskaitymą būtų įtraukti tik konkretūs URL.
Pavyzdys: norint nuskaityti tik angliškus pagalbos puslapius:
/en;/help
Taip nuskaitomi tik tie puslapiai, kurių URL yra /en arba help, ir taupomi simboliai praleidžiant neaktualias skiltis.
Neįtraukti neaktualių URL
Laukas: Advanced Settings > URL Filtering > Exclude URLs that contain (Neįtraukti URL, kuriuose yra)
Įveskite kabliataškiu atskirtus raktinius žodžius, kad praleistumėte tokias skiltis kaip tinklaraščiai, vaizdai ar naujienos.
Pavyzdys:
/news;/pictures;/press
Taip išvengsite daug turinio turinčių, bet pokalbių robotui neaktualių skilčių, tokių kaip naujienos ar nuotraukų galerijos, nuskaitymo.
Query Parameters
Ignoruoti visus užklausos parametrus
Laukas: Advanced Settings > Query Parameters > Ignore all query parameters (Ignoruoti visus užklausos parametrus)
Pažymėkite šį langelį, kad URL su skirtingais užklausos parametrais būtų laikomi tuo pačiu puslapiu. Tai apsaugo nuo besidubliuojančio turinio nuskaitymo.
Ignoruoti konkrečius užklausos parametrus
Laukas: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignoruoti konkrečius užklausos parametrus)
Įveskite kabliataškiu atskirtus parametrų pavadinimus, kad ignoruotumėte konkrečius sekimo ar filtravimo parametrus.
Pavyzdys:
ref;source;campaign;utm_source
Tokiu atveju page.html?ref=email ir page.html?ref=social bus laikomi tuo pačiu URL.
Content Filtering
Įtraukti konkrečius elementus
Laukas: Advanced Settings > Content Filtering > Include element IDs (Įtraukti elementų ID)
Įveskite kabliataškiu atskirtus elementų identifikatorius, kad nuskaitytumėte tik konkrečias puslapio dalis. Naudokite #id elementų ID, .classname klasėms ir laužtinius skliaustus atributams: [data-id="82874db"] atitinka elementus su tikslia šia atributo reikšme, [data-content] atitinka kiekvieną elementą, kuris apskritai turi šį atributą.
Pavyzdys:
#main-content;.article-body;[data-section="product"]
Taip nuskaitoma tik pagrindinio turinio sritis, straipsnių tekstai ir produktų skiltys, ignoruojant visa kita.
Sekti nuorodas tik įtrauktuose elementuose
Laukas: Advanced Settings > Content Filtering > Follow only links in included elements (Sekti nuorodas tik įtrauktuose elementuose)
Šis perjungiklis atsiranda, kai nurodote Include element IDs. Kai jis įjungtas, nuskaitymo robotas seks tik tas nuorodas, kurios randamos įtrauktuose elementuose. Tai naudinga, kai norite apriboti nuskaitymą tam tikromis svetainės skiltimis, pavyzdžiui, straipsnių turinio sritimis, ignoruodami navigacijos meniu antraštėse ar poraštėse.
Numatytoji reikšmė: išjungta (sekamos visos puslapyje esančios nuorodos)
Neįtraukti puslapio elementų
Laukas: Advanced Settings > Content Filtering > Exclude element IDs (Neįtraukti elementų ID)
Apsaugokite nuo antraščių, poraščių ir kitų maketo elementų nuskaitymo. Taikoma ta pati selektorių sintaksė: header ir footer be priešdėlio, #id, .classname arba atributas laužtiniuose skliaustuose, pvz., [data-id="82874db"] arba [data-nosnippet]. Atributų selektoriai yra patogūs, kai norimas pašalinti elementas neturi stabilaus id ar klasės, bet turi data-* atributą, kurį galite nukopijuoti iš naršyklės kūrėjo įrankių.
Pavyzdys:
header;footer;#navigation;.sidebar;[data-nosnippet]
Taip pašalinami HTML blokai, kurie kartojasi kiekviename puslapyje ir paprastai neturi jokio naudingo turinio jūsų pokalbių robotui.
Sekti nuorodas neįtrauktuose elementuose
Laukas: Advanced Settings > Content Filtering > Follow links in excluded elements (Sekti nuorodas neįtrauktuose elementuose)
Šis perjungiklis atsiranda, kai nurodote Exclude element IDs. Kai jis įjungtas, nuskaitymo robotas vis tiek seks nuorodas, esančias neįtrauktuose elementuose (pvz., navigacijos meniu antraštėse), nors pats turinys į apmokymą nebus įtrauktas.
Numatytoji reikšmė: išjungta (nuorodos neįtrauktuose elementuose nesekamos)
Naudojimo atvejis: įjunkite šią funkciją, kai norite pašalinti antraštės ar poraštės turinį iš apmokymo, tačiau vis tiek norite, kad robotas atrastų puslapius per tose srityse esančias navigacijos nuorodas. Tai suteikia dvigubą naudą: švarius apmokymo duomenis be meniu triukšmo ir pilną svetainės puslapių nuskaitymą.
Svarbu: jei naudojate visos svetainės nuskaitymą ir neįtraukiate tokių elementų kaip header neįjungę parinkties „Follow links in excluded elements“, nuskaitymo sistema gali neatrasti gilesnių nuorodų (meniu dažnai būna antraštėse). Tokiu atveju arba įjunkite šį perjungiklį, arba naudokite svetainės schemą – tai saugiausias ir efektyviausias būdas.
Scraping Behavior
Nuskaityti dokumentus
Laukas: Advanced Settings > Scraping Behavior > Scrape documents (Nuskaityti dokumentus)
Kai įjungta, sistema išgauna ir apdoroja svetainėje rastą dokumentų turinį. Šiuo metu palaikomi PDF failai.
Neįtraukti vaizdų nuorodų
Laukas: Advanced Settings > Scraping Behavior > Exclude image links (Neįtraukti vaizdų nuorodų)
Įjunkite šį perjungiklį, kad iš apmokymo duomenų rinkinio pašalintumėte visas vaizdų nuorodas. Pagal numatytuosius nustatymus sistema išgauna visas vaizdų nuorodas, o tai gali gerokai padidinti simbolių skaičių.
Šios parinkties įjungimas gali iš esmės sumažinti jūsų sunaudojamų simbolių kiekį.
Nuskaityti paslėptą turinį
Laukas: Advanced Settings > Scraping Behavior > Scrape hidden contents (Nuskaityti paslėptą turinį)
Kai įjungta (numatytasis nustatymas), sistema išgauna turinį iš paslėptų HTML elementų (elementų su display:none, visibility:hidden ar panašiomis CSS savybėmis).
Numatytoji reikšmė: įjungta
Kada išjungti: išjunkite šią parinktį, kad praleistumėte paslėptą turinį ir nuskaitytumėte tik matomus elementus. Tai naudinga, kai svetainėse yra paslėpto turinio, pavyzdžiui:
- Sutrauktos akordeono (accordion) skiltys
- Tik mobiliesiems arba tik staliniams kompiuteriams skirtas turinys
- Paslėpti formų laukai
- Kūrėjų komentarai ar derinimo (debug) informacija
Išjungus šį nustatymą galima sumažinti simbolių skaičių ir neleisti neaktualiam paslėptam turiniui patekti į jūsų apmokymo duomenis.
Delsa tarp puslapių
Laukas: Advanced Settings > Scraping Behavior > Delay between pages (Delsa tarp puslapių)
Pridėkite delsą (sekundėmis) tarp kiekvieno puslapio nuskaitymo, kad neperkrautumėte savo serverio. Tai naudinga svetainėms, kuriose taikomi užklausų skaičiaus apribojimai (rate limiting).
Simuliuoti apsilankymą iš konkrečios šalies
Laukas: Advanced Settings > Scraping Behavior > Country code (Šalies kodas)
Jei jūsų svetainėje rodomas skirtingas turinys, priklausomai nuo lankytojo vietos, įveskite dviejų raidžių šalies kodą (pvz., US, PL, DE), kad simuliuotumėte nuskaitymą iš tos vietovės.
Rekomenduojama konfigūracija daugumai svetainių
Daugumai svetainių ši konfigūracija užtikrina geriausią pusiausvyrą tarp išsamaus turinio ir mažesnio simbolių skaičiaus:
- Naudokite svetainės schemą (sitemap), kai ji pasiekiama, kad tiksliai valdytumėte URL
- Exclude element IDs:
header;footer;#navigation;.sidebar - Įjunkite „Exclude image links“, kad pašalintumėte vaizdų URL iš apmokymo
- Išjunkite „Scrape hidden contents“, jei jūsų svetainėje yra daug paslėptų elementų
- Apsvarstykite „Follow links in excluded elements“, jei naudojate pilną nuskaitymą su neįtrauktomis antraštėmis
Ši konfigūracija paprastai sumažina simbolių skaičių 20-40 %, išsaugodama visą vertingą turinį.
Santrauka: geriausios praktikos
- Naudokite sitemap vietoje viso puslapio nuskaitymo, kad tiksliai valdytumėte procesą
- Įtraukite URL, kad nusitaikytumėte tik į vertingą turinį
- Neįtraukite URL, kad praleistumėte neaktualius ar didelės apimties puslapius
- Ignoruokite užklausos parametrus, kad išvengtumėte pasikartojančio turinio
- Neįtraukite elementų ID, kad pašalintumėte pasikartojančias puslapio dalis, tokias kaip antraštės ir poraštės
- Valdykite nuorodų sekimą naudodami „Follow only links in included elements“ arba „Follow links in excluded elements“, kad tiksliai sureguliuotumėte nuskaitymą
- Neįtraukite vaizdų nuorodų, kad pastebimai sumažintumėte simbolių skaičių
- Išjunkite paslėpto turinio nuskaitymą, jei jūsų svetainėje yra nereikalingų paslėptų elementų
- Sutelkite dėmesį į naudingą turinį, skirtą jūsų robotui (DUK, produktų puslapiai, pagalbos straipsniai)