Kui treenite oma chatbot'i veebisaidil, aitab skannitavate andmete piiramine kõige vajalikumaga vähendada tähemärkide kasutust, kiirendab treenimist ja parandab vastuste kvaliteeti, keskendudes üksnes asjakohasele sisule.
See juhend selgitab, kuidas optimeerida skannimist, kasutades veebisaidi treenimise modaalaknas täpsemaid seadeid Advanced settings (Täpsemad seaded) teekonnal Training > Links > Add New Training: Website (Treenimine > Lingid > Lisa uus treenimine: Veebisait).
Miks vähem treenimist võib olla parem
ChatLab kasutab RAG (Retrieval-Augmented Generation) arhitektuuri. Kogu veebisaidi sisu päheõppimise asemel otsib tehisintellekt iga kasutaja küsimuse esitamise hetkel kõige asjakohasemaid infoosi ja kasutab neid vastuse loomiseks.
Liiga suure andmemahu probleem
Rohkem andmeid ei tähenda alati paremaid vastuseid. Asjakohatu või liigse sisu lisamine võib otsinguprotsessi segadusse ajada:
- RAG hindab sisutükkide asjakohasust kasutaja küsimuse suhtes. Kui teie sait sisaldab palju lehti, millel on korduv, ebamäärane või üldine tekst (menüüd, jalused, pressiteated, blogi sildilehed), halvendavad need otsingutulemuste kvaliteeti.
- Kui chatbot leiab mitu väheväärtuslikku osa, mis jagavad küll märksõnu, kuid millel puudub kasulik kontekst, võib see luua ebatäpseid, liiga üldiseid või teemaväliseid vastuseid.
- Näiteks: kui teie jalus sisaldab igal lehel linke nagu "Avaleht", "Kontakt", "Privaatsus", "KKK", võib bot vastata kasutaja küsimusele "Kuidas ma saan teiega ühendust võtta?" kasuliku telefoninumbri või e-posti aadressi asemel hoopis üldise lõiguga jalusest.
Rohkem signaali, vähem müra = paremad vastused
Skannides ainult kasulikku sisu, aitate tehisintellektil leida iga küsimuse jaoks selge, konkreetse ja kvaliteetse konteksti. Keskenduge järgmisele:
- Tootekirjeldused
- KKK-lehed
- Tugiartiklid
- Tingimuste ja eeskirjade dokumendid
- Peamised maandumislehed
Kasutage täieliku veebisaidi skannimise asemel sisukaarti (Sitemap)
Soovitatav: kasutage võimaluse korral alati valikut sitemap.
Täielik veebisaidi skannimine järgib kõiki lehel nähtavaid linke, sealhulgas linke jalustest, menüüdest ja külgribadelt, mis viib sageli korduva või väheväärtusliku sisu skannimiseni. Need jaotised asuvad tavaliselt igal lehel ja sisaldavad harva unikaalset infot, mis oleks kasulik vestluse vastustes.
Kasutades sisukaarti (mis asub tavaliselt aadressil https://yourdomain.com/sitemap.xml):
- Väldite ebavajalike lehtede roomamist (nt õiguslikud lehed, sotsiaalmeedia lingid, korduvad blogisildid)
- Kontrollite täpselt, milliseid URL-e skannitakse
- Ennetate menüüdest, jalustest ja päistest tulenevat soovimatut tähemärkide liigkasutust
Täpsemate seadete ülevaade
Täpsematele seadetele juurdepääsuks klõpsake vahekaardil Training valikul Add New Training: Website, seejärel avage jaotis Advanced settings. Seaded on jaotatud nelja kategooriasse:
- URL Filtering (URL-ide filtreerimine) - määrake, milliseid URL-e kaasata või välistada
- Query Parameters (Päringuparameetrid) - hallake URL-i parameetreid
- Content Filtering (Sisu filtreerimine) - filtreerige konkreetseid leheelemente
- Scraping Behavior (Kraapimiskäitumine) - konfigureerige, kuidas sisu eraldatakse
URL-ide filtreerimine (URL Filtering)
Ainult teatud URL-ide kaasamine
Väli: Advanced Settings > URL Filtering > Include only URLs that contain (Kaasa ainult URL-id, mis sisaldavad)
Lisage semikooloniga eraldatud märksõnad, et kaasata skannimisse ainult konkreetsed URL-id.
Näide: ainult ingliskeelsete abilehtede skannimiseks:
/en;/help
See skannib ainult lehti, mille URL sisaldab /en või help, säästes tähemärke ja jättes asjakohatud jaotised vahele.
Asjakohatute URL-ide välistamine
Väli: Advanced Settings > URL Filtering > Exclude URLs that contain (Välista URL-id, mis sisaldavad)
Lisage semikooloniga eraldatud märksõnad, et jätta vahele jaotised nagu blogid, pildid või uudised.
Näide:
/news;/pictures;/press
See hoiab ära suure sisumahuga, kuid chatbot'i jaoks asjakohatute jaotiste (nagu uudised või pildigaleriid) skannimise.
Päringuparameetrid (Query Parameters)
Kõigi päringuparameetrite ignoreerimine
Väli: Advanced Settings > Query Parameters > Ignore all query parameters (Ignoreeri kõiki päringuparameetreid)
Märkige see ruut, et käsitleda erinevate päringuparameetritega URL-e sama lehena. See hoiab ära duplikaatsisu skannimise.
Konkreetsete päringuparameetrite ignoreerimine
Väli: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignoreeri konkreetseid päringuparameetreid)
Lisage semikooloniga eraldatud parameetrinimed, et ignoreerida konkreetseid jälgimis- või filtreerimisparameetreid.
Näide:
ref;source;campaign;utm_source
See käsitleb aadresse page.html?ref=email ja page.html?ref=social sama URL-ina.
Sisu filtreerimine (Content Filtering)
Konkreetsete elementide kaasamine
Väli: Advanced Settings > Content Filtering > Include element IDs (Kaasa elementide ID-d)
Lisage semikooloniga eraldatud elementide identifikaatorid, et skannida ainult lehe teatud osi. Kasutage elementide ID-de jaoks #id, klasside jaoks .classname ja atribuutide jaoks nurksulge: [data-id="82874db"] vastab täpselt selle atribuudiväärtusega elementidele, [data-content] vastab igale elemendile, millel see atribuut üldse olemas on.
Näide:
#main-content;.article-body;[data-section="product"]
See skannib ainult peamist sisuala, artikli kehaosi ja tootejaotisi, ignoreerides kõike muud.
Järgi linke ainult kaasatud elementides
Väli: Advanced Settings > Content Filtering > Follow only links in included elements (Järgi linke ainult kaasatud elementides)
See lüliti ilmub siis, kui määrate välja Include element IDs. Kui see on lubatud, järgib roomaja ainult kaasatud elementide seest leitud linke. See on kasulik, kui soovite piirata roomamist veebisaidi teatud jaotistega, näiteks artikli sisualadega, ignoreerides samal ajal navigatsioonimenüüsid päistes või jalustes.
Vaikimisi: Keelatud (kõiki lehel olevaid linke järgitakse)
Leheelementide välistamine
Väli: Advanced Settings > Content Filtering > Exclude element IDs (Välista elementide ID-d)
Vältige päiste, jaluste ja muude kujunduselementide skannimist. Kehtib sama selektorite süntaks: header ja footer ilma eesliiteta, #id, .classname või atribuut nurksulgudes, näiteks [data-id="82874db"] või [data-nosnippet]. Atribuudiselektorid on mugavad siis, kui eemaldataval elemendil pole kindlat ID-d ega klassi, kuid sellel on brauseri arendajatööriistadest kopeeritav data-* atribuut.
Näide:
header;footer;#navigation;.sidebar;[data-nosnippet]
See eemaldab HTML-plokid, mis korduvad igal lehel ja ei sisalda tavaliselt teie chatbot'i jaoks kasulikku infot.
Järgi linke välistatud elementides
Väli: Advanced Settings > Content Filtering > Follow links in excluded elements (Järgi linke välistatud elementides)
See lüliti ilmub siis, kui määrate välja Exclude element IDs. Kui see on lubatud, järgib roomaja endiselt välistatud elementidest (nagu päises asuvad navigatsioonimenüüd) leitud linke, kuigi sisu ennast treenimisest välja jäetakse.
Vaikimisi: Keelatud (välistatud elementides olevaid linke ei järgita)
Kasutusjuht: lubage see valik, kui soovite päise/jaluse sisu treenimisest välja jätta, kuid vajate siiski, et roomaja leiaks lehti nendes alades asuvate navigatsioonilinkide kaudu. Nii saavutate parima mõlemast: puhtad treeningandmed ilma segavate menüüdetekstideta, skannides samal ajal kogu oma saiti.
Tähtis: kui kasutate täielikku veebisaidi skannimist ja välistate elemente nagu päis (header) ilma valikut "Follow links in excluded elements" lubamata, ei pruugi skanner sügavamaid linke avastada (menüüd asuvad sageli päiste sees). Sellisel juhul lülitage lüliti sisse või kasutage kõige turvalisema ja tõhusama meetodina sisukaarti (sitemap).
Kraapimiskäitumine (Scraping Behavior)
Dokumentide kraapimine
Väli: Advanced Settings > Scraping Behavior > Scrape documents (Kraabi dokumente)
Kui see on lubatud, eraldab ja töötleb süsteem veebisaidilt leitud dokumentide sisu. Praegu toetatakse PDF-faile.
Pildilinkide välistamine
Väli: Advanced Settings > Scraping Behavior > Exclude image links (Välista pildilingid)
Lülitage see valik sisse, et välistada treeningu andmestikust kõik pildilingid. Vaikimisi eraldab süsteem kõik pildilingid, mis võib tähemärkide arvu märkimisväärselt suurendada.
Selle valiku sisselülitamine võib teie tähemärkide arvu oluliselt vähendada.
Peidetud sisu kraapimine
Väli: Advanced Settings > Scraping Behavior > Scrape hidden contents (Kraabi peidetud sisu)
Kui see on lubatud (vaikeseade), eraldab süsteem sisu peidetud HTML-elementidest (elemendid, millel on display:none, visibility:hidden või sarnased CSS-omadused).
Vaikimisi: Lubatud
Millal keelata: keelake see valik, et jätta peidetud sisu vahele ja kraapida ainult nähtavaid elemente. See on kasulik, kui veebisaidid sisaldavad peidetud sisu, näiteks:
- Kokkuvolditud akordionjaotised
- Ainult mobiilile või ainult töölauale mõeldud sisu
- Peidetud vormiväljad
- Arendaja kommentaarid või silumisinfo
Selle keelamine võib vähendada tähemärkide arvu ja vältida asjakohatu peidetud sisu sattumist treeningandmetesse.
Lehtedevaheline viivitus
Väli: Advanced Settings > Scraping Behavior > Delay between pages (Viivitus lehtede vahel)
Lisage viivitus (sekundites) iga lehe skannimise vahele, et vältida oma serveri ülekoormamist. Kasulik veebisaitide puhul, millel on päringupiirangud (rate limiting).
Konkreetsest riigist külastuse simuleerimine
Väli: Advanced Settings > Scraping Behavior > Country code (Riigikood)
Kui teie sait kuvab erinevat sisu sõltuvalt külastaja asukohast, sisestage 2-täheline riigikood (nt US, PL, DE), et simuleerida skannimist sellest asukohast.
Soovitatav seadistus enamikule veebisaitidele
Enamiku veebisaitide puhul tagab järgmine seadistus parima tasakaalu tervikliku sisu ja väiksema tähemärkide arvu vahel:
- Kasutage sisukaarti (sitemap), kui see on URL-ide täpseks juhtimiseks saadaval
- Exclude element IDs:
header;footer;#navigation;.sidebar - Lülitage sisse "Exclude image links", et eemaldada piltide URL-id treenimisest
- Lülitage välja "Scrape hidden contents", kui teie saidil on palju peidetud elemente
- Kaaluge lüliti "Follow links in excluded elements" sisselülitamist, kui kasutate täielikku skannimist koos välistatud päistega
See seadistus vähendab tähemärkide arvu tavaliselt 20-40%, säilitades samal ajal kogu väärtusliku sisu.
Kokkuvõte: parimad tavad
- Kasutage täieliku skannimise asemel sisukaarti (sitemap) täpseks juhtimiseks
- Kaasake URL-e, et sihtida ainult väärtuslikku sisu
- Välistage URL-e, et jätta vahele asjakohatud või mahukad lehed
- Ignoreerige päringuparameetreid, et vältida duplikaatsisu
- Välistage elementide ID-sid, et eemaldada korduvaid leheosi, nagu päised ja jalused
- Juhtige linkide järgimist valikutega "Follow only links in included elements" või "Follow links in excluded elements" roomamise täpseks reguleerimiseks
- Välistage pildilingid, et vähendada tähemärkide arvu märkimisväärselt
- Keelake peidetud sisu kraapimine, kui teie saidil on ebavajalikke peidetud elemente
- Keskenduge oma boti jaoks kasulikule sisule (KKK-d, tootelehed, tugiartiklid)