Ohjekeskus
Chatbotin kouluttaminen

Kuinka vähentää koulutusmerkkejä verkkosivustoa skannattaessa

Viimeksi päivitetty:

Kun koulutat chatbotiasi verkkosivuston avulla, skannattavan tiedon määrän rajaaminen kaikkein hyödyllisimpään sisältöön auttaa vähentämään merkkien kulutusta, nopeuttaa koulutusta ja parantaa vastausten laatua keskittymällä vain olennaiseen sisältöön.

Tässä oppaassa kerrotaan, miten optimoit skannauksen käyttämällä lisäasetuksia (Advanced settings) verkkosivuston koulutusikkunassa (Training > Links > Add New Training: Website [Koulutus > Linkit > Lisää uusi koulutus: Verkkosivusto]).


Miksi vähempi koulutusmateriaali voi olla parempi

ChatLab käyttää RAG (Retrieval-Augmented Generation) -arkkitehtuuria. Sen sijaan, että tekoäly painaisi mieleensä kaiken verkkosivuston sisällön, se etsii kaikkein olennaisimmat tiedonmurut kunkin käyttäjän kysymyksen hetkellä ja luo vastauksen niiden pohjalta.

Liiallisen datan ongelma

Enemmän dataa ei aina tarkoita parempia vastauksia. Epäolennaisen tai päällekkäisen sisällön lisääminen voi sekoittaa tiedonhakua:

  • RAG pisteyttää sisältölohkojen osuvuutta käyttäjän kysymykseen. Jos sivustosi sisältää paljon toistuvaa, epämääräistä tai yleisluontoista tekstiä (valikot, alatunnisteet, lehdistötiedotteet, blogin avainsanasivut), ne heikentävät hakutulosten laatua.
  • Kun chatbot hakee useita vähäarvoisia lohkoja, jotka jakavat samoja avainsanoja mutta joista puuttuu hyödyllinen konteksti, se saattaa luoda epätarkkoja, liian yleisiä tai aiheen ohi meneviä vastauksia.
  • Esimerkiksi: Jos alatunnisteesi sisältää linkit kuten "Etusivu", "Yhteystiedot", "Tietosuoja", "UKK" jokaisella sivulla, botti saattaa vastata yleisluontoisella kappaleella alatunnisteesta hyödyllisen puhelinnumeron tai sähköpostiosoitteen sijaan, kun käyttäjä kysyy: "Miten voin ottaa teihin yhteyttä?"

Vahva signaali, vähän kohinaa = paremmat vastaukset

Skannaamalla vain hyödyllistä sisältöä autat tekoälyä hakemaan selkeää, täsmällistä ja laadukasta kontekstia jokaiseen kysymykseen. Keskity seuraaviin:

  • Tuotekuvaukset
  • UKK-sivut
  • Tukilukujen artikkelit
  • Käyttöehdot ja käytäntöasiakirjat
  • Tärkeimmät laskeutumissivut

Käytä sivustokarttaa koko sivuston skannauksen sijaan

Suositus: Käytä sitemap-vaihtoehtoa (sivustokartta) aina kun mahdollista.

Koko sivuston skannaus seuraa kaikkia sivulla näkyviä linkkejä, mukaan lukien alatunnisteiden, valikoiden ja sivupalkkien linkkejä, mikä johtaa usein toistuvan tai arvottoman sisällön skannaamiseen. Nämä osiot ovat yleensä läsnä jokaisella sivulla, eivätkä ne juuri koskaan sisällä uniikkia tietoa, josta olisi hyötyä chat-vastauksissa.

Käyttämällä sivustokarttaa (joka sijaitsee yleensä osoitteessa https://yourdomain.com/sitemap.xml), voit:

  • Välttää tarpeettomien sivujen indeksoinnin (esim. lakitekstit, sosiaalisen median linkit, toistuvat blogitunnisteet)
  • Hallita tarkasti, mitkä URL-osoitteet skannataan
  • Estää valikoiden, alatunnisteiden ja ylätunnisteiden aiheuttaman tahattoman merkkimäärän liiallisen käytön

Lisäasetusten yleiskatsaus

Pääset lisäasetuksiin napsauttamalla Add New Training: Website (Lisää uusi koulutus: Verkkosivusto) Training-välilehdellä ja avaamalla sitten Advanced settings (Lisäasetukset) -osion. Asetukset on jaettu neljään kategoriaan:

  • URL Filtering (URL-suodatus) - Määritä, mitkä URL-osoitteet sisällytetään tai suljetaan pois
  • Query Parameters (Kyselyparametrit) - Käsittele URL-parametrit
  • Content Filtering (Sisällön suodatus) - Suodata tiettyjä sivun elementtejä
  • Scraping Behavior (Skannaustoiminta) - Määritä, miten sisältö erotetaan sivuilta

URL-suodatus

URL-suodatusvaihtoehdot

Sisällytä vain tietyt URL-osoitteet

Kenttä: Advanced Settings > URL Filtering > Include only URLs that contain (Sisällytä vain URL-osoitteet, jotka sisältävät)

Lisää puolipisteellä erotettuja avainsanoja sisällyttääksesi skannaukseen vain tietyt URL-osoitteet.

Esimerkki: Jos haluat skannata vain englanninkieliset ohjesivut:

/en;/help

Tämä skannaa vain sivut, joiden URL-osoitteessa on /en tai help, mikä säästää merkkejä ohittamalla epäolennaiset osiot.

Sulje pois epäolennaiset URL-osoitteet

Kenttä: Advanced Settings > URL Filtering > Exclude URLs that contain (Sulje pois URL-osoitteet, jotka sisältävät)

Lisää puolipisteellä erotettuja avainsanoja ohittaaksesi osioita, kuten blogit, kuvat tai uutiset.

Esimerkki:

/news;/pictures;/press

Tämä estää raskaiden mutta chatbotille epäolennaisten osioiden, kuten uutisten tai kuvagallerioiden, skannaamisen.


Kyselyparametrit

Kyselyparametrien asetukset

Ohita kaikki kyselyparametrit

Kenttä: Advanced Settings > Query Parameters > Ignore all query parameters (Ohita kaikki kyselyparametrit)

Valitse tämä valintaruutu kohdellaksesi URL-osoitteita, joissa on eri kyselyparametreja, samana sivuna. Tämä estää päällekkäisen sisällön skannaamisen.

Ohita tietyt kyselyparametrit

Kenttä: Advanced Settings > Query Parameters > Ignore specific query parameters (Ohita tietyt kyselyparametrit)

Lisää puolipisteellä erotettuja parametrien nimiä ohittaaksesi tietyt seuranta- tai suodatusparametrit.

Esimerkki:

ref;source;campaign;utm_source

Tämä käsittelee osoitteita page.html?ref=email ja page.html?ref=social samana URL-osoitteena.


Sisällön suodatus

Sisällön suodatusvaihtoehdot

Sisällytä tietyt elementit

Kenttä: Advanced Settings > Content Filtering > Include element IDs (Sisällytä elementtitunnisteet)

Lisää puolipisteellä erotettuja elementtimääritteitä skannataksesi vain tietyt sivun osat. Käytä #id-muotoa elementin tunnisteille, .classname-muotoa luokille ja hakasulkeita attribuuteille: [data-id="82874db"] vastaa elementtejä, joilla on juuri kyseinen attribuutin arvo, ja [data-content] vastaa kaikkia elementtejä, joilla kyseinen attribuutti ylipäätään on.

Esimerkki:

#main-content;.article-body;[data-section="product"]

Tämä skannaa vain pääsisältöalueen, artikkelien tekstiosiot ja tuoteosiot ohittaen kaiken muun.

Seuraa vain sisällytettyjen elementtien linkkejä

Kenttä: Advanced Settings > Content Filtering > Follow only links in included elements (Seuraa vain sisällytettyjen elementtien linkkejä)

Tämä kytkin tulee näkyviin, kun määrität kentän Include element IDs. Kun se on käytössä, verkkosisällön kerääjä seuraa vain linkkejä, jotka löytyvät sisällytetyistä elementeistä. Tämä on hyödyllistä, kun haluat rajata indeksoinnin vain verkkosivuston tiettyihin osioihin, kuten artikkelien sisältöalueisiin, ja jättää ylä- tai alatunnisteiden navigointivalikot huomiotta.

Oletus: Pois käytöstä (kaikkia sivun linkkejä seurataan)

Sulje pois sivun elementit

Kenttä: Advanced Settings > Content Filtering > Exclude element IDs (Sulje pois elementtitunnisteet)

Estä ylätunnisteiden, alatunnisteiden ja muiden asetteluelementtien skannaus. Sama valitsinsyntaksi pätee: header ja footer ilman etuliitettä, #id, .classname tai attribuutti hakasulkeissa, kuten [data-id="82874db"] tai [data-nosnippet]. Attribuuttivalitsimet ovat käteviä silloin, kun poistettavalla elementillä ei ole pysyvää id- tai class-määritettä, mutta sillä on data-*-attribuutti, jonka voit kopioida selaimen kehittäjätyökaluista.

Esimerkki:

header;footer;#navigation;.sidebar;[data-nosnippet]

Tämä poistaa HTML-lohkot, jotka toistuvat jokaisella sivulla ja jotka eivät yleensä sisällä hyödyllistä tietoa chatbotillesi.

Seuraa poissuljettujen elementtien linkkejä

Kenttä: Advanced Settings > Content Filtering > Follow links in excluded elements (Seuraa poissuljettujen elementtien linkkejä)

Tämä kytkin tulee näkyviin, kun määrität kentän Exclude element IDs. Kun se on käytössä, kerääjä seuraa silti poissuljettujen elementtien sisältä löytyviä linkkejä (kuten ylätunnisteiden navigointivalikoita), vaikka itse sisältö jätetään pois koulutuksesta.

Oletus: Pois käytöstä (poissuljettujen elementtien linkkejä ei seurata)

Käyttötapaus: Ota tämä käyttöön, kun haluat jättää ylä- ja alatunnisteiden sisällön pois koulutuksesta, mutta tarvitset kerääjää löytämään sivuja näillä alueilla olevien navigointilinkkien kautta. Näin saat molempien puolten edut: siistin koulutusdatan ilman valikoiden aiheuttamaa hälyä samalla, kun koko sivustosi indeksoidaan.

Tärkeää: Jos käytät koko sivuston skannausta ja suljet pois elementtejä kuten header ottamatta käyttöön asetusta "Follow links in excluded elements", skanneri ei välttämättä löydä syvempiä linkkejä (valikot ovat usein ylätunnisteiden sisällä). Ota tällöin kytkin käyttöön tai käytä sivustokarttaa, joka on turvallisin ja tehokkain tapa.


Skannaustoiminta

Skannaustoiminnan asetukset

Skannaa asiakirjat

Kenttä: Advanced Settings > Scraping Behavior > Scrape documents (Skannaa asiakirjat)

Kun tämä asetus on käytössä, järjestelmä poimii ja käsittelee verkkosivustolta löytyvien asiakirjojen sisällön. Tällä hetkellä ominaisuus tukee PDF-tiedostoja.

Sulje pois kuvalinkit

Kenttä: Advanced Settings > Scraping Behavior > Exclude image links (Sulje pois kuvalinkit)

Ota tämä kytkin käyttöön poistaaksesi kaikki kuvalinkit koulutusaineistosta. Oletusarvoisesti järjestelmä poimii kaikki kuvalinkit, mikä voi kasvattaa merkkimäärää huomattavasti.

Tämän vaihtoehdon käyttöönotto voi vähentää merkkimäärää merkittävästi.

Skannaa piilotettu sisältö

Kenttä: Advanced Settings > Scraping Behavior > Scrape hidden contents (Skannaa piilotettu sisältö)

Kun tämä asetus on käytössä (oletus), järjestelmä poimii sisällön piilotetuista HTML-elementeistä (elementit, joissa on display:none, visibility:hidden tai vastaavia CSS-ominaisuuksia).

Oletus: Käytössä

Milloin poistaa käytöstä: Poista tämä asetus käytöstä ohittaaksesi piilotetun sisällön ja skannataksesi vain näkyvät elementit. Tämä on hyödyllistä, kun verkkosivustoilla on piilotettua sisältöä, kuten:

  • Supistetut haitariosiot (haitarivalikot)
  • Vain mobiililaitteille tai vain työpöydälle tarkoitettu sisältö
  • Piilotetut lomakekentät
  • Kehittäjien kommentit tai virheenkorjaustiedot

Tämän poistaminen käytöstä voi vähentää merkkimäärää ja estää epäolennaisen piilotetun sisällön päätymisen koulutusdataasi.

Sivujen välinen viive

Kenttä: Advanced Settings > Scraping Behavior > Delay between pages (Sivujen välinen viive)

Määritä viive (sekunneissa) kunkin sivun skannauksen väliin palvelimesi ylikuormituksen estämiseksi. Hyödyllinen sivustoille, joilla on käytössä pyyntöjen määrärajoitus (rate limiting).

Simuloi vierailua tietystä maasta

Kenttä: Advanced Settings > Scraping Behavior > Country code (Maakoodi)

Jos sivustosi näyttää erilaista sisältöä vierailijan sijainnin mukaan, anna 2-kirjaiminen maakoodi (esim. US, FI, DE) simuloidaksesi skannausta kyseisestä sijainnista.


Suositeltu määritys useimmille verkkosivustoille

Useimmilla verkkosivustoilla seuraava määritys tarjoaa parhaan tasapainon kattavan sisällön ja alhaisemman merkkimäärän välillä:

  1. Käytä sivustokarttaa, kun se on saatavilla, tarkkaa URL-osoitteiden hallintaa varten
  2. Sulje pois elementtitunnisteet (Exclude element IDs): header;footer;#navigation;.sidebar
  3. Ota käyttöön "Exclude image links" poistaaksesi kuvien URL-osoitteet koulutusdatasta
  4. Poista käytöstä "Scrape hidden contents", jos sivustollasi on paljon piilotettuja elementtejä
  5. Harkitse asetusta "Follow links in excluded elements", jos käytät koko sivuston skannausta ja olet sulkenut pois ylätunnisteet

Tämä määritys vähentää merkkimäärää tyypillisesti 20-40 % säilyttäen samalla kaiken arvokkaan sisällön.


Yhteenveto: Parhaat käytännöt

  • Käytä sivustokarttaa koko sivuston skannauksen sijaan tarkan hallinnan varmistamiseksi
  • Sisällytä URL-osoitteita kohdistaaksesi skannauksen vain arvokkaaseen sisältöön
  • Sulje pois URL-osoitteita ohittaaksesi epäolennaiset tai raskaat sivut
  • Ohita kyselyparametrit välttääksesi päällekkäistä sisältöä
  • Sulje pois elementtitunnisteita toistuvien sivunosien, kuten ylä- ja alatunnisteiden, poistamiseksi
  • Hallitse linkkien seuraamista asetuksilla "Follow only links in included elements" tai "Follow links in excluded elements" tarkkaa indeksoinnin hallintaa varten
  • Sulje pois kuvalinkit vähentääksesi merkkimäärää merkittävästi
  • Poista käytöstä piilotetun sisällön skannaus, jos sivustollasi on tarpeettomia piilotettuja elementtejä
  • Keskity hyödylliseen sisältöön bottiasi varten (UKK:t, tuotesivut, tukiartikkelit)