Når du trener chatboten din på et nettsted, vil det å begrense mengden skannede data til det som er mest nyttig bidra til å redusere tegnforbruket, øke treningshastigheten og forbedre svarkvaliteten ved å fokusere utelukkende på relevant innhold.
Denne veiledningen forklarer hvordan du optimaliserer skanningen ved hjelp av Advanced settings (Avanserte innstillinger) i modulen for nettstedstrening (Training > Links > Add New Training: Website (Trening > Lenker > Legg til ny trening: Nettsted)).
Hvorfor mindre trening kan være bedre
ChatLab bruker RAG (Retrieval-Augmented Generation)-arkitektur. I stedet for å pugge alt innhold på nettstedet, søker den kunstige intelligensen etter de mest relevante informasjonsbitene i det øyeblikket brukeren stiller et spørsmål, og bruker disse til å generere et svar.
Problemet med for mye data
Mer data betyr ikke alltid bedre svar. Å legge til irrelevant eller overflødig innhold kan forvirre gjenfinningsprosessen:
- RAG rangerer innholdsbiter basert på relevans for brukerens spørsmål. Hvis nettstedet ditt inneholder mange sider med repeterende, vag eller generell tekst (menyer, bunntekster, pressemeldinger, tagg-sider for blogger), vanner de ut kvaliteten på søkeresultatene.
- Når chatboten henter inn flere biter med lav verdi som deler nøkkelord, men mangler nyttig kontekst, kan den generere unøyaktige, for generelle eller irrelevante svar.
- Et eksempel: Hvis bunnteksten din inneholder lenker som «Hjem», «Kontakt», «Personvern», «FAQ» på hver eneste side, kan boten svare med et generelt avsnitt fra bunnteksten i stedet for et nyttig telefonnummer eller en e-postadresse når en bruker spør: «Hvordan kan jeg kontakte dere?»
Høyere signal, mindre støy = bedre svar
Ved å skanne kun nyttig innhold hjelper du den kunstige intelligensen med å hente ut tydelig, spesifikk og høykvalitets kontekst for hvert spørsmål. Fokuser på:
- Produktbeskrivelser
- FAQ-sider (ofte stilte spørsmål)
- Hjelpeartikler
- Retningslinjer og vilkårsdokumenter
- Viktige landingssider
Bruk nettstedskart i stedet for fullstendig nettstedsskanning
Anbefalt: Bruk alternativet for sitemap (nettstedskart) når det er mulig.
En fullstendig nettstedsskanning følger alle synlige lenker på siden, inkludert lenker fra bunntekster, menyer og sidefelt, noe som ofte fører til skanning av repeterende innhold eller innhold uten verdi. Disse seksjonene finnes vanligvis på hver eneste side og inneholder sjelden unik informasjon som er nyttig for chatsvar.
Ved å bruke et nettstedskart (vanligvis plassert på https://dittdomene.no/sitemap.xml), vil du:
- Unngå gjennomsøking av unødvendige sider (f.eks. juridiske sider, sosiale lenker, gjentatte bloggtagger)
- Kontrollere nøyaktig hvilke URL-er som skannes
- Forhindre utilsiktet overforbruk av tegn fra menyer, bunntekster og topptekster
Oversikt over avanserte innstillinger
For å få tilgang til avanserte innstillinger klikker du på Add New Training: Website i fanen Training, og utvider deretter delen Advanced settings. Innstillingene er organisert i fire kategorier:
- URL Filtering (URL-filtrering) - Kontroller hvilke URL-er som skal inkluderes eller ekskluderes
- Query Parameters (Spørreparametere) - Håndter URL-parametere
- Content Filtering (Innholdsfiltrering) - Filtrer spesifikke sideelementer
- Scraping Behavior (Skrapeadferd) - Konfigurer hvordan innhold trekkes ut
URL Filtering
Inkluder kun spesifikke URL-er
Felt: Advanced Settings > URL Filtering > Include only URLs that contain (Inkluder kun URL-er som inneholder)
Legg til nøkkelord atskilt med semikolon for kun å inkludere spesifikke URL-er i skanningen.
Eksempel: For å skanne kun engelske hjelpesider:
/en;/help
Dette skanner kun sider som inneholder /en eller help i URL-en, og sparer tegn ved å hoppe over irrelevante deler.
Ekskluder irrelevante URL-er
Felt: Advanced Settings > URL Filtering > Exclude URLs that contain (Ekskluder URL-er som inneholder)
Legg til nøkkelord atskilt med semikolon for å hoppe over seksjoner som blogger, bilder eller nyheter.
Eksempel:
/news;/pictures;/press
Dette unngår skanning av innholdstunge, men chatbot-irrelevante seksjoner som nyheter eller bildegallerier.
Query Parameters
Ignorer alle spørreparametere
Felt: Advanced Settings > Query Parameters > Ignore all query parameters (Ignorer alle spørreparametere)
Merk av i denne avmerkingsboksen for å behandle URL-er med ulike spørreparametere som samme side. Dette forhindrer skanning av duplisert innhold.
Ignorer spesifikke spørreparametere
Felt: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignorer spesifikke spørreparametere)
Legg til parameternavn atskilt med semikolon for å ignorere spesifikke sporings- eller filtreringsparametere.
Eksempel:
ref;source;campaign;utm_source
Dette behandler page.html?ref=email og page.html?ref=social som samme URL.
Content Filtering
Inkluder spesifikke elementer
Felt: Advanced Settings > Content Filtering > Include element IDs (Inkluder element-ID-er)
Legg til elementidentifikatorer atskilt med semikolon for kun å skanne bestemte deler av siden. Bruk #id for element-ID-er, .classname for klasser, og hakeparenteser for attributter: [data-id="82874db"] samsvarer med elementer med nøyaktig denne attributtverdien, [data-content] samsvarer med alle elementer som i det hele tatt har attributtet.
Eksempel:
#main-content;.article-body;[data-section="product"]
Dette skanner kun hovedinnholdsområdet, brødteksten i artikler og produktseksjoner, og ignorerer alt annet.
Følg kun lenker i inkluderte elementer
Felt: Advanced Settings > Content Filtering > Follow only links in included elements (Følg kun lenker i inkluderte elementer)
Denne bryteren vises når du angir Include element IDs. Når den er aktivert, vil gjennomsøkeren bare følge lenker som finnes innenfor de inkluderte elementene. Dette er nyttig når du vil begrense gjennomsøkingen til bestemte seksjoner på nettstedet, for eksempel innholdsområder for artikler, samtidig som navigasjonsmenyer i topp- eller bunntekster ignoreres.
Standard: Deaktivert (alle lenker på siden følges)
Ekskluder sideelementer
Felt: Advanced Settings > Content Filtering > Exclude element IDs (Ekskluder element-ID-er)
Forhindre skanning av topptekster, bunntekster og andre layoutelementer. Den samme velgersyntaksen gjelder: header og footer uten prefiks, #id, .classname, eller et attributt i hakeparenteser som [data-id="82874db"] eller [data-nosnippet]. Attributtvelgere er praktiske når elementet du vil fjerne ikke har en stabil ID eller klasse, men har et data-*-attributt du kan kopiere fra nettleserens utviklerverktøy.
Eksempel:
header;footer;#navigation;.sidebar;[data-nosnippet]
Dette fjerner HTML-blokker som gjentas på hver side og generelt ikke inneholder nyttig innhold for chatboten din.
Følg lenker i ekskluderte elementer
Felt: Advanced Settings > Content Filtering > Follow links in excluded elements (Følg lenker i ekskluderte elementer)
Denne bryteren vises når du angir Exclude element IDs. Når den er aktivert, vil gjennomsøkeren fortsatt følge lenker som finnes i ekskluderte elementer (som navigasjonsmenyer i topptekster), selv om selve innholdet er ekskludert fra treningen.
Standard: Deaktivert (lenker i ekskluderte elementer følges ikke)
Brukstilfelle: Aktiver dette når du vil ekskludere innhold i topp- eller bunntekst fra treningen, men likevel trenger at gjennomsøkeren oppdager sider via navigasjonslenker i disse områdene. Dette gir deg det beste fra to verdener: rene treningsdata uten menystøy, samtidig som hele nettstedet ditt gjennomsøkes.
Viktig: Hvis du bruker fullstendig nettstedsskanning og ekskluderer elementer som topptekst uten å aktivere «Follow links in excluded elements», kan det hende at skanneren ikke oppdager dypereliggende lenker (menyer ligger ofte inne i topptekster). I slike tilfeller bør du enten aktivere bryteren eller bruke et nettstedskart for den tryggeste og mest effektive metoden.
Scraping Behavior
Skrap dokumenter
Felt: Advanced Settings > Scraping Behavior > Scrape documents (Skrap dokumenter)
Når denne er aktivert, trekker systemet ut og behandler dokumentinnhold som finnes på nettstedet. Støtter for øyeblikket PDF-filer.
Ekskluder bildelenker
Felt: Advanced Settings > Scraping Behavior > Exclude image links (Ekskluder bildelenker)
Aktiver denne bryteren for å ekskludere alle bildelenker fra treningsdatasettet. Som standard trekker systemet ut alle bildelenker, noe som kan øke tegnantallet betraktelig.
Aktivering av dette alternativet kan redusere tegnantallet ditt betydelig.
Skrap skjult innhold
Felt: Advanced Settings > Scraping Behavior > Scrape hidden contents (Skrap skjult innhold)
Når denne er aktivert (standard), trekker systemet ut innhold fra skjulte HTML-elementer (elementer med display:none, visibility:hidden eller lignende CSS-egenskaper).
Standard: Aktivert
Når du bør deaktivere: Deaktiver dette alternativet for å hoppe over skjult innhold og kun skrape synlige elementer. Dette er nyttig når nettsteder inneholder skjult innhold som:
- Skjulte trekkspillseksjoner (akkordeoner)
- Innhold som kun vises på mobil eller datamaskin
- Skjulte skjemafelter
- Utviklerkommentarer eller feilsøkingsinformasjon
Deaktivering av dette kan redusere tegnantallet og forhindre at irrelevant skjult innhold havner i treningsdataene dine.
Forsinkelse mellom sider
Felt: Advanced Settings > Scraping Behavior > Delay between pages (Forsinkelse mellom sider)
Legg til en forsinkelse (i sekunder) mellom skanningen av hver side for å unngå overbelastning av serveren din. Nyttig for nettsteder med hastighetsbegrensninger (rate limiting).
Simuler besøk fra et bestemt land
Felt: Advanced Settings > Scraping Behavior > Country code (Landskode)
Hvis nettstedet ditt viser ulikt innhold avhengig av hvor den besøkende befinner seg, skriver du inn en landskode på to bokstaver (f.eks. US, PL, NO) for å simulere skanning fra det stedet.
Anbefalt konfigurasjon for de fleste nettsteder
For de fleste nettsteder gir følgende konfigurasjon den beste balansen mellom helhetlig innhold og redusert tegnantall:
- Bruk nettstedskart når det er tilgjengelig for presis URL-kontroll
- Ekskluder element-ID-er:
header;footer;#navigation;.sidebar - Aktiver «Exclude image links» for å fjerne bilde-URL-er fra treningen
- Deaktiver «Scrape hidden contents» hvis nettstedet ditt har mange skjulte elementer
- Vurder «Follow links in excluded elements» hvis du bruker full skanning med ekskluderte topptekster
Denne konfigurasjonen reduserer vanligvis tegnantallet med 20-40 % samtidig som alt verdifullt innhold beholdes.
Sammendrag: Beste praksis
- Bruk nettstedskart i stedet for full skanning for presis kontroll
- Inkluder URL-er for å målrette kun verdifullt innhold
- Ekskluder URL-er for å hoppe over irrelevante eller tunge sider
- Ignorer spørreparametere for å unngå duplisert innhold
- Ekskluder element-ID-er for å fjerne gjentatte sidedeler som topptekster og bunntekster
- Styr lenkefølging med «Follow only links in included elements» eller «Follow links in excluded elements» for finjustert gjennomsøkingskontroll
- Ekskluder bildelenker for å redusere tegnantallet betydelig
- Deaktiver skraping av skjult innhold hvis nettstedet ditt har unødvendige skjulte elementer
- Fokuser på nyttig innhold for boten din (FAQ-er, produktsider, hjelpeartikler)