Hjälpcenter
Träna din chatbot

Så minskar du träningstecken när du skannar en webbplats

Senast uppdaterad:

När du tränar din chatbot på en webbplats hjälper det att begränsa mängden skannad data till det som är mest användbart. Det minskar förbrukningen av tecken, snabbar upp träningen och förbättrar svarskvaliteten genom att fokusera enbart på relevant innehåll.

Den här guiden förklarar hur du optimerar din skanning med hjälp av Advanced settings (avancerade inställningar) i modalfönstret för webbplatsträning (Training > Links > Add New Training: Website).


Varför mindre träning kan vara bättre

ChatLab använder RAG-arkitektur (Retrieval-Augmented Generation). Istället för att memorera allt innehåll på webbplatsen söker AI:n efter de mest relevanta informationsdelarna vid tidpunkten för varje användarfråga och använder dem för att skapa ett svar.

Problemet med för mycket data

Mer data innebär inte alltid bättre svar. Att lägga till irrelevant eller överflödigt innehåll kan förvirra sökprocessen:

  • RAG poängsätter innehållsblock utifrån relevans för användarens fråga. Om din webbplats innehåller många sidor med upprepande, vag eller allmän text (menyer, sidfötter, pressmeddelanden, taggsidor i bloggen) försämrar de kvaliteten på sökresultaten.
  • När chatboten hämtar flera lågvärdiga block som delar nyckelord men saknar hjälpsam kontext, kan den generera felaktiga, alltför generella eller irrelevanta svar.
  • Till exempel: Om din sidfot innehåller länkar som "Hem", "Kontakt", "Integritetspolicy", "Vanliga frågor" på varje sida, kan boten svara med ett generiskt stycke från sidfoten istället för ett användbart telefonnummer eller e-postadress när en användare frågar "Hur kan jag kontakta er?"

Hög signalstyrka, lågt brus = bättre svar

Genom att bara skanna användbart innehåll hjälper du AI:n att hämta tydlig, specifik och högkvalitativ kontext för varje fråga. Fokusera på:

  • Produktbeskrivningar
  • FAQ-sidor
  • Supportartiklar
  • Policydokument
  • Viktiga landningssidor

Använd sitemap istället för fullständig webbplatsskanning

Rekommenderas: Använd alternativet sitemap (webbplatskarta) när det är möjligt.

En fullständig webbplatsskanning följer alla synliga länkar på sidan, inklusive länkar från sidfötter, menyer och sidofält, vilket ofta leder till att upprepat eller värdelöst innehåll skannas. Dessa avsnitt finns vanligtvis på varje sida och innehåller sällan unik information som är användbar för chattsvar.

Genom att använda en sitemap (vanligtvis placerad på https://din-doman.se/sitemap.xml) gör du följande:

  • Undviker att genomsöka onödiga sidor (t.ex. juridiska sidor, sociala länkar, upprepade bloggtaggar)
  • Kontrollerar exakt vilka URL:er som skannas
  • Förhindrar oavsiktlig överförbrukning av tecken från menyer, sidfötter och sidhuvuden

Översikt över avancerade inställningar

För att komma åt avancerade inställningar klickar du på Add New Training: Website (lägg till ny träning: webbplats) under fliken Training, och expanderar sedan sektionen Advanced settings. Inställningarna är indelade i fyra kategorier:

  • URL Filtering (URL-filtrering) - Kontrollera vilka URL:er som ska inkluderas eller exkluderas
  • Query Parameters (frågeparametrar) - Hantera URL-parametrar
  • Content Filtering (innehållsfiltrering) - Filtrera specifika sidelement
  • Scraping Behavior (skanningsbeteende) - Konfigurera hur innehåll extraheras

URL Filtering

Alternativ för URL-filtrering

Inkludera endast specifika URL:er

Fält: Advanced Settings > URL Filtering > Include only URLs that contain (inkludera endast URL:er som innehåller)

Lägg till nyckelord separerade med semikolon för att endast inkludera specifika URL:er i skanningen.

Exempel: För att endast skanna engelska hjälpsidor:

/en;/help

Detta skannar endast sidor som innehåller /en eller help i URL:en, vilket sparar tecken genom att hoppa över irrelevanta delar.

Exkludera irrelevanta URL:er

Fält: Advanced Settings > URL Filtering > Exclude URLs that contain (exkludera URL:er som innehåller)

Lägg till nyckelord separerade med semikolon för att hoppa över sektioner som bloggar, bilder eller nyheter.

Exempel:

/news;/pictures;/press

Detta förhindrar skanning av innehållstunga men för chatboten irrelevanta sektioner som nyheter eller bildgallerier.


Query Parameters

Alternativ för frågeparametrar

Ignorera alla frågeparametrar

Fält: Advanced Settings > Query Parameters > Ignore all query parameters (ignorera alla frågeparametrar)

Markera den här kryssrutan för att behandla URL:er med olika frågeparametrar som samma sida. Detta förhindrar skanning av duplicerat innehåll.

Ignorera specifika frågeparametrar

Fält: Advanced Settings > Query Parameters > Ignore specific query parameters (ignorera specifika frågeparametrar)

Lägg till parameternamn separerade med semikolon för att ignorera specifika spårnings- eller filtreringsparametrar.

Exempel:

ref;source;campaign;utm_source

Detta gör att page.html?ref=email och page.html?ref=social behandlas som samma URL.


Content Filtering

Alternativ för innehållsfiltrering

Inkludera specifika element

Fält: Advanced Settings > Content Filtering > Include element IDs (inkludera element-ID:n)

Lägg till elementidentifierare separerade med semikolon för att endast skanna specifika delar av sidan. Använd #id för element-ID:n, .klassnamn för klasser och hakparenteser för attribut: [data-id="82874db"] matchar element med exakt det attributvärdet, [data-content] matchar alla element som över huvud taget har attributet.

Exempel:

#main-content;.article-body;[data-section="product"]

Detta skannar endast huvudområdet, artikeltexter och produktsektioner, och ignorerar allt annat.

Följ endast länkar i inkluderade element

Fält: Advanced Settings > Content Filtering > Follow only links in included elements (följ endast länkar i inkluderade element)

Denna brytare visas när du anger Include element IDs. När den är aktiverad följer crawlerspindeln endast länkar som finns inom de inkluderade elementen. Detta är användbart när du vill begränsa genomsökningen till specifika delar av webbplatsen, som artikelområden, samtidigt som du ignorerar navigeringsmenyer i sidhuvuden eller sidfötter.

Standard: Inaktiverad (alla länkar på sidan följs)

Exkludera sidelement

Fält: Advanced Settings > Content Filtering > Exclude element IDs (exkludera element-ID:n)

Förhindra skanning av sidhuvuden, sidfötter och andra layoutelement. Samma väljarsyntax gäller: header och footer utan prefix, #id, .klassnamn, eller ett attribut inom hakparenteser som [data-id="82874db"] eller [data-nosnippet]. Attributväljare är praktiska när elementet du vill ta bort saknar ett stabilt id eller en stabil klass, men har ett data-*-attribut som du kan kopiera från webbläsarens utvecklarverktyg.

Exempel:

header;footer;#navigation;.sidebar;[data-nosnippet]

Detta tar bort HTML-block som upprepas på varje sida och som i allmänhet inte innehåller något användbart innehåll för din chatbot.

Följ länkar i exkluderade element

Fält: Advanced Settings > Content Filtering > Follow links in excluded elements (följ länkar i exkluderade element)

Denna brytare visas när du anger Exclude element IDs. När den är aktiverad följer crawlerspindeln fortfarande länkar som finns inom exkluderade element (som navigeringsmenyer i sidhuvuden), även om själva innehållet exkluderas från träningen.

Standard: Inaktiverad (länkar i exkluderade element följs inte)

Användningsområde: Aktivera detta när du vill exkludera innehåll i sidhuvud/sidfot från träningen men ändå behöver att genomsökaren upptäcker sidor via navigeringslänkar i dessa områden. Detta ger dig det bästa av två världar: ren träningsdata utan menybrus, samtidigt som hela din webbplats fortfarande genomsöks.

Viktigt: Om du använder fullständig webbplatsskanning och exkluderar element som sidhuvud utan att aktivera "Follow links in excluded elements", kan det hända att skannern inte hittar djupare länkar (menyer ligger ofta i sidhuvuden). Aktivera i så fall antingen brytaren eller använd en sitemap för den säkraste och mest effektiva metoden.


Scraping Behavior

Alternativ för skanningsbeteende

Skanna dokument

Fält: Advanced Settings > Scraping Behavior > Scrape documents (skanna dokument)

När detta är aktiverat extraherar och bearbetar systemet dokumentinnehåll som finns på webbplatsen. För närvarande stöds PDF-filer.

Exkludera bildlänkar

Fält: Advanced Settings > Scraping Behavior > Exclude image links (exkludera bildlänkar)

Aktivera denna brytare för att exkludera alla bildlänkar från träningsdatauppsättningen. Som standard extraherar systemet alla bildlänkar, vilket kan öka teckenantalet avsevärt.

Att aktivera det här alternativet kan minska din teckenförbrukning betydligt.

Skanna dolt innehåll

Fält: Advanced Settings > Scraping Behavior > Scrape hidden contents (skanna dolt innehåll)

När detta är aktiverat (standard) extraherar systemet innehåll från dolda HTML-element (element med display:none, visibility:hidden eller liknande CSS-egenskaper).

Standard: Aktiverad

När det bör inaktiveras: Inaktivera det här alternativet för att hoppa över dolt innehåll och endast skanna synliga element. Detta är användbart när webbplatser innehåller dolt innehåll som:

  • Hopfällbara dragspelssektioner (accordions)
  • Innehåll som endast visas på mobila enheter eller datorer
  • Dolda formulärfält
  • Utvecklarkommentarer eller felsökningsinformation

Att inaktivera detta kan minska teckenantalet och förhindra att irrelevant dolt innehåll hamnar i din träningsdata.

Fördröjning mellan sidor

Fält: Advanced Settings > Scraping Behavior > Delay between pages (fördröjning mellan sidor)

Lägg till en fördröjning (i sekunder) mellan skanningen av varje sida för att förhindra att din server överbelastas. Användbart för webbplatser med hastighetsbegränsningar (rate limiting).

Simulera besök från specifikt land

Fält: Advanced Settings > Scraping Behavior > Country code (landskod)

Om din webbplats visar olika innehåll beroende på besökarens plats, anger du en landskod med två bokstäver (t.ex. US, PL, SE) för att simulera skanning från den platsen.


Rekommenderad konfiguration för de flesta webbplatser

För de flesta webbplatser ger följande konfiguration den bästa balansen mellan heltäckande innehåll och minskat teckenantal:

  1. Använd sitemap när det finns tillgängligt för exakt URL-kontroll
  2. Exkludera element-ID:n: header;footer;#navigation;.sidebar
  3. Aktivera "Exclude image links" för att ta bort bild-URL:er från träningen
  4. Inaktivera "Scrape hidden contents" om din webbplats har många dolda element
  5. Överväg "Follow links in excluded elements" om du använder fullständig skanning med exkluderade sidhuvuden

Den här konfigurationen minskar vanligtvis teckenantalet med 20-40 % samtidigt som allt värdefullt innehåll behålls.


Sammanfattning: Bästa praxis

  • Använd sitemap istället för fullständig skanning för exakt kontroll
  • Inkludera URL:er för att rikta in dig enbart på värdefullt innehåll
  • Exkludera URL:er för att hoppa över irrelevanta eller tunga sidor
  • Ignorera frågeparametrar för att undvika duplicerat innehåll
  • Exkludera element-ID:n för att ta bort upprepade sidedelar som sidhuvuden och sidfötter
  • Styr länkföljning med "Follow only links in included elements" eller "Follow links in excluded elements" för detaljerad kontroll över genomsökningen
  • Exkludera bildlänkar för att minska teckenantalet avsevärt
  • Inaktivera skanning av dolt innehåll om din webbplats har onödiga dolda element
  • Fokusera på användbart innehåll för din bot (FAQ-sidor, produktsidor, supportartiklar)