Hjælpecenter
Træning af din chatbot

Sådan reducerer du træningstegn, når du scanner et website

Sidst opdateret:

Når du træner din chatbot på en hjemmeside, hjælper det at begrænse mængden af scannede data til det mest nyttige. Det reducerer tegnforbruget, gør træningen hurtigere og forbedrer svarkvaliteten ved kun at fokusere på relevant indhold.

Denne guide forklarer, hvordan du optimerer din scanning ved hjælp af Advanced settings (avancerede indstillinger) i vinduet til hjemmesidetræning (Training > Links > Add New Training: Website).


Hvorfor mindre træning kan være bedre

ChatLab bruger en RAG-arkitektur (Retrieval-Augmented Generation). I stedet for at lære alt hjemmesideindhold udenad søger AI'en efter de mest relevante bidder af information på tidspunktet for hvert brugerspørgsmål og bruger dem til at generere et svar.

Problemet med for mange data

Flere data betyder ikke altid bedre svar. Tilføjelse af irrelevant eller overflødigt indhold kan forvirre søgeprocessen:

  • RAG vurderer tekststykker for relevans i forhold til brugerens spørgsmål. Hvis din side indeholder mange undersider med gentaget, vag eller generisk tekst (menuer, sidefødder, pressemeddelelser, tagsider på blogs), udvander det kvaliteten af søgeresultaterne.
  • Når chatbotten henter flere tekststykker af lav værdi, som deler nøgleord, men mangler brugbar kontekst, kan den generere upræcise, alt for generelle eller irrelevante svar.
  • For eksempel: Hvis din sidefod indeholder links som "Forside", "Kontakt", "Privatlivspolitik", "FAQ" på hver eneste side, svarer botten måske med et generisk afsnit fra sidefoden i stedet for et nyttigt telefonnummer eller en e-mail, når en bruger spørger: "Hvordan kan jeg kontakte jer?"

Højt signal, lav støj = bedre svar

Ved kun at scanne nyttigt indhold hjælper du AI'en med at finde en klar, specifik kontekst af høj kvalitet til hvert spørgsmål. Fokuser på:

  • Produktbeskrivelser
  • FAQ-sider
  • Supportartikler
  • Politikdokumenter
  • Vigtige landingssider

Brug sitemap i stedet for fuld scanning af hjemmesiden

Anbefalet: Brug indstillingen sitemap så vidt muligt.

En fuld scanning af hjemmesiden følger alle synlige links på siden, herunder links fra sidefødder, menuer og sidepaneler, hvilket ofte fører til scanning af gentaget eller værdiløst indhold. Disse sektioner findes typisk på hver side og indeholder sjældent unik information, der er nyttig til chatsvar.

Ved at bruge et sitemap (som regel placeret på https://yourdomain.com/sitemap.xml) opnår du følgende:

  • Undgå scanning af unødvendige sider (f.eks. juridiske sider, links til sociale medier, gentagne blogtags)
  • Styr præcis, hvilke URL'er der scannes
  • Undgå utilsigtet overforbrug af tegn fra menuer, sidefødder og sidehoveder

Oversigt over avancerede indstillinger

For at få adgang til avancerede indstillinger skal du klikke på Add New Training: Website (tilføj ny træning: hjemmeside) under fanen Training (træning) og derefter folde sektionen Advanced settings ud. Indstillingerne er opdelt i fire kategorier:

  • URL Filtering (URL-filtrering) - Styr, hvilke URL'er der skal inkluderes eller ekskluderes
  • Query Parameters (forespørgselsparametre) - Håndter URL-parametre
  • Content Filtering (indholdsfiltrering) - Filtrer specifikke sideelementer
  • Scraping Behavior (scraping-adfærd) - Konfigurer, hvordan indhold udtrækkes

URL-filtrering

Valgmuligheder for URL-filtrering

Inkluder kun specifikke URL'er

Felt: Advanced Settings > URL Filtering > Include only URLs that contain

Tilføj semikolonseparerede nøgleord for kun at inkludere specifikke URL'er i scanningen.

Eksempel: For kun at scanne engelske hjælpesider:

/en;/help

Dette scanner kun sider, der indeholder /en eller help i URL'en, hvilket sparer tegn ved at springe irrelevante sektioner over.

Ekskluder irrelevante URL'er

Felt: Advanced Settings > URL Filtering > Exclude URLs that contain

Tilføj semikolonseparerede nøgleord for at springe sektioner som blogs, billeder eller nyheder over.

Eksempel:

/news;/pictures;/press

Dette forhindrer scanning af indholdstunge, men for chatbotten irrelevante sektioner såsom nyheder eller billedgallerier.


Forespørgselsparametre

Valgmuligheder for forespørgselsparametre

Ignorer alle forespørgselsparametre

Felt: Advanced Settings > Query Parameters > Ignore all query parameters

Marker dette afkrydsningsfelt for at behandle URL'er med forskellige forespørgselsparametre som den samme side. Dette forhindrer scanning af duplikeret indhold.

Ignorer specifikke forespørgselsparametre

Felt: Advanced Settings > Query Parameters > Ignore specific query parameters

Tilføj semikolonseparerede parameternavne for at ignorere specifikke sporings- eller filtreringsparametre.

Eksempel:

ref;source;campaign;utm_source

Dette behandler page.html?ref=email og page.html?ref=social som den samme URL.


Indholdsfiltrering

Valgmuligheder for indholdsfiltrering

Inkluder specifikke elementer

Felt: Advanced Settings > Content Filtering > Include element IDs

Tilføj semikolonseparerede elementidentifikatorer for kun at scanne specifikke dele af siden. Brug #id for element-id'er, .klassenavn for klasser og kantede parenteser for attributter: [data-id="82874db"] matcher elementer med præcis den attributværdi, mens [data-content] matcher ethvert element, der overhovedet har attributten.

Eksempel:

#main-content;.article-body;[data-section="product"]

Dette scanner kun det primære indholdsområde, artikeltekster og produktsektioner og ignorerer alt andet.

Følg kun links i inkluderede elementer

Felt: Advanced Settings > Content Filtering > Follow only links in included elements

Denne indstilling vises, når du angiver Include element IDs. Når den er aktiveret, følger crawleren kun links, der findes inden for de inkluderede elementer. Dette er nyttigt, når du vil begrænse crawling til specifikke sektioner af hjemmesiden, f.eks. artikelområder, mens navigationsmenuer i sidehoveder eller sidefødder ignoreres.

Standard: Deaktiveret (alle links på siden følges)

Ekskluder sideelementer

Felt: Advanced Settings > Content Filtering > Exclude element IDs

Undgå scanning af sidehoveder, sidefødder og andre layoutelementer. Den samme selektorsyntaks gælder: header og footer uden præfiks, #id, .klassenavn eller en attribut i kantede parenteser som f.eks. [data-id="82874db"] eller [data-nosnippet]. Attributselektorer er praktiske, når det element, du vil udelukke, ikke har et stabilt id eller en klasse, men indeholder en data-*-attribut, som du kan kopiere fra browserens udviklerværktøjer.

Eksempel:

header;footer;#navigation;.sidebar;[data-nosnippet]

Dette fjerner HTML-blokke, der gentages på hver side, og som generelt ikke indeholder brugbart indhold for din chatbot.

Følg links i ekskluderede elementer

Felt: Advanced Settings > Content Filtering > Follow links in excluded elements

Denne indstilling vises, når du angiver Exclude element IDs. Når den er aktiveret, følger crawleren stadig links, der findes i ekskluderede elementer (som f.eks. navigationsmenuer i sidehoveder), selvom selve indholdet er udelukket fra træningen.

Standard: Deaktiveret (links i ekskluderede elementer følges ikke)

Brugsscenarie: Aktivér denne, når du vil udelukke indhold fra sidehoved/sidefod fra træningen, men stadig har brug for, at crawleren finder sider via navigationslinks i disse områder. Dette giver dig det bedste fra begge verdener: rene træningsdata uden forstyrrende menuer, samtidig med at hele din side gennemgås.

Vigtigt: Hvis du bruger en fuld scanning af hjemmesiden og ekskluderer elementer som header uden at aktivere "Follow links in excluded elements", finder scanneren muligvis ikke dybere links (menuer ligger ofte inde i sidehoveder). I så fald bør du enten aktivere indstillingen eller bruge et sitemap, hvilket er den sikreste og mest effektive metode.


Scraping-adfærd

Valgmuligheder for scraping-adfærd

Scrape dokumenter

Felt: Advanced Settings > Scraping Behavior > Scrape documents

Når denne indstilling er aktiveret, udtrækker og behandler systemet dokumentindhold, der findes på hjemmesiden. Understøtter i øjeblikket PDF-filer.

Ekskluder billedlinks

Felt: Advanced Settings > Scraping Behavior > Exclude image links

Aktivér denne funktion for at udelukke alle billedlinks fra træningsdatasættet. Som standard udtrækker systemet alle billedlinks, hvilket kan øge tegnforbruget markant.

Aktivering af denne indstilling kan reducere dit tegnforbrug væsentligt.

Scrape skjult indhold

Felt: Advanced Settings > Scraping Behavior > Scrape hidden contents

Når denne indstilling er aktiveret (standard), udtrækker systemet indhold fra skjulte HTML-elementer (elementer med display:none, visibility:hidden eller lignende CSS-egenskaber).

Standard: Aktiveret

Hvornår skal den deaktiveres: Deaktivér denne funktion for at springe skjult indhold over og kun scrape synlige elementer. Dette er nyttigt, når hjemmesider indeholder skjult indhold såsom:

  • Sammenfoldede harmonikasektioner
  • Indhold, der kun vises på mobil eller computer
  • Skjulte formularfelter
  • Udviklerkommentarer eller fejlfindingsoplysninger

Deaktivering af dette kan reducere tegnforbruget og forhindre, at irrelevant skjult indhold kommer med i dine træningsdata.

Forsinkelse mellem sider

Felt: Advanced Settings > Scraping Behavior > Delay between pages

Tilføj en forsinkelse (i sekunder) mellem scanningen af hver side for at forhindre overbelastning af din server. Nyttigt for hjemmesider med hastighedsbegrænsning (rate limiting).

Simuler besøg fra et specifikt land

Felt: Advanced Settings > Scraping Behavior > Country code

Hvis din hjemmeside viser forskelligt indhold afhængigt af den besøgendes placering, kan du indtaste en landekode på 2 bogstaver (f.eks. US, PL, DE) for at simulere scanning fra denne placering.


Anbefalet konfiguration for de fleste hjemmesider

For de fleste hjemmesider giver følgende konfiguration den bedste balance mellem omfattende indhold og reduceret tegnforbrug:

  1. Brug sitemap, når det er tilgængeligt, for præcis kontrol over URL'er
  2. Exclude element IDs: header;footer;#navigation;.sidebar
  3. Aktivér "Exclude image links" for at fjerne billed-URL'er fra træningen
  4. Deaktivér "Scrape hidden contents", hvis din side indeholder mange skjulte elementer
  5. Overvej "Follow links in excluded elements", hvis du bruger en fuld scanning med ekskluderede sidehoveder

Denne konfiguration reducerer typisk tegnforbruget med 20-40 %, samtidig med at alt værdifuldt indhold bevares.


Opsummering: Bedste praksis

  • Brug sitemap i stedet for fuld scanning for præcis kontrol
  • Inkluder URL'er for kun at målrette værdifuldt indhold
  • Ekskluder URL'er for at springe irrelevante eller tunge sider over
  • Ignorer forespørgselsparametre for at undgå duplikeret indhold
  • Ekskluder element-id'er for at fjerne gentagne sidedele som sidehoveder og sidefødder
  • Styr linkfølgning med "Follow only links in included elements" eller "Follow links in excluded elements" for præcis kontrol over crawling
  • Ekskluder billedlinks for at reducere tegnforbruget markant
  • Deaktivér scraping af skjult indhold, hvis din side har unødvendige skjulte elementer
  • Fokuser på nyttigt indhold til din bot (FAQ-sider, produktsider, supportartikler)