Helpcentrum
Je chatbot trainen

Hoe je trainingskarakters vermindert bij het scannen van een website

Laatst bijgewerkt:

Wanneer je jouw chatbot traint op een website, helpt het beperken van de hoeveelheid gescande gegevens tot wat het meest nuttig is om het tekenverbruik te verminderen, de training te versnellen en de antwoordkwaliteit te verbeteren door je uitsluitend te richten op relevante inhoud.

Deze handleiding legt uit hoe je jouw scan kunt optimaliseren met behulp van de Advanced settings (Geavanceerde instellingen) in het trainingsvenster voor websites (Training > Links > Add New Training: Website).


Waarom minder training beter kan zijn

ChatLab maakt gebruik van de RAG-architectuur (Retrieval-Augmented Generation). In plaats van alle website-inhoud uit het hoofd te leren, zoekt de AI op het moment van elke gebruikersvraag naar de meest relevante stukjes informatie en gebruikt deze om een antwoord te genereren.

Het probleem met te veel gegevens

Meer gegevens betekenen niet altijd betere antwoorden. Het toevoegen van irrelevante of overbodige inhoud kan het ophaalproces verwarren:

  • RAG kent scores toe aan tekstfragmenten op basis van relevantie voor de vraag van de gebruiker. Als jouw site veel pagina's bevat met herhalende, vage of algemene tekst (menu's, footers, persberichten, blog-tagpagina's), verwateren deze de kwaliteit van de zoekresultaten.
  • Wanneer de chatbot meerdere fragmenten met een lage waarde ophaalt die wel trefwoorden delen maar nuttige context missen, kan hij onnauwkeurige, te algemene of irrelevante antwoorden genereren.
  • Bijvoorbeeld: Als jouw footer op elke pagina links bevat zoals "Home", "Contact", "Privacy", "FAQ", reageert de bot mogelijk met een algemene alinea uit de footer in plaats van een nuttig telefoonnummer of e-mailadres wanneer een gebruiker vraagt: "Hoe kan ik contact opnemen?"

Hoog signaal, weinig ruis = betere antwoorden

Door alleen nuttige inhoud te scannen, help je de AI om duidelijke, specifieke en hoogwaardige context op te halen voor elke vraag. Richt je op:

  • Productbeschrijvingen
  • FAQ-pagina's
  • Ondersteuningsartikelen
  • Beleidsdocumenten
  • Belangrijke landingspagina's

Gebruik een sitemap in plaats van een volledige websitescan

Aanbevolen: Gebruik waar mogelijk de optie sitemap.

Een volledige websitescan volgt alle zichtbare links op de pagina, inclusief links uit footers, menu's en sidebars, wat er vaak toe leidt dat herhalende of waardeloze inhoud wordt gescand. Deze onderdelen zijn meestal op elke pagina aanwezig en bevatten zelden unieke informatie die nuttig is voor antwoorden in de chat.

Door een sitemap te gebruiken (meestal te vinden op https://yourdomain.com/sitemap.xml):

  • Voorkom je dat onnodige pagina's worden gecrawld (bijv. juridische pagina's, socialemediakanalen, herhaalde blogtags)
  • Bepaal je precies welke URL's worden gescand
  • Voorkom je onbedoeld overmatig verbruik van tekens door menu's, footers en headers

Overzicht van Advanced settings

Om toegang te krijgen tot de geavanceerde instellingen, klik je op Add New Training: Website (Nieuwe training toevoegen: Website) op het tabblad Training en vouw je het gedeelte Advanced settings (Geavanceerde instellingen) uit. De instellingen zijn onderverdeeld in vier categorieën:

  • URL Filtering (URL-filtering) - Bepaal welke URL's moeten worden opgenomen of uitgesloten
  • Query Parameters (Queryparameters) - Beheer URL-parameters
  • Content Filtering (Inhoudsfiltering) - Filter specifieke pagina-elementen
  • Scraping Behavior (Scraping-gedrag) - Configureer hoe inhoud wordt geëxtraheerd

URL Filtering

URL Filtering options

Alleen specifieke URL's opnemen

Veld: Advanced Settings > URL Filtering > Include only URLs that contain (Alleen URL's opnemen die het volgende bevatten)

Voeg door puntkomma's gescheiden trefwoorden toe om alleen specifieke URL's in de scan op te nemen.

Voorbeeld: Om alleen Engelstalige helppagina's te scannen:

/en;/help

Dit scant alleen pagina's die /en of help in de URL bevatten, waardoor je tekens bespaart door irrelevante secties over te slaan.

Irrelevante URL's uitsluiten

Veld: Advanced Settings > URL Filtering > Exclude URLs that contain (URL's uitsluiten die het volgende bevatten)

Voeg door puntkomma's gescheiden trefwoorden toe om secties zoals blogs, afbeeldingen of nieuws over te slaan.

Voorbeeld:

/news;/pictures;/press

Dit voorkomt het scannen van secties die veel inhoud bevatten maar niet relevant zijn voor de chatbot, zoals nieuws of fotogalerijen.


Query Parameters

Query Parameters options

Alle queryparameters negeren

Veld: Advanced Settings > Query Parameters > Ignore all query parameters (Alle queryparameters negeren)

Schakel dit selectievakje in om URL's met verschillende queryparameters als dezelfde pagina te behandelen. Dit voorkomt het scannen van dubbele inhoud.

Specifieke queryparameters negeren

Veld: Advanced Settings > Query Parameters > Ignore specific query parameters (Specifieke queryparameters negeren)

Voeg door puntkomma's gescheiden parameternamen toe om specifieke tracking- of filterparameters te negeren.

Voorbeeld:

ref;source;campaign;utm_source

Hierdoor worden page.html?ref=email en page.html?ref=social als dezelfde URL behandeld.


Content Filtering

Content Filtering options

Specifieke elementen opnemen

Veld: Advanced Settings > Content Filtering > Include element IDs (Element-ID's opnemen)

Voeg door puntkomma's gescheiden element-identifiers toe om alleen specifieke delen van de pagina te scannen. Gebruik #id voor element-ID's, .classname voor classes en vierkante haken voor attributen: [data-id="82874db"] matcht elementen met exact die attribuutwaarde, [data-content] matcht elk element dat het attribuut überhaupt bevat.

Voorbeeld:

#main-content;.article-body;[data-section="product"]

Dit scant alleen het hoofdgedeelte van de inhoud, artikelteksten en productsecties, en negeert al het andere.

Alleen links in opgenomen elementen volgen

Veld: Advanced Settings > Content Filtering > Follow only links in included elements (Alleen links in opgenomen elementen volgen)

Deze schakelaar verschijnt wanneer je Include element IDs opgeeft. Wanneer ingeschakeld, volgt de crawler alleen links die binnen de opgenomen elementen worden gevonden. Dit is handig wanneer je het crawlen wilt beperken tot specifieke secties van de website, zoals artikelteksten, terwijl je navigatiemenu's in headers of footers negeert.

Standaard: Uitgeschakeld (alle links op de pagina worden gevolgd)

Pagina-elementen uitsluiten

Veld: Advanced Settings > Content Filtering > Exclude element IDs (Element-ID's uitsluiten)

Voorkom het scannen van headers, footers en andere lay-outelementen. Dezelfde selectorsyntaxis is van toepassing: header en footer zonder voorvoegsel, #id, .classname of een attribuut tussen vierkante haken zoals [data-id="82874db"] of [data-nosnippet]. Attribuutselectors zijn handig wanneer het element dat je wilt weglaten geen stabiele id of class heeft, maar wel een data-*-attribuut bevat dat je vanuit de ontwikkelaarstools van de browser kunt kopiëren.

Voorbeeld:

header;footer;#navigation;.sidebar;[data-nosnippet]

Dit verwijdert HTML-blokken die op elke pagina worden herhaald en over het algemeen geen nuttige inhoud voor jouw chatbot bevatten.

Links in uitgesloten elementen volgen

Veld: Advanced Settings > Content Filtering > Follow links in excluded elements (Links in uitgesloten elementen volgen)

Deze schakelaar verschijnt wanneer je Exclude element IDs opgeeft. Wanneer ingeschakeld, volgt de crawler nog steeds links die binnen uitgesloten elementen worden gevonden (zoals navigatiemenu's in headers), ook al is de inhoud zelf uitgesloten van training.

Standaard: Uitgeschakeld (links in uitgesloten elementen worden niet gevolgd)

Toepassing: Schakel dit in wanneer je header- of footer-inhoud wilt uitsluiten van training, maar de crawler toch pagina's moet laten ontdekken via navigatielinks in die gebieden. Dit geeft je het beste van twee werelden: schone trainingsgegevens zonder menuruiss, terwijl toch jouw hele site wordt gecrawld.

Belangrijk: Als je een volledige websitescan gebruikt en elementen zoals de header uitsluit zonder "Follow links in excluded elements" in te schakelen, ontdekt de scanner mogelijk geen dieper liggende links (menu's bevinden zich vaak in headers). Schakel in dat geval de schakelaar in of gebruik een sitemap voor de veiligste en meest efficiënte methode.


Scraping Behavior

Scraping Behavior options

Documenten scrapen

Veld: Advanced Settings > Scraping Behavior > Scrape documents (Documenten scrapen)

Wanneer ingeschakeld, extraheert en verwerkt het systeem documentinhoud die op de website wordt gevonden. Ondersteunt momenteel PDF-bestanden.

Afbeeldingslinks uitsluiten

Veld: Advanced Settings > Scraping Behavior > Exclude image links (Afbeeldingslinks uitsluiten)

Zet deze schakelaar aan om alle afbeeldingslinks uit de trainingsgegevens uit te sluiten. Standaard extraheert het systeem alle afbeeldingslinks, wat het aantal tekens aanzienlijk kan verhogen.

Het inschakelen van deze optie kan jouw aantal tekens aanzienlijk verminderen.

Verborgen inhoud scrapen

Veld: Advanced Settings > Scraping Behavior > Scrape hidden contents (Verborgen inhoud scrapen)

Wanneer ingeschakeld (standaard), extraheert het systeem inhoud uit verborgen HTML-elementen (elementen met display:none, visibility:hidden of vergelijkbare CSS-eigenschappen).

Standaard: Ingeschakeld

Wanneer uitschakelen: Schakel deze optie uit om verborgen inhoud over te slaan en alleen zichtbare elementen te scrapen. Dit is handig wanneer websites verborgen inhoud bevatten zoals:

  • Ingeklapte accordeonsecties
  • Inhoud die alleen voor mobiel of alleen voor desktop is bedoeld
  • Verborgen formuliervelden
  • Opmerkingen van ontwikkelaars of debuginformatie

Het uitschakelen hiervan kan het aantal tekens verminderen en voorkomen dat irrelevante verborgen inhoud in jouw trainingsgegevens terechtkomt.

Vertraging tussen pagina's

Veld: Advanced Settings > Scraping Behavior > Delay between pages (Vertraging tussen pagina's)

Voeg een vertraging (in seconden) toe tussen het scannen van elke pagina om overbelasting van jouw server te voorkomen. Handig voor websites met snelheidslimieten (rate limiting).

Bezoek vanuit een specifiek land simuleren

Veld: Advanced Settings > Scraping Behavior > Country code (Landcode)

Als jouw site verschillende inhoud toont afhankelijk van de locatie van de bezoeker, voer dan een tweeletterige landcode in (bijv. US, PL, DE) om het scannen vanaf die locatie te simuleren.


Aanbevolen configuratie voor de meeste websites

Voor de meeste websites biedt de volgende configuratie de beste balans tussen uitgebreide inhoud en een lager aantal tekens:

  1. Gebruik een sitemap indien beschikbaar voor nauwkeurige URL-controle
  2. Exclude element IDs: header;footer;#navigation;.sidebar
  3. Schakel "Exclude image links" in om afbeeldings-URL's uit de training te verwijderen
  4. Schakel "Scrape hidden contents" uit als jouw site veel verborgen elementen bevat
  5. Overweeg "Follow links in excluded elements" als je een volledige scan gebruikt met uitgesloten headers

Deze configuratie verlaagt het aantal tekens doorgaans met 20-40%, terwijl alle waardevolle inhoud behouden blijft.


Samenvatting: best practices

  • Gebruik een sitemap in plaats van een volledige scan voor nauwkeurige controle
  • Voeg URL's toe (Include URLs) om je alleen op waardevolle inhoud te richten
  • Sluit URL's uit (Exclude URLs) om irrelevante of zware pagina's over te slaan
  • Negeer queryparameters om dubbele inhoud te voorkomen
  • Sluit element-ID's uit om herhaalde pagina-onderdelen zoals headers en footers te verwijderen
  • Beheer het volgen van links met "Follow only links in included elements" of "Follow links in excluded elements" voor fijnmazige controle over het crawlen
  • Sluit afbeeldingslinks uit om het aantal tekens aanzienlijk te verminderen
  • Schakel het scrapen van verborgen inhoud uit als jouw site onnodige verborgen elementen bevat
  • Richt je op nuttige inhoud voor jouw bot (FAQ's, productpagina's, ondersteuningsartikelen)