Door websitebronnen toe te voegen, kan je chatbot rechtstreeks leren van de inhoud van je website. Of het nu gaat om productdetails, veelgestelde vragen of blogberichten: het scannen van je website zorgt ervoor dat de chatbot nauwkeurige en actuele antwoorden kan geven op basis van je daadwerkelijke website-inhoud.
Waar vind je websitetraining?
Selecteer je chatbot en ga vervolgens naar het tabblad Training (Training). Kies in de linkerzijbalk voor Links (Links). Hier beheer je alle trainingsbronnen op basis van websites.
Klik op Add New Training: Website (Nieuwe training toevoegen: Website) om het trainingsformulier te openen.
Scanopties
Het trainingsformulier biedt je twee manieren om website-inhoud toe te voegen, gescheiden door een OR-scheidingsteken (OF).
Scan website contents (Website-inhoud scannen) - Voer een URL in het veld Address (Adres) in en kies tussen:
- Whole website (Hele website) - Doorzoekt alle vindbare pagina's vanaf de URL die je opgeeft
- Single address (Enkel adres) - Scant alleen de specifieke pagina die je invoert
Use sitemap (Sitemap gebruiken) - Voer de URL van je sitemap (bijv. https://www.yourdomain.com/sitemap.xml) in het veld Sitemap (Sitemap) in. Hiermee worden alleen de pagina's gescand die in je sitemapbestand worden vermeld.
Wanneer je een sitemap gebruikt, wordt het veld Address automatisch uitgeschakeld (en vice versa), aangezien je slechts één methode per trainingstaak kunt gebruiken.
Trainen op de hele website
- Voer de hoofd-URL van je website in het veld Address in (bijv.
https://www.yourdomain.com) - Selecteer Whole website in het dropdownmenu onder het adresveld
- Klik op Start scanning the website (Starten met scannen van website)
Het systeem doorzoekt je website en volgt links om alle pagina's te ontdekken. Je kunt de voortgang volgen op het tabblad Trainings (Trainingen), waar je in realtime ziet hoeveel links zijn gescand en hoeveel trainingstekens zijn verzameld.
Trainen op één pagina
- Voer de specifieke pagina-URL in het veld Address in (bijv.
https://www.yourdomain.com/pricing) - Selecteer Single address in het dropdownmenu
- Klik op Start scanning the website
Dit is handig wanneer je slechts één specifieke pagina hoeft toe te voegen aan de kennisbank van je chatbot, bijvoorbeeld een pas gepubliceerd artikel of een bijgewerkte FAQ-pagina.
Trainen op basis van een sitemap
- Voer de URL van je sitemap in het veld Sitemap in (bijv.
https://www.yourdomain.com/sitemap.xml) - Klik op Start scanning the website
Het scannen van een sitemap geeft je nauwkeurige controle over welke pagina's worden meegenomen, omdat alleen URL's worden verwerkt die in je sitemapbestand staan.
Afzonderlijke pagina's selecteren voor training
Voordat je een scan start, kun je de schakelaar I want to select individual urls for training after scanning the website (Ik wil na het scannen van de website afzonderlijke URL's selecteren voor de training) inschakelen. Deze optie is alleen beschikbaar bij het scannen van een hele website (niet voor de modus voor een enkel adres).
Wanneer deze is ingeschakeld:
- Scant het systeem je website en ontdekt het alle pagina's
- Zie je na afloop van de scan een boomstructuur van alle ontdekte pagina's met het aantal tekens
- Vink je pagina's aan of uit om ze op te nemen in of uit te sluiten van de training
- Klik op Start the Training (Training starten) om de training te beginnen op basis van de door jou geselecteerde pagina's
Dit is nuttig wanneer je website pagina's bevat waarvan je niet wilt dat de chatbot leert, zoals inlogpagina's, beheeromgevingen of niet-relevante onderdelen.
Websites talen scannen
Als je website in meerdere talen is gepubliceerd, detecteert ChatLab tijdens het scannen de beschikbare talen en kun je bepalen welke talen in de kennisbank van je chatbot worden opgenomen. Je vindt deze opties in het gedeelte Languages (Talen) van het trainingsformulier, net boven Advanced settings (Geavanceerde instellingen).
Taalbereik
Het dropdownmenu Language scope (Taalbereik) bepaalt welk deel van een meertalige website wordt gescand:
- Main website language (recommended) (Hoofdtaal van de website (aanbevolen)) - de standaardoptie. Alleen de hoofdtaal van de site wordt gescand. Andere taalversies worden overgeslagen. Dit houdt je trainingsgegevens overzichtelijk en gericht, en verbruikt minder van je trainingscapaciteit.
- All languages (Alle talen) - scant elke taalversie van de site. Hiermee worden al je gelokaliseerde pagina's verzameld, maar er wordt meer inhoud opgehaald en meer trainingscapaciteit gebruikt.
- Selected language (Geselecteerde taal) - scant één taal die je kiest uit de op de site gedetecteerde talen.
ChatLab detecteert automatisch de hoofdtaal van je website en gebruikt deze als standaard. Wanneer je Selected language kiest, wordt de gedetecteerde hoofdtaal vooraf voor je geselecteerd en in de lijst gemarkeerd als "main". Je kunt dit wijzigen naar elke andere gedetecteerde taal.
Taaldetectie is beschikbaar op elk abonnement, inclusief het gratis plan. Op het gratis plan wordt de paginataal nog steeds gedetecteerd en wordt alleen de hoofdtaal gescand, tenzij je het bereik wijzigt naar All languages.
Taaldetectiemethode
Wanneer het bereik is ingesteld op Main website language of Selected language, kun je via het dropdownmenu Language detection method (Taaldetectiemethode) kiezen hoe ChatLab de taalversies op je site herkent:
- Hreflang attributes (recommended) (Hreflang-attributen (aanbevolen)) - de standaardoptie. Maakt gebruik van de
hreflang- enlang-opmaak die de meeste meertalige sites al bieden om hun verschillende taalversies aan elkaar te koppelen. - URL path prefix (/en/, /de/, ...) (URL-padvoorvoegsel (/en/, /de/, ...)) - voor websites die elke taal onder een padsegment zoals
/en/,/de/of/fr/plaatsen zonderhreflang-opmaak.
Als ChatLab talen niet automatisch kan detecteren, kun je nog steeds de hoofdtaal of alle talen scannen. Wanneer je Selected language kiest, vul dan eerst je websiteadres in de bovenstaande velden in en kies de optie vervolgens opnieuw, zodat de site kan worden geanalyseerd.
Voor een overzicht van hoe je chatbot deze taalversies vervolgens gebruikt bij het beantwoorden, raadpleeg je Multilingual chatbots en Chatbot language setup. De daar beschreven taalmodi voor de kennisbank zijn afhankelijk van bronnen die met taaldetectie zijn gescand, waardoor oudere bronnen mogelijk opnieuw moeten worden getraind om er optimaal gebruik van te maken.
Geavanceerde instellingen
Klik op de knop Advanced settings in het trainingsformulier om toegang te krijgen tot gedetailleerde scaninstellingen.
De geavanceerde instellingen zijn onderverdeeld in vier secties:
URL Filtering (URL-filtering)
- Include only URLs that contain (Alleen URL's opnemen die het volgende bevatten) - Scan alleen URL's die overeenkomen met deze patronen (gescheiden door puntkomma's, bijv.
/en;/help) - Exclude URLs that contain (URL's uitsluiten die het volgende bevatten) - Sla URL's over die overeenkomen met deze patronen (bijv.
/news;/pictures). Gangbare patronen zoals/wp-admin/,/feed/en winkelwagenpagina's worden standaard uitgesloten
Query Parameters (Queryparameters)
- Ignore all query parameters (Alle queryparameters negeren) - Behandel URL's met verschillende queryparameters als dezelfde pagina (bijv.
/page?id=1en/page?id=2worden beide/page) - Ignore specific query parameters (Specifieke queryparameters negeren) - Negeer alleen bepaalde parameters (gangbare trackingparameters zoals
utm_source,fbclid,gclidworden automatisch genegeerd)
Content Filtering (Inhoudsfiltering)
- Include element IDs (Element-ID's opnemen) - Extraheer alleen inhoud uit specifieke HTML-elementen (gebruik
#idvoor ID's,.classnamevoor klassen,[data-id="82874db"]voor elementen met een bepaald attribuut, gescheiden door puntkomma's) - Exclude element IDs (Element-ID's uitsluiten) - Sla inhoud van specifieke HTML-elementen over (bijv.
footer;header;#navigation;[data-nosnippet]) - Er verschijnen voorwaardelijke schakelaars wanneer in te sluiten/uit te sluiten elementen zijn ingesteld, zodat je kunt bepalen of de crawler links volgt die binnen die elementen worden gevonden
Scraping Behavior (Scrapegedrag)
- Scrape documents (Documenten scrapen) - Extraheer ook inhoud uit PDF-bestanden die op de website worden gevonden
- Exclude image links (Afbeeldingslinks uitsluiten) - Sla afbeeldings-URL's over uit de trainingsgegevensset
- Scrape hidden contents (Verborgen inhoud scrapen) - Neem inhoud van verborgen HTML-elementen op (standaard ingeschakeld)
- Delay between pages (Vertraging tussen pagina's) - Voeg een vertraging in seconden toe tussen paginaverzoeken om de belasting van de server te verlagen
- Country code (Landcode) - Leid het scrapen via een proxyserver in een specifiek land (tweeletterige code, bijv.
us)
E-mailmeldingen
De schakelaar Email me when training is finished or needs my attention (Stuur mij een e-mail wanneer de training is voltooid of aandacht vereist) is standaard ingeschakeld. Wanneer deze actief is, ontvang je een e-mailmelding wanneer:
- De training met succes is voltooid
- Het systeem je input nodig heeft (bijv. het selecteren van pagina's na een scan)
- Er zich problemen voordoen tijdens de training
Je kunt het e-mailadres voor meldingen wijzigen in het veld naast de schakelaar.
De voortgang van de training volgen
Schakel na het starten van een scan over naar het tabblad Trainings om de voortgang te volgen. Elke trainingstaak toont:
- De bron-URL
- De huidige status (Scanning links, Awaiting links selection, Training, Training completed)
- Een voortgangsbalk tijdens het actief scannen of trainen
- De datum van de laatste update
Klik op More details (Meer details) om alle parameters te bekijken die voor een specifieke trainingstaak zijn gebruikt, inclusief eventuele geavanceerde instellingen die zijn geconfigureerd.
Getrainde links beheren
Nadat de training is voltooid, verschijnen alle gescande pagina's op het tabblad Links. Elke link toont:
- Paginatitel en URL
- Aantal tekens (grootte van de trainingsgegevens)
- Trainingsstatus
- Datum van laatste update
Voor elke link kun je:
- Retrain (Opnieuw trainen) - De inhoud voor deze specifieke pagina opnieuw scannen en bijwerken
- View (Bekijken) - De exacte inhoud bekijken die van de pagina is geëxtraheerd
- Delete (Verwijderen) - Deze pagina verwijderen uit de kennisbank van je chatbot
Gebruik het selectievakje Select all (Alles selecteren) en de knoppen voor bulkacties om meerdere links tegelijk opnieuw te trainen of te verwijderen.
Gescande inhoud bekijken
Klik op de knop View naast een getrainde link om precies te zien welke inhoud van die pagina is geëxtraheerd.
Het modale venster voor bronweergave toont de paginatitel, URL, het aantal tekens, de datum van de laatste update en de volledige tekstinhoud waarop je chatbot is getraind. Dit helpt je te verifiëren of de juiste inhoud is verzameld en inzicht te krijgen in de kennisbank van je chatbot.
Gerelateerde artikelen
- Training in background - Lees hoe trainen op de achtergrond werkt
- Re-training your chatbot - Je chatbot bijwerken met nieuwe inhoud
- How to reduce training characters when scanning a website - Tips voor het optimaliseren van de omvang van je trainingsgegevens
- Training your chatbot: basics and limits - Inzicht in limieten voor trainingsgegevens