L'aggiunta di fonti da siti web permette al tuo chatbot di imparare direttamente dai contenuti del tuo sito. Che si tratti di dettagli sui prodotti, FAQ o articoli del blog, la scansione del sito assicura che il chatbot possa fornire risposte precise e aggiornate in base ai contenuti effettivi del sito.
Dove trovare il training da sito web
Seleziona il tuo chatbot, quindi passa alla scheda Training (Addestramento). Nella barra laterale sinistra, scegli Links (Link). Qui puoi gestire tutte le fonti di training basate su siti web.
Fai clic su Add New Training: Website (Aggiungi nuovo addestramento: Sito web) per aprire il modulo di addestramento.
Opzioni di scansione
Il modulo di training offre due modalità per aggiungere contenuti dal sito web, separate dal divisore OR (O).
Scan website contents (Scansiona i contenuti del sito web) - Inserisci un URL nel campo Address (Indirizzo) e scegli tra:
- Whole website (Intero sito web) - Esegue la scansione di tutte le pagine rilevabili a partire dall'URL fornito
- Single address (Singolo indirizzo) - Scansiona solo la pagina specifica inserita
Use sitemap (Usa sitemap) - Inserisci l'URL della tua sitemap (es. https://www.yourdomain.com/sitemap.xml) nel campo Sitemap. In questo modo verranno scansionate solo le pagine elencate nel file della sitemap.
Quando usi una sitemap, il campo Address viene disabilitato automaticamente (e viceversa), poiché puoi utilizzare solo un metodo per ciascuna sessione di training.
Eseguire il training sull'intero sito web
- Inserisci l'URL principale del tuo sito nel campo Address (es.
https://www.yourdomain.com) - Seleziona Whole website dal menu a discesa sotto il campo dell'indirizzo
- Fai clic su Start scanning the website (Avvia scansione del sito web)
Il sistema eseguirà la scansione del sito seguendo i link per individuare tutte le pagine. Puoi monitorare l'avanzamento nella scheda Trainings (Sessioni di addestramento), dove vedrai in tempo reale il numero di link scansionati e i caratteri di training raccolti.
Eseguire il training su una singola pagina
- Inserisci l'URL della pagina specifica nel campo Address (es.
https://www.yourdomain.com/pricing) - Seleziona Single address dal menu a discesa
- Fai clic su Start scanning the website
Questa opzione è utile quando devi aggiungere solo una pagina specifica alla knowledge base del chatbot, ad esempio un articolo appena pubblicato o una pagina FAQ aggiornata.
Eseguire il training da sitemap
- Inserisci l'URL della sitemap nel campo Sitemap (es.
https://www.yourdomain.com/sitemap.xml) - Fai clic su Start scanning the website
La scansione tramite sitemap offre un controllo preciso sulle pagine da includere, poiché elabora solo gli URL presenti nel file della sitemap.
Selezionare singole pagine per il training
Prima di avviare una scansione, puoi attivare l'opzione I want to select individual urls for training after scanning the website (Desidero selezionare singoli URL per il training dopo la scansione del sito web). Questa opzione è disponibile solo durante la scansione di un intero sito web (non per la modalità a singolo indirizzo).
Quando è abilitata:
- Il sistema scansiona il sito web e rileva tutte le pagine
- Al termine della scansione, visualizzerai una struttura ad albero di tutte le pagine rilevate con il relativo conteggio dei caratteri
- Seleziona o deseleziona le pagine per includerle o escluderle dal training
- Fai clic su Start the Training (Avvia il training) per avviare il training sulle pagine selezionate
Questa funzione è utile se il sito web contiene pagine da cui non vuoi che il chatbot impari, come pagine di accesso, aree amministrative o sezioni non pertinenti.
Scansione delle lingue del sito web
Se il tuo sito web è pubblicato in più di una lingua, ChatLab rileva le lingue disponibili durante la scansione e ti consente di decidere quali includere nella knowledge base del chatbot. Trovi questi controlli nella sezione Languages (Lingue) del modulo di training, subito sopra ad Advanced settings (Impostazioni avanzate).
Ambito linguistico (Language scope)
Il menu a discesa Language scope controlla quale porzione di un sito multilingue viene scansionata:
- Main website language (recommended) (Lingua principale del sito web (consigliata)) - impostazione predefinita. Viene scansionata solo la lingua principale del sito. Le altre versioni linguistiche vengono ignorate. Ciò mantiene i dati di training snelli e mirati, consumando meno capacità di training.
- All languages (Tutte le lingue) - scansiona tutte le versioni linguistiche del sito. In questo modo vengono acquisite tutte le pagine localizzate, ma si raccolgono più contenuti e si consuma più capacità di training.
- Selected language (Lingua selezionata) - scansiona una singola lingua scelta tra quelle rilevate sul sito.
ChatLab rileva automaticamente la lingua principale del tuo sito web e la usa come impostazione predefinita. Quando scegli Selected language, la lingua principale rilevata viene preselezionata per te e contrassegnata come "principale" nell'elenco. Puoi modificarla selezionando qualsiasi altra lingua rilevata.
Il rilevamento della lingua è disponibile in tutti i piani, compreso il piano gratuito. Nel piano gratuito la lingua della pagina viene comunque rilevata e viene scansionata solo la lingua principale, a meno che non si imposti l'ambito su All languages.
Metodo di rilevamento della lingua (Language detection method)
Quando l'ambito è impostato su Main website language o Selected language, puoi scegliere come ChatLab riconosce le versioni linguistiche del sito tramite il menu a discesa Language detection method:
- Hreflang attributes (recommended) (Attributi hreflang (consigliato)) - impostazione predefinita. Utilizza il markup
hreflangelanggià presente nella maggior parte dei siti multilingue per collegare tra loro le versioni linguistiche. - URL path prefix (/en/, /de/, ...) (Prefisso del percorso URL (/en/, /de/, ...)) - per i siti che organizzano ogni lingua all'interno di un segmento del percorso come
/en/,/de/o/fr/senza markuphreflang.
Se ChatLab non riesce a rilevare automaticamente le lingue, puoi comunque scansionare la lingua principale o tutte le lingue. Quando scegli Selected language, inserisci prima l'indirizzo del sito web nei campi sopra, quindi seleziona nuovamente l'opzione per consentire l'analisi del sito.
Per una panoramica su come il chatbot utilizza queste versioni linguistiche quando risponde, consulta Chatbot multilingue e Configurazione della lingua del chatbot. Le modalità linguistiche della knowledge base descritte in quegli articoli si basano su fonti scansionate con il rilevamento della lingua, pertanto le fonti precedenti potrebbero richiedere un nuovo training per sfruttarle appieno.
Impostazioni avanzate (Advanced settings)
Fai clic sul pulsante Advanced settings nel modulo di training per accedere a controlli di scansione più dettagliati.
Le impostazioni avanzate sono organizzate in quattro sezioni:
URL Filtering (Filtro URL)
- Include only URLs that contain (Includi solo gli URL che contengono) - Scansiona solo gli URL che corrispondono a questi pattern (separati da punto e virgola, es.
/en;/help) - Exclude URLs that contain (Escludi gli URL che contengono) - Salta gli URL che corrispondono a questi pattern (es.
/news;/pictures). Pattern comuni come/wp-admin/,/feed/e le pagine del carrello sono esclusi per impostazione predefinita
Query Parameters (Parametri di query)
- Ignore all query parameters (Ignora tutti i parametri di query) - Tratta gli URL con parametri di query diversi come la stessa pagina (es.
/page?id=1e/page?id=2diventano entrambi/page) - Ignore specific query parameters (Ignora parametri di query specifici) - Ignora solo determinati parametri (i parametri di tracciamento comuni come
utm_source,fbclid,gclidvengono ignorati automaticamente)
Content Filtering (Filtro contenuti)
- Include element IDs (Includi ID elemento) - Estrai i contenuti solo da elementi HTML specifici (usa
#idper gli ID,.classnameper le classi,[data-id="82874db"]per elementi con un determinato attributo, separati da punto e virgola) - Exclude element IDs (Escludi ID elemento) - Salta i contenuti di elementi HTML specifici (es.
footer;header;#navigation;[data-nosnippet]) - Quando imposti elementi da includere/escludere compaiono opzioni condizionali per stabilire se il crawler debba seguire i link presenti all'interno di tali elementi
Scraping Behavior (Comportamento di scraping)
- Scrape documents (Esegui scraping dei documenti) - Estrai contenuti anche dai file PDF trovati sul sito
- Exclude image links (Escludi link alle immagini) - Escludi gli URL delle immagini dal dataset di training
- Scrape hidden contents (Esegui scraping dei contenuti nascosti) - Includi i contenuti degli elementi HTML nascosti (abilitato per impostazione predefinita)
- Delay between pages (Ritardo tra le pagine) - Aggiungi un ritardo in secondi tra le richieste delle pagine per ridurre il carico sul server
- Country code (Codice paese) - Instrada lo scraping tramite un server proxy in un paese specifico (codice a due lettere, es.
us)
Notifiche via email
L'opzione Email me when training is finished or needs my attention (Inviami un'email quando il training è terminato o richiede la mia attenzione) è abilitata per impostazione predefinita. Quando è attiva, riceverai un'email di notifica se:
- Il training viene completato correttamente
- Il sistema richiede un tuo intervento (ad esempio la selezione delle pagine dopo la scansione)
- Si verificano problemi durante il training
Puoi modificare l'indirizzo email di notifica nel campo accanto all'opzione.
Monitorare l'avanzamento del training
Dopo aver avviato una scansione, passa alla scheda Trainings per monitorare l'avanzamento. Ogni sessione di training mostra:
- L'URL di origine
- Lo stato corrente (Scanning links, Awaiting links selection, Training, Training completed)
- Una barra di avanzamento durante la scansione o il training attivi
- La data dell'ultimo aggiornamento
Fai clic su More details (Maggiori dettagli) per visualizzare tutti i parametri usati per una specifica sessione di training, incluse le impostazioni avanzate configurate.
Gestire i link sottoposti a training
Al termine del training, tutte le pagine scansionate compaiono nella scheda Links. Ogni link mostra:
- Titolo e URL della pagina
- Conteggio dei caratteri (dimensioni dei dati di training)
- Stato del training
- Data dell'ultimo aggiornamento
Per ogni link puoi:
- Retrain (Esegui di nuovo il training) - Scansiona nuovamente e aggiorna i contenuti per questa specifica pagina
- View (Visualizza) - Mostra l'esatto contenuto estratto dalla pagina
- Delete (Elimina) - Rimuovi questa pagina dalla knowledge base del chatbot
Usa la casella di controllo Select all (Seleziona tutto) e i pulsanti per le azioni di massa per ripetere il training o eliminare più link contemporaneamente.
Visualizzare i contenuti scansionati
Fai clic sul pulsante View accanto a qualsiasi link sottoposto a training per visualizzare esattamente i contenuti estratti da quella pagina.
La finestra modale di visualizzazione della fonte mostra il titolo della pagina, l'URL, il conteggio dei caratteri, la data dell'ultimo aggiornamento e il testo completo su cui è stato addestrato il chatbot. Questo ti aiuta a verificare che siano stati acquisiti i contenuti corretti e a comprendere la knowledge base del chatbot.
Articoli correlati
- Training in background - Scopri come funziona il training in background
- Re-training del tuo chatbot - Come aggiornare il chatbot con nuovi contenuti
- Come ridurre i caratteri di training durante la scansione di un sito web - Suggerimenti per ottimizzare le dimensioni dei dati di training
- Training del tuo chatbot: nozioni di base e limiti - Informazioni sui limiti dei dati di training