Voice Conversation trasforma il tuo chatbot in un assistente vocale in tempo reale. I visitatori premono il pulsante di chiamata nel widget di chat e avviano una conversazione vocale con il bot: parlano e il bot risponde con una voce sintetizzata. Puoi scegliere il modello vocale, la voce, la lingua e alcuni limiti di sicurezza.
Prima di iniziare, crea un chatbot e allenalo. Voice Conversation è disponibile come funzionalità premium - se il tuo piano non la include, comparirà un messaggio di upgrade. Le chiamate consumano crediti per i messaggi.
Dove trovare le impostazioni di Voice Conversation
Seleziona il tuo chatbot, fai clic sulla scheda Settings (Impostazioni), quindi seleziona Voice Conversation (Conversazione vocale) nella barra laterale sinistra.
Nella parte superiore della pagina troverai l'interruttore Enable voice conversation (Abilita conversazione vocale). Il resto delle impostazioni compare solo dopo aver abilitato la conversazione vocale.
Scegli un modello vocale
ChatLab supporta quattro modelli vocali, ciascuno con la propria tariffa al minuto indicata accanto nel menu a discesa:
- GPT Realtime - un'opzione speech-to-speech di OpenAI.
- GPT Realtime Mini - il modello vocale predefinito per i nuovi bot. Confronta la tariffa in crediti mostrata e testalo con le tue domande.
- Gemini 3.1 Flash Voice - un'opzione speech-to-speech basata su Gemini Live.
- ElevenLabs Voice - un'opzione che utilizza le voci di ElevenLabs. Usa il normale modello di testo del bot (impostato in Settings > Model & Advanced) per generare le risposte, che vengono poi convertite in voce da ElevenLabs. La tariffa vocale al minuto viene addebitata in aggiunta al costo per risposta del modello di testo.
Sotto il selettore del modello è presente la scheda Cost breakdown (Riepilogo costi), che mostra la tariffa al minuto per il modello attualmente selezionato, consentendoti di verificare sempre come verrà fatturata la chiamata in base alla tariffa indicata accanto a ciascun modello nel menu a discesa.
Scegli una voce
Ciascun modello mette a disposizione il proprio set di voci nel menu a discesa Voice (Voce):
- OpenAI (GPT Realtime e GPT Realtime Mini) - Alloy, Ash, Ballad, Cedar, Coral, Echo, Fable, Marin, Onyx, Nova, Sage, Shimmer, Verse.
- Gemini - Kore (consigliata), Charon, Puck, Fenrir, Aoede, Leda, Orus, Zephyr.
- ElevenLabs - Brian, Helen, Chris, Daniel, Jessica, Sarah, Lily, Liam, Will, Janet.
I nuovi bot utilizzano Alloy come voce predefinita. Puoi cambiare la voce in qualsiasi momento: la nuova voce sarà attiva a partire dalla chiamata successiva.
Imposta la lingua
La sezione Language (Lingua) controlla la lingua (o le lingue) parlate dal bot durante una chiamata.
- OpenAI e Gemini - scegli una singola lingua principale. Se un visitatore parla in un'altra lingua supportata durante la chiamata, il bot passerà a quella lingua in modo naturale.
- ElevenLabs - scegli una lingua predefinita più un numero qualsiasi di lingue aggiuntive che l'agente è autorizzato a utilizzare.
Fai clic sul riquadro di una lingua per aprire un selettore dotato di ricerca e bandiere dei paesi.
Messaggio di benvenuto vocale
Il Voice Welcome Message (Messaggio di benvenuto vocale) è la prima frase pronunciata dal bot all'inizio di una chiamata. Viene riprodotto una sola volta all'inizio della sessione, quindi mantienilo breve e naturale: una formula come "Ciao, come posso aiutarti?" funziona benissimo.
La lunghezza massima è di 500 caratteri.
Limita la durata della conversazione
Le chiamate vocali consumano crediti al minuto; per questo motivo sono disponibili due limiti di sicurezza per proteggere il budget del proprietario del bot.
Max Conversation Duration
Il campo Max Conversation Duration (Durata massima conversazione) limita la durata di una singola chiamata. Il valore predefinito è di 300 secondi (5 minuti); l'intervallo consentito va da 30 secondi a 3600 secondi (60 minuti). Quando il limite viene raggiunto, il bot pronuncia un messaggio post-limite (che puoi personalizzare subito sotto il campo) e la chiamata si conclude.
Se desideri consentire una durata illimitata per le singole chiamate, attiva l'opzione No cap (Nessun limite). Verrà visualizzato un avviso, poiché una singola chiamata potrebbe consumare tutti i crediti rimanenti.
Limite vocale giornaliero
L'impostazione Daily voice cap (minutes) (Limite vocale giornaliero in minuti) viene verificata prima dell'inizio di una nuova chiamata tramite widget, basandosi sull'utilizzo vocale registrato per il bot. Non garantisce che le chiamate simultanee in corso si interrompano a un totale esatto di minuti condivisi. Verifica l'utilizzo registrato e imposta anche il limite di durata per singola chiamata. Non dare per scontato che questo controllo sul widget blocchi anche le telefonate in entrata.
Attiva No daily cap (Nessun limite giornaliero) per rimuovere il limite al giorno.
Comportamento vocale e prompt di sistema
Le chiamate vocali possono utilizzare un prompt di sistema diverso rispetto alla chat di testo, una soluzione utile per impostare al telefono un tono più colloquiale e orientato al parlato.
Nella sezione Voice Behavior (Comportamento vocale), fai clic sul link Manage voice behavior and prompt in Role & Behavior settings (Gestisci comportamento vocale e prompt nelle impostazioni Ruolo e comportamento) per passare a Settings > Role & Behavior, dove una scheda dedicata a Voice Conversation consente di modificare il prompt specifico per la voce indipendentemente dal prompt della chat di testo.
Come funziona la fatturazione delle chiamate vocali
- Il primo minuto di ogni chiamata viene addebitato per intero alla tariffa al minuto del modello selezionato. Si tratta dell'addebito minimo per qualsiasi chiamata, anche se molto breve.
- Dopo il primo minuto, l'addebito si basa sulla durata fatturabile e viene arrotondato per eccesso a crediti interi. Le sessioni sul widget vengono monitorate a intervalli di 10 secondi, quindi non si tratta di un calcolo al cronometro esatto.
- Il silenzio durante una chiamata attiva viene conteggiato nella durata. Per le chiamate tramite widget, i controlli di connessione limitano l'addebito quando il browser smette di inviare dati; un breve intervallo finale può comunque essere conteggiato.
- Prima che una chiamata abbia inizio, ChatLab verifica che il bot disponga di crediti sufficienti per coprire almeno il primo minuto. In caso contrario, la chiamata non può essere avviata.
- Per ElevenLabs Voice, la tariffa al minuto viene applicata in aggiunta al costo per risposta del modello di testo del bot, poiché ElevenLabs utilizza il modello di testo per generare le risposte e poi le converte in parlato.
Sincronizzazione della knowledge base per ElevenLabs
Quando viene selezionato un modello vocale ElevenLabs, sotto le impostazioni vocali compare un pannello di stato che indica se i dati di addestramento del bot sono stati caricati su ElevenLabs. La sincronizzazione viene eseguita automaticamente dopo l'addestramento: ChatLab invia a ElevenLabs un documento generato a partire dal materiale di addestramento del bot. Controlla il pannello di stato dopo l'addestramento e attendi l'esito positivo della sincronizzazione prima di testare le informazioni appena aggiunte. Le knowledge base di grandi dimensioni potrebbero essere troncate durante l'esportazione, quindi ti consigliamo di testare gli argomenti più importanti anziché dare per scontata una totale parità con la chat di testo.
Telefonate
Una volta abilitata la conversazione vocale, puoi anche assegnare al bot un numero di telefono reale in modo che i clienti possano chiamare tramite la normale rete telefonica. Consulta l'articolo dedicato: Telefonate.
Digitazione vocale rispetto a conversazione vocale
Queste due funzioni hanno nomi simili ma sono diverse:
- Voice input (Digitazione vocale, in Settings > Chat Conversation) aggiunge un pulsante a forma di microfono alla barra dei messaggi per consentire ai visitatori di dettare una domanda invece di digitarla. Il bot continua a rispondere via testo. Utilizza la Web Speech API del browser.
- Voice conversation (Conversazione vocale, descritta in questa pagina) è una vera e propria chiamata speech-to-speech in tempo reale: i visitatori ascoltano la voce del bot, con la tecnologia di OpenAI Realtime, Gemini Live o ElevenLabs.
Fai una chiamata di prova
Attendi che compaia la conferma Saved (Salvato), quindi apri Overview (Panoramica) e usa il pulsante di chiamata all'interno del widget. Consenti l'accesso al microfono quando richiesto dal browser. Verifica il messaggio di benvenuto, la lingua, la voce e una risposta basata sui tuoi dati di addestramento, quindi termina la chiamata. Se il microfono non è disponibile o l'accesso è stato negato, controlla i permessi del browser e prova a usare un browser supportato. Prima di pubblicare, ripeti il test sul tuo chatbot incorporato.