Hilfezentrum
Sprache & Telefonie

Voice Conversation

Zuletzt aktualisiert:

Voice Conversation verwandelt Ihren Chatbot in einen Echtzeit-Sprachagenten. Besucher tippen im Chat-Widget auf den Anruf-Button und führen ein gesprochenes Gespräch mit dem Bot - sie sprechen, und der Bot antwortet mit einer synthetischen Stimme. Sie wählen das Voice-Modell, die Stimme, die Sprache sowie einige Sicherheitseinstellungen.

Bevor Sie beginnen, erstellen Sie einen Chatbot und trainieren Sie ihn. Voice Conversation ist als Premium-Funktion verfügbar - falls Ihr Tarif die Funktion nicht enthält, wird ein Upgrade-Hinweis angezeigt. Anrufe verbrauchen Message Credits.

Wo Sie die Einstellungen für Voice Conversation finden

Wählen Sie Ihren Chatbot aus, klicken Sie auf den Tab Settings (Einstellungen) und wählen Sie dann in der linken Seitenleiste Voice Conversation (Sprachkonversation) aus.

Einstellungen für Voice Conversation

Oben auf der Seite finden Sie den Schalter Enable voice conversation (Sprachkonversation aktivieren). Die restlichen Einstellungen werden erst sichtbar, sobald die Sprachkonversation aktiviert ist.

Schalter zum Aktivieren der Sprachkonversation|width=70

Voice-Modell auswählen

ChatLab unterstützt vier Voice-Modelle, jeweils mit einem eigenen Minutentarif, der daneben im Dropdown-Menü angezeigt wird:

  • GPT Realtime - eine Speech-to-Speech-Option von OpenAI.
  • GPT Realtime Mini - das Standard-Voice-Modell für neue Bots. Vergleichen Sie den angezeigten Credit-Tarif und testen Sie ihn mit Ihren Fragen.
  • Gemini 3.1 Flash Voice - eine Speech-to-Speech-Option mit Gemini Live.
  • ElevenLabs Voice - eine Option mit Stimmen von ElevenLabs. Verwendet das reguläre Textmodell des Bots (festgelegt unter Settings > Model & Advanced [Einstellungen > Modell & Erweitert]), um Antworten zu generieren; anschließend wandelt ElevenLabs diese in Sprache um. Der Minutentarif für die Sprachausgabe wird zusätzlich zu den Kosten des Textmodells pro Antwort berechnet.

Unterhalb der Modellauswahl befindet sich eine Karte Cost breakdown (Kostenaufschlüsselung), die den Minutentarif für das aktuell ausgewählte Modell anzeigt. So sehen Sie stets, wie der Anruf zu dem neben dem jeweiligen Modell im Dropdown-Menü angegebenen Tarif abgerechnet wird.

Kostenaufschlüsselung für Voice-Modelle|width=70

Eine Stimme auswählen

Jedes Modell stellt im Dropdown-Menü Voice (Stimme) seine eigene Auswahl an Stimmen zur Verfügung:

  • OpenAI (GPT Realtime und GPT Realtime Mini) - Alloy, Ash, Ballad, Cedar, Coral, Echo, Fable, Marin, Onyx, Nova, Sage, Shimmer, Verse.
  • Gemini - Kore (empfohlen), Charon, Puck, Fenrir, Aoede, Leda, Orus, Zephyr.
  • ElevenLabs - Brian, Helen, Chris, Daniel, Jessica, Sarah, Lily, Liam, Will, Janet.

Neue Bots sind standardmäßig auf Alloy eingestellt. Sie können die Stimme jederzeit ändern - die neue Stimme wird beim nächsten Anruf aktiv.

Stimmen-Dropdown-Menü|width=50

Die Sprache festlegen

Der Bereich Language (Sprache) steuert, welche Sprache (oder Sprachen) der Bot während eines Anrufs spricht.

  • OpenAI und Gemini - Wählen Sie eine einzige primäre Sprache aus. Wenn ein Besucher während des Anrufs in einer anderen unterstützten Sprache spricht, wechselt der Bot ganz natürlich zu dieser Sprache.
  • ElevenLabs - Wählen Sie eine Standardsprache sowie eine beliebige Anzahl zusätzlicher Sprachen aus, die der Agent verwenden darf.

Klicken Sie auf eine Sprachkachel, um eine Auswahl mit Länderflaggen und Suchfunktion zu öffnen.

Sprachauswahl|width=70

Sprach-Begrüßungsnachricht

Die Voice Welcome Message (Sprach-Begrüßungsnachricht) ist der erste Satz, den der Bot spricht, wenn ein Anruf beginnt. Sie wird einmal zu Beginn der Sitzung abgespielt. Halten Sie sie daher kurz und natürlich - Formulierungen wie "Hallo, wie kann ich Ihnen helfen?" eignen sich gut.

Die maximale Länge beträgt 500 Zeichen.

Feld für die Sprach-Begrüßungsnachricht|width=70

Gesprächsdauer begrenzen

Sprachanrufe verbrauchen Credits pro Minute, daher stehen zwei Sicherheitslimits zur Verfügung, um das Budget des Bot-Besitzers zu schützen.

Max Conversation Duration (Maximale Gesprächsdauer)

Das Feld Max Conversation Duration (Maximale Gesprächsdauer) begrenzt die Dauer eines einzelnen Anrufs. Der Standardwert beträgt 300 Sekunden (5 Minuten); der zulässige Bereich liegt zwischen 30 Sekunden und 3.600 Sekunden (60 Minuten). Wenn das Limit erreicht ist, spricht der Bot eine Nachricht nach Erreichen des Limits (die Sie direkt unter dem Feld anpassen können) und der Anruf wird beendet.

Wenn Sie eine unbegrenzte Dauer für einzelne Anrufe zulassen möchten, aktivieren Sie den Schalter No cap (Keine Begrenzung). Es wird eine Warnung angezeigt, da ein einzelner Anruf dann alle verbleibenden Credits verbrauchen kann.

Maximale Gesprächsdauer|width=70

Daily voice cap (Tägliches Sprachlimit)

Die Einstellung Daily voice cap (minutes) (Tägliches Sprachlimit (Minuten)) wird vor dem Start eines neuen Widget-Anrufs anhand der erfassten Sprachnutzung für den Bot überprüft. Sie garantiert nicht, dass laufende gleichzeitige Anrufe bei einer exakt gemeinsamen Minutengesamtzahl stoppen. Überprüfen Sie die erfasste Nutzung und verwenden Sie zusätzlich das Limit für die Gesprächsdauer pro Anruf. Gehen Sie nicht davon aus, dass diese Widget-Prüfung auch eingehende Telefonanrufe blockiert.

Aktivieren Sie No daily cap (Kein tägliches Limit), um das Tageslimit aufzuheben.

Tägliches Sprachlimit|width=70

Sprachverhalten und System-Prompt

Sprachanrufe können einen anderen System-Prompt als der Text-Chat verwenden. Dies ist nützlich, wenn Sie am Telefon eine eher dialogorientierte Persönlichkeit im Gesprächsstil wünschen.

Klicken Sie im Bereich Voice Behavior (Sprachverhalten) auf den Link Manage voice behavior and prompt in Role & Behavior settings (Sprachverhalten und Prompt in den Einstellungen für Rolle & Verhalten verwalten), um zu Settings > Role & Behavior (Rolle & Verhalten) zu wechseln. Dort können Sie in einem separaten Tab für Voice Conversation den für Sprachunterhaltungen vorgesehenen Prompt unabhängig vom Text-Chat-Prompt bearbeiten.

Link zum Sprachverhalten|width=70

So funktioniert die Sprachabrechnung

  • Die erste Minute jedes Anrufs wird voll zum Minutentarif des gewählten Modells abgerechnet. Dies ist die Mindestgebühr für jeden Anruf, selbst für sehr kurze Gespräche.
  • Nach der ersten Minute basiert die Gebühr auf der abrechnungsrelevanten Dauer und wird auf ganze Credits aufgerundet. Widget-Sitzungen werden in 10-Sekunden-Intervallen erfasst, sodass es sich nicht um eine sekundengenaue Stoppuhr-Abrechnung handelt.
  • Stille während eines verbundenen Anrufs zählt zur Gesprächsdauer. Bei Widget-Anrufen begrenzen Verbindungsprüfungen die Gebühr, wenn der Browser keine Daten mehr sendet; ein kurzes Abschlussintervall kann dennoch berechnet werden.
  • Bevor ein Anruf beginnt, prüft ChatLab, ob der Bot über genügend Credits verfügt, um mindestens die erste Minute abzudecken. Wenn nicht, kann der Anruf nicht gestartet werden.
  • Bei ElevenLabs Voice wird die Minutengebühr zusätzlich zu den Kosten des Textmodells des Bots pro Antwort berechnet, da ElevenLabs das Textmodell zur Erstellung von Antworten verwendet und diese anschließend in Sprache umwandelt.

Wissensdatenbank-Synchronisierung für ElevenLabs

Wenn ein Voice-Modell von ElevenLabs ausgewählt ist, erscheint unter den Spracheinstellungen ein Statusbereich, der anzeigt, ob die Trainingsdaten des Bots zu ElevenLabs hochgeladen wurden. Die Synchronisierung läuft nach dem Training automatisch ab: ChatLab sendet ein aus dem Trainingsmaterial des Bots erstelltes Dokument an ElevenLabs. Überprüfen Sie den Statusbereich nach dem Training und warten Sie auf eine erfolgreiche Synchronisierung, bevor Sie neu hinzugefügtes Wissen testen. Große Wissensdatenbanken werden beim Export möglicherweise gekürzt. Testen Sie daher wichtige Themen, anstatt von einer vollständigen Übereinstimmung mit dem Text-Chat auszugehen.

Telefonanrufe

Sobald die Sprachkonversation aktiviert ist, können Sie dem Bot auch eine echte Telefonnummer zuweisen, sodass Kunden über das reguläre Telefonnetz anrufen können. Weitere Informationen finden Sie im entsprechenden Artikel: Telefonanrufe.

Voice Input im Vergleich zu Voice Conversation

Diese beiden Funktionen klingen ähnlich, unterscheiden sich jedoch grundlegend:

  • Voice Input (Spracheingabe, unter Settings > Chat Conversation [Chat-Konversation]) fügt der Nachrichtenleiste einen Mikrofon-Button hinzu, damit Besucher eine Frage als Text diktieren können. Der Bot antwortet weiterhin mit Text. Dies nutzt die Web Speech API des Browsers.
  • Voice Conversation (diese Seite) ist ein vollständiger Echtzeit-Anruf von Sprache zu Sprache - Besucher hören den Bot sprechen, unterstützt von OpenAI Realtime, Gemini Live oder ElevenLabs.

Einen Sprachanruf testen

Warten Sie auf Saved (Gespeichert), öffnen Sie dann Overview (Übersicht) und nutzen Sie die Anruftaste im Widget. Erlauben Sie den Mikrofonzugriff, wenn Ihr Browser danach fragt. Überprüfen Sie die Begrüßungsnachricht, die Sprache, die Stimme und eine Antwort aus Ihren Trainingsdaten, und beenden Sie dann den Anruf. Wenn das Mikrofon nicht verfügbar ist oder der Zugriff verweigert wurde, überprüfen Sie die Browser-Berechtigungen und versuchen Sie es mit einem unterstützten Browser. Wiederholen Sie den Test vor der Veröffentlichung auf Ihrem eingebetteten Chatbot.

Verwandte Artikel