Hilfezentrum
Chatbot trainieren

Neue Website-Quellen hinzufügen

Zuletzt aktualisiert:

Durch das Hinzufügen von Website-Quellen kann Ihr Chatbot direkt aus den Inhalten Ihrer Website lernen. Ob Produktdetails, FAQs oder Blogbeiträge - das Scannen Ihrer Website stellt sicher, dass der Chatbot präzise und aktuelle Antworten auf Basis Ihrer tatsächlichen Website-Inhalte liefern kann.

Wo Sie das Website-Training finden

Wählen Sie Ihren Chatbot aus und navigieren Sie dann zum Tab Training (Training). Wählen Sie in der linken Seitenleiste Links (Links) aus. Hier verwalten Sie alle websitebasierten Trainingsquellen.

Klicken Sie auf Add New Training: Website (Neues Training hinzufügen: Website), um das Trainingsformular zu öffnen.

Liste der Trainings-Links mit hervorgehobenem Button „Add New Training“

Scan-Optionen

Das Trainingsformular bietet Ihnen zwei Möglichkeiten, Website-Inhalte hinzuzufügen, getrennt durch ein OR-Trennzeichen (ODER).

Scan website contents (Website-Inhalte scannen) - Geben Sie eine URL in das Feld Address (Adresse) ein und wählen Sie zwischen:

  • Whole website (Ganze Website) - Durchsucht alle auffindbaren Seiten ausgehend von der angegebenen URL
  • Single address (Einzelne Adresse) - Scannt nur die spezifische Seite, die Sie eingeben

Use sitemap (Sitemap verwenden) - Geben Sie Ihre Sitemap-URL (z. B. https://www.yourdomain.com/sitemap.xml) in das Feld Sitemap (Sitemap) ein. Dadurch werden nur die in Ihrer Sitemap-Datei aufgeführten Seiten gescannt.

Wenn Sie eine Sitemap verwenden, wird das Feld „Address“ automatisch deaktiviert (und umgekehrt), da Sie pro Trainingsauftrag nur eine Methode verwenden können.

Modal für neues Training mit dem Adressfeld, dem Dropdown-Menü für den Scan-Modus und der Sitemap-Option

Auf ganzer Website trainieren

  1. Geben Sie die Basis-URL Ihrer Website in das Feld Address ein (z. B. https://www.yourdomain.com)
  2. Wählen Sie Whole website aus dem Dropdown-Menü unter dem Adressfeld
  3. Klicken Sie auf Start scanning the website (Scannen der Website starten)

Das System durchsucht Ihre Website und folgt Links, um alle Seiten zu erfassen. Sie können den Fortschritt im Tab Trainings (Trainings) überwachen, wo Sie in Echtzeit die Anzahl der gescannten Links und der gesammelten Trainingszeichen sehen.

Modal für neues Training mit hervorgehobenem Button „Start scanning the website“

Auf einer einzelnen Seite trainieren

  1. Geben Sie die URL der gewünschten Seite in das Feld Address ein (z. B. https://www.yourdomain.com/pricing)
  2. Wählen Sie Single address aus dem Dropdown-Menü
  3. Klicken Sie auf Start scanning the website

Dies ist nützlich, wenn Sie der Wissensdatenbank Ihres Chatbots nur eine bestimmte Seite hinzufügen müssen, beispielsweise einen neu veröffentlichten Artikel oder eine aktualisierte FAQ-Seite.

Auf Sitemap trainieren

  1. Geben Sie Ihre Sitemap-URL in das Feld Sitemap ein (z. B. https://www.yourdomain.com/sitemap.xml)
  2. Klicken Sie auf Start scanning the website

Das Scannen per Sitemap gibt Ihnen präzise Kontrolle darüber, welche Seiten berücksichtigt werden, da nur die in Ihrer Sitemap-Datei aufgeführten URLs verarbeitet werden.

Einzelne Seiten für das Training auswählen

Vor dem Start eines Scans können Sie den Schalter I want to select individual urls for training after scanning the website (Ich möchte nach dem Scannen der Website einzelne URLs für das Training auswählen) aktivieren. Diese Option ist nur verfügbar, wenn Sie eine ganze Website scannen (nicht im Modus für einzelne Adressen).

Wenn diese Option aktiviert ist:

  1. Das System scannt Ihre Website und erfasst alle Seiten
  2. Nach Abschluss des Scans sehen Sie eine Baumstruktur aller gefundenen Seiten mit der jeweiligen Zeichenanzahl
  3. Aktivieren oder deaktivieren Sie Seiten, um sie in das Training aufzunehmen oder davon auszuschließen
  4. Klicken Sie auf Start the Training (Training starten), um das Training mit den ausgewählten Seiten zu beginnen

Dies ist hilfreich, wenn Ihre Website Seiten enthält, aus denen der Chatbot nicht lernen soll, wie Login-Seiten, Admin-Bereiche oder irrelevante Abschnitte.

Sprachen der Website scannen

Wenn Ihre Website in mehreren Sprachen veröffentlicht wird, erkennt ChatLab die verfügbaren Sprachen beim Scannen und lässt Sie entscheiden, welche davon in die Wissensdatenbank Ihres Chatbots aufgenommen werden sollen. Diese Einstellungen finden Sie im Bereich Languages (Sprachen) des Trainingsformulars direkt über Advanced settings (Erweiterte Einstellungen).

Bereich „Languages“ des Trainingsformulars mit den Optionen für Sprachumfang und Erkennungsmethode

Sprachumfang

Das Dropdown-Menü Language scope (Sprachumfang) steuert, wie viel von einer mehrsprachigen Website gescannt wird:

  • Main website language (recommended) (Hauptsprache der Website (empfohlen)) - der Standard. Es wird nur die Hauptsprache der Website gescannt. Andere Sprachversionen werden übersprungen. Dadurch bleiben Ihre Trainingsdaten schlank und fokussiert, und es wird weniger von Ihrer Trainingskapazität verbraucht.
  • All languages (Alle Sprachen) - scannt jede Sprachversion der Website. Dadurch werden alle Ihre lokalisierten Seiten erfasst, es werden jedoch mehr Inhalte gesammelt und mehr Trainingskapazität verbraucht.
  • Selected language (Ausgewählte Sprache) - scannt eine einzelne Sprache, die Sie aus den auf der Website erkannten Sprachen auswählen.

ChatLab erkennt automatisch die Hauptsprache Ihrer Website und nutzt sie als Standard. Wenn Sie Selected language wählen, wird die erkannte Hauptsprache für Sie vorausgewählt und in der Liste als „main“ markiert. Sie können sie auf jede andere erkannte Sprache umstellen.

Die Spracherkennung ist in jedem Tarif verfügbar, auch im FREE-Plan. Im FREE-Plan wird die Seitensprache weiterhin erkannt, und es wird nur die Hauptsprache gescannt, es sei denn, Sie ändern den Umfang auf All languages.

Methode zur Spracherkennung

Wenn der Umfang auf Main website language oder Selected language eingestellt ist, können Sie über das Dropdown-Menü Language detection method (Methode zur Spracherkennung) festlegen, wie ChatLab die Sprachversionen auf Ihrer Website identifiziert:

  • Hreflang attributes (recommended) (Hreflang-Attribute (empfohlen)) - der Standard. Nutzt das Markup hreflang und lang, das die meisten mehrsprachigen Websites bereits bereitstellen, um ihre Sprachversionen miteinander zu verknüpfen.
  • URL path prefix (/en/, /de/, ...) (URL-Pfadpräfix (/en/, /de/, ...)) - für Websites, die jede Sprache unter einem Pfadsegment wie /en/, /de/ oder /fr/ führen, ohne hreflang-Markup zu nutzen.

Falls ChatLab Sprachen nicht automatisch erkennen kann, können Sie dennoch die Hauptsprache oder alle Sprachen scannen. Wenn Sie Selected language wählen, geben Sie zuerst Ihre Website-Adresse in die obigen Felder ein und wählen Sie die Option dann erneut, damit die Website analysiert werden kann.

Eine Übersicht darüber, wie Ihr Chatbot diese Sprachversionen beim Antworten verwendet, finden Sie unter Mehrsprachige Chatbots und Spracheinstellungen für Chatbots. Die dort beschriebenen Sprachmodi der Wissensdatenbank setzen Quellen voraus, die mit Spracherkennung gescannt wurden. Ältere Quellen müssen daher möglicherweise neu trainiert werden, um diese Funktionen voll nutzen zu können.

Erweiterte Einstellungen

Klicken Sie im Trainingsformular auf die Schaltfläche Advanced settings (Erweiterte Einstellungen), um auf detaillierte Scan-Optionen zuzugreifen.

Modal für neues Training mit hervorgehobenem Bereich „Advanced settings“

Die erweiterten Einstellungen sind in vier Bereiche unterteilt:

URL Filtering (URL-Filterung)

  • Include only URLs that contain (Nur URLs einbeziehen, die Folgendes enthalten) - Scannt nur URLs, die diesen Mustern entsprechen (durch Semikolon getrennt, z. B. /en;/help)
  • Exclude URLs that contain (URLs ausschließen, die Folgendes enthalten) - Überspringt URLs, die diesen Mustern entsprechen (z. B. /news;/pictures). Gängige Muster wie /wp-admin/, /feed/ und Warenkorb-Seiten werden standardmäßig ausgeschlossen

Query Parameters (URL-Parameter)

  • Ignore all query parameters (Alle URL-Parameter ignorieren) - Behandelt URLs mit unterschiedlichen Parametern als dieselbe Seite (z. B. werden /page?id=1 und /page?id=2 beide zu /page)
  • Ignore specific query parameters (Bestimmte URL-Parameter ignorieren) - Ignoriert nur bestimmte Parameter (gängige Tracking-Parameter wie utm_source, fbclid, gclid werden automatisch ignoriert)

Content Filtering (Inhaltsfilterung)

  • Include element IDs (Element-IDs einbeziehen) - Extrahiert Inhalte nur aus bestimmten HTML-Elementen (verwenden Sie #id für IDs, .classname für Klassen, [data-id="82874db"] für Elemente mit einem bestimmten Attribut, jeweils durch Semikolon getrennt)
  • Exclude element IDs (Element-IDs ausschließen) - Überspringt Inhalte bestimmter HTML-Elemente (z. B. footer;header;#navigation;[data-nosnippet])
  • Wenn Elemente zum Ein- oder Ausschließen festgelegt sind, erscheinen bedingte Schalter, mit denen Sie steuern können, ob der Crawler Links folgt, die innerhalb dieser Elemente gefunden werden

Scraping Behavior (Scraping-Verhalten)

  • Scrape documents (Dokumente erfassen) - Extrahiert auch Inhalte aus PDF-Dateien, die auf der Website gefunden werden
  • Exclude image links (Bild-Links ausschließen) - Schließt Bild-URLs aus dem Trainingsdatensatz aus
  • Scrape hidden contents (Versteckte Inhalte erfassen) - Bezieht Inhalte aus ausgeblendeten HTML-Elementen ein (standardmäßig aktiviert)
  • Delay between pages (Verzögerung zwischen Seiten) - Fügt eine Verzögerung in Sekunden zwischen Seitenanfragen ein, um die Serverlast zu reduzieren
  • Country code (Ländercode) - Leitet das Scraping über einen Proxy-Server in einem bestimmten Land weiter (Zwei-Buchstaben-Code, z. B. us)

E-Mail-Benachrichtigungen

Der Schalter Email me when training is finished or needs my attention (Mich per E-Mail benachrichtigen, wenn das Training abgeschlossen ist oder meine Aufmerksamkeit erfordert) ist standardmäßig aktiviert. Wenn er aktiv ist, erhalten Sie eine E-Mail-Benachrichtigung, wenn:

  • Das Training erfolgreich abgeschlossen wurde
  • Das System Ihre Eingabe benötigt (z. B. Auswahl von Seiten nach einem Scan)
  • Während des Trainings Probleme auftreten

Sie können die E-Mail-Adresse für Benachrichtigungen im Feld neben dem Schalter ändern.

Trainingsfortschritt überwachen

Wechseln Sie nach dem Start eines Scans zum Tab Trainings, um den Fortschritt zu überwachen. Jeder Trainingsauftrag zeigt:

  • Die Quell-URL
  • Den aktuellen Status (Scanning links, Awaiting links selection, Training, Training completed)
  • Einen Fortschrittsbalken während des aktiven Scannens oder Trainierens
  • Das Datum der letzten Aktualisierung

Tab „Trainings“ mit einem abgeschlossenen Trainingsauftrag und hervorgehobenem Tab „Trainings“

Klicken Sie auf More details (Weitere Details), um alle für einen bestimmten Trainingsauftrag verwendeten Parameter zu sehen, einschließlich aller konfigurierten erweiterten Einstellungen.

Geöffnete Trainingsdetails mit Anzeige aller Parameter

Trainierte Links verwalten

Nach Abschluss des Trainings erscheinen alle gescannten Seiten im Tab Links. Jeder Link zeigt:

  • Seitentitel und URL
  • Zeichenanzahl (Größe der Trainingsdaten)
  • Trainingsstatus
  • Datum der letzten Aktualisierung

Für jeden Link können Sie:

  • Retrain (Neu trainieren) - Den Inhalt dieser bestimmten Seite erneut scannen und aktualisieren
  • View (Anzeigen) - Den genauen Inhalt ansehen, der von der Seite extrahiert wurde
  • Delete (Löschen) - Diese Seite aus der Wissensdatenbank Ihres Chatbots entfernen

Verwenden Sie das Kontrollkästchen Select all (Alle auswählen) und die Sammelaktions-Buttons, um mehrere Links gleichzeitig neu zu trainieren oder zu löschen.

Gescannte Inhalte ansehen

Klicken Sie neben einem trainierten Link auf die Schaltfläche View, um genau zu sehen, welcher Inhalt von dieser Seite extrahiert wurde.

Link-Liste mit hervorgehobenem Button „View“

Das Quellansichts-Modal zeigt den Seitentitel, die URL, die Zeichenanzahl, das Datum der letzten Aktualisierung und den vollständigen Textinhalt, auf dem Ihr Chatbot trainiert wurde. Dies hilft Ihnen zu überprüfen, ob der richtige Inhalt erfasst wurde, und die Wissensdatenbank Ihres Chatbots besser zu verstehen.

Quellansichts-Modal mit extrahiertem Seiteninhalt

Verwandte Artikel