Dodanie źródeł ze stron internetowych pozwala Twojemu chatbotowi uczyć się bezpośrednio z treści Twojej witryny. Niezależnie od tego, czy chodzi o szczegóły produktów, sekcje FAQ czy wpisy na blogu, skanowanie witryny sprawia, że chatbot może udzielać precyzyjnych i aktualnych odpowiedzi na podstawie rzeczywistej zawartości Twojej strony.
Gdzie znaleźć trenowanie na podstawie witryny
Wybierz swojego chatbota, a następnie przejdź do zakładki Training (Trenowanie). Na pasku bocznym po lewej stronie wybierz Links (Linki). W tym miejscu zarządzasz wszystkimi źródłami trenowania opartymi na stronach internetowych.
Kliknij Add New Training: Website (Dodaj nowe trenowanie: Witryna), aby otworzyć formularz trenowania.
Opcje skanowania
Formularz trenowania oferuje dwa sposoby dodawania treści z witryny, rozdzielone separatorem OR (LUB).
Scan website contents (Skanuj zawartość witryny) - wprowadź adres URL w polu Address (Adres) i wybierz jedną z opcji:
- Whole website (Cała witryna) - przeszukuje wszystkie wykrywalne strony, zaczynając od podanego adresu URL
- Single address (Pojedynczy adres) - skanuje wyłącznie wprowadzoną stronę
Use sitemap (Użyj mapy witryny) - wprowadź adres URL mapy witryny (np. https://www.yourdomain.com/sitemap.xml) w polu Sitemap (Mapa witryny). W ten sposób przeskanowane zostaną tylko strony wymienione w pliku sitemap.
Gdy korzystasz z mapy witryny, pole Address zostaje automatycznie wyłączone (i odwrotnie), ponieważ w ramach jednego zadania trenowania można użyć tylko jednej metody.
Trenowanie na całej witrynie
- Wprowadź główny adres URL swojej witryny w polu Address (np.
https://www.yourdomain.com) - Wybierz Whole website z listy rozwijanej pod polem adresu
- Kliknij Start scanning the website (Rozpocznij skanowanie witryny)
System przeszuka Twoją witrynę, przechodząc po linkach, aby wykryć wszystkie strony. Postępy możesz śledzić w zakładce Trainings (Trenowania), gdzie w czasie rzeczywistym zobaczysz liczbę przeskanowanych linków oraz zebranych znaków trenowania.
Trenowanie na pojedynczej stronie
- Wprowadź adres URL konkretnej strony w polu Address (np.
https://www.yourdomain.com/pricing) - Wybierz Single address z listy rozwijanej
- Kliknij Start scanning the website
Jest to przydatne, gdy chcesz dodać do bazy wiedzy chatbota tylko jedną konkretną stronę, na przykład nowo opublikowany artykuł lub zaktualizowaną stronę FAQ.
Trenowanie na mapie witryny
- Wprowadź adres URL mapy witryny w polu Sitemap (np.
https://www.yourdomain.com/sitemap.xml) - Kliknij Start scanning the website
Skanowanie mapy witryny zapewnia dokładną kontrolę nad tym, które strony zostaną uwzględnione, ponieważ przetwarza wyłącznie adresy URL wymienione w pliku sitemap.
Wybór poszczególnych stron do trenowania
Przed rozpoczęciem skanowania możesz włączyć przełącznik I want to select individual urls for training after scanning the website (Chcę wybrać poszczególne adresy URL do trenowania po przeskanowaniu witryny). Opcja ta jest dostępna wyłącznie podczas skanowania całej witryny (nie działa w trybie pojedynczego adresu).
Po jej włączeniu:
- System skanuje Twoją witrynę i wykrywa wszystkie strony
- Po zakończeniu skanowania zobaczysz widok drzewa ze wszystkimi wykrytymi stronami oraz liczbą ich znaków
- Zaznacz lub odznacz strony, aby włączyć je do trenowania lub z niego wykluczyć
- Kliknij Start the Training (Rozpocznij trenowanie), aby rozpocząć trenowanie na wybranych stronach
Jest to pomocne, gdy Twoja witryna zawiera strony, których chatbot nie powinien przyswajać, takie jak ekrany logowania, panele administracyjne lub sekcje niemające znaczenia dla klientów.
Skanowanie wersji językowych witryny
Jeśli Twoja witryna jest dostępna w więcej niż jednym języku, ChatLab wykryje dostępne języki podczas skanowania i pozwoli Ci zdecydować, które z nich uwzględnić w bazie wiedzy chatbota. Elementy sterujące tą funkcją znajdziesz w sekcji Languages (Języki) formularza trenowania, tuż nad Advanced settings (Ustawienia zaawansowane).
Zakres języków
Lista rozwijana Language scope (Zakres języków) określa, jak duża część witryny wielojęzycznej zostanie przeskanowana:
- Main website language (recommended) (Główny język witryny [zalecane]) - opcja domyślna. Skanowany jest tylko główny język witryny. Inne wersje językowe są pomijane. Pozwala to zachować zwięzłe, uporządkowane dane treningowe i zużywa mniej Twojego limitu trenowania.
- All languages (Wszystkie języki) - skanuje każdą wersję językową witryny. Zbiera wszystkie zlokalizowane strony, ale gromadzi więcej treści i zużywa większą część Twojego limitu trenowania.
- Selected language (Wybrany język) - skanuje jeden konkretny język wybrany spośród wykrytych na stronie.
ChatLab automatycznie wykrywa język główny Twojej witryny i ustawia go jako domyślny. Gdy wybierzesz Selected language, wykryty język główny jest wstępnie zaznaczony i oznaczony na liście jako "main". Możesz go zmienić na dowolny inny wykryty język.
Wykrywanie języka jest dostępne w każdym planie, w tym w planie FREE. W planie FREE język strony jest nadal wykrywany, a skanowany jest tylko język główny, chyba że przełączysz zakres na All languages.
Metoda wykrywania języka
Gdy zakres jest ustawiony na Main website language lub Selected language, za pomocą listy rozwijanej Language detection method (Metoda wykrywania języka) możesz wybrać, w jaki sposób ChatLab ma rozpoznawać wersje językowe na Twojej stronie:
- Hreflang attributes (recommended) (Atrybuty hreflang [zalecane]) - opcja domyślna. Wykorzystuje znaczniki
hreflangilang, które większość wielojęzycznych witryn ma już wdrożone, aby łączyć ze sobą swoje wersje językowe. - URL path prefix (/en/, /de/, ...) (Prefiks ścieżki URL [/en/, /de/, ...]) - dla stron, które umieszczają poszczególne języki w segmencie ścieżki, takim jak
/en/,/de/lub/fr/, bez żadnych znacznikówhreflang.
Jeśli ChatLab nie może wykryć języków automatycznie, nadal możesz przeskanować język główny lub wszystkie języki. Jeśli wybierzesz Selected language, najpierw wprowadź adres swojej witryny w polach powyżej, a następnie wybierz tę opcję ponownie, aby strona mogła zostać przeanalizowana.
Przegląd tego, jak chatbot korzysta z poszczególnych wersji językowych podczas odpowiadania, znajdziesz w artykułach Wielojęzyczne chatboty oraz Konfiguracja języków chatbota. Opisane tam tryby językowe bazy wiedzy opierają się na źródłach, które przeskanowano z włączonym wykrywaniem języka, dlatego starsze źródła mogą wymagać ponownego wytrenowania, aby w pełni wykorzystać te możliwości.
Ustawienia zaawansowane
Kliknij przycisk Advanced settings w formularzu trenowania, aby uzyskać dostęp do szczegółowych parametrów skanowania.
Ustawienia zaawansowane podzielono na cztery sekcje:
URL Filtering (Filtrowanie adresów URL)
- Include only URLs that contain (Uwzględnij tylko adresy URL zawierające) - skanuj wyłącznie adresy URL pasujące do podanych wzorców (rozdzielane średnikami, np.
/en;/help) - Exclude URLs that contain (Wyklucz adresy URL zawierające) - pomijaj adresy URL pasujące do tych wzorców (np.
/news;/pictures). Popularne ścieżki, takie jak/wp-admin/,/feed/oraz strony koszyka, są domyślnie wykluczone
Query Parameters (Parametry zapytania)
- Ignore all query parameters (Ignoruj wszystkie parametry zapytania) - traktuj adresy URL z różnymi parametrami zapytania jako tę samą stronę (np.
/page?id=1i/page?id=2staną się adresem/page) - Ignore specific query parameters (Ignoruj określone parametry zapytania) - ignoruj tylko wybrane parametry (popularne parametry śledzące, takie jak
utm_source,fbclid,gclid, są ignorowane automatycznie)
Content Filtering (Filtrowanie treści)
- Include element IDs (Uwzględnij identyfikatory elementów) - pobieraj treść wyłącznie z określonych elementów HTML (użyj
#iddla identyfikatorów,.classnamedla klas,[data-id="82874db"]dla elementów o danym atrybucie, rozdzielając je średnikami) - Exclude element IDs (Wyklucz identyfikatory elementów) - pomijaj treść z określonych elementów HTML (np.
footer;header;#navigation;[data-nosnippet]) - Po ustawieniu elementów do uwzględnienia lub wykluczenia pojawiają się dodatkowe przełączniki, które pozwalają określić, czy crawler ma podążać za linkami znalezionymi wewnątrz tych elementów
Scraping Behavior (Zachowanie crawlers)
- Scrape documents (Pobieraj dokumenty) - wyodrębniaj również treść z plików PDF znalezionych w witrynie
- Exclude image links (Wyklucz linki do obrazów) - pomijaj adresy URL obrazów w zbiorze danych trenowania
- Scrape hidden contents (Pobieraj ukrytą zawartość) - dołączaj treść z ukrytych elementów HTML (domyślnie włączone)
- Delay between pages (Opóźnienie między stronami) - dodaj opóźnienie w sekundach między żądaniami kolejnych stron, aby zmniejszyć obciążenie serwera
- Country code (Kod kraju) - kieruj proces pobierania danych przez serwer proxy w określonym kraju (dwuliterowy kod, np.
us)
Powiadomienia e-mail
Przełącznik Email me when training is finished or needs my attention (Powiadom mnie e-mailem, gdy trenowanie się zakończy lub będzie wymagać mojej uwagi) jest domyślnie włączony. Gdy jest aktywny, otrzymasz powiadomienie e-mail, gdy:
- Trenowanie zakończy się pomyślnie
- System będzie wymagać Twojego działania (np. wyboru stron po przeskanowaniu)
- Podczas trenowania wystąpią jakiekolwiek problemy
Adres e-mail do powiadomień możesz zmienić w polu obok przełącznika.
Monitorowanie postępów trenowania
Po rozpoczęciu skanowania przejdź do zakładki Trainings, aby śledzić postępy. Każde zadanie trenowania wyświetla:
- Źródłowy adres URL
- Bieżący status (Scanning links, Awaiting links selection, Training, Training completed)
- Pasek postępu podczas aktywnego skanowania lub trenowania
- Datę ostatniej aktualizacji
Kliknij More details (Więcej szczegółów), aby zobaczyć wszystkie parametry użyte w danym zadaniu trenowania, w tym skonfigurowane ustawienia zaawansowane.
Zarządzanie wytrenowanymi linkami
Po zakończeniu trenowania wszystkie przeskanowane strony pojawią się w zakładce Links. Każdy link zawiera:
- Tytuł strony i adres URL
- Liczbę znaków (rozmiar danych treningowych)
- Status trenowania
- Datę ostatniej aktualizacji
W przypadku każdego linku możesz wybrać:
- Retrain (Trenuj ponownie) - przeskanuj ponownie i zaktualizuj zawartość tej konkretnej strony
- View (Wyświetl) - zobacz dokładną treść pobraną ze strony
- Delete (Usuń) - usuń tę stronę z bazy wiedzy chatbota
Użyj pola wyboru Select all (Zaznacz wszystko) i przycisków działań masowych, aby przetrenować lub usunąć wiele linków jednocześnie.
Przeglądanie przeskanowanej zawartości
Kliknij przycisk View obok dowolnego wytrenowanego linku, aby zobaczyć, jaka dokładnie treść została pobrana z danej strony.
Modal podglądu źródła wyświetla tytuł strony, adres URL, liczbę znaków, datę ostatniej aktualizacji oraz pełny tekst, na którym chatbot został wytrenowany. Pozwala to upewnić się, że pobrano właściwą zawartość, i ułatwia wgląd w bazę wiedzy chatbota.
Powiązane artykuły
- Trenowanie w tle - dowiedz się, jak działa trenowanie w tle
- Ponowne trenowanie chatbota - jak aktualizować chatbota o nowe treści
- Jak ograniczyć liczbę znaków trenowania podczas skanowania witryny - wskazówki dotyczące optymalizacji rozmiaru danych treningowych
- Trenowanie chatbota: podstawy i limity - informacje o limitach danych treningowych