Центр допомоги
Навчання вашого чатбота

Додавання нових джерел вебсайту

Останнє оновлення:

Додавання вебсайтів як джерел дозволяє вашому чатботу навчатися безпосередньо на вмісті вашого сайту. Незалежно від того, чи це інформація про товари, сторінки FAQ або публікації в блозі, сканування вашого сайту гарантує, що чатбот зможе надавати точні й актуальні відповіді на основі реального контенту вашого ресурсу.

Де знайти навчання на вебсайті

Виберіть свого чатбота, а потім перейдіть на вкладку Training (Навчання). На бічній панелі ліворуч виберіть Links (Посилання). Тут ви можете керувати всіма джерелами навчання на основі вебсайтів.

Натисніть Add New Training: Website (Додати нове навчання: Вебсайт), щоб відкрити форму навчання.

Список посилань для навчання з виділеною кнопкою Add New Training

Варіанти сканування

Форма навчання пропонує два способи додавання вмісту вебсайту, розділені позначкою OR (АБО).

Scan website contents (Сканувати вміст вебсайту) - введіть URL-адресу в поле Address (Адреса) та виберіть один із варіантів:

  • Whole website (Весь вебсайт) - сканує всі доступні для виявлення сторінки, починаючи з указаної вами URL-адреси
  • Single address (Окрема адреса) - сканує лише конкретну сторінку, яку ви вказали

Use sitemap (Використати мапу сайту) - введіть URL-адресу вашої мапи сайту (наприклад, https://www.yourdomain.com/sitemap.xml) у поле Sitemap (Мапа сайту). У цьому разі скануються лише сторінки, перелічені у файлі мапи сайту.

Якщо використовується мапа сайту, поле Address автоматично вимикається (і навпаки), оскільки для одного завдання навчання можна застосувати лише один метод.

Модальне вікно нового навчання з полями Address, випадаючим списком режимів сканування та опцією sitemap

Навчання на всьому вебсайті

  1. Введіть кореневу URL-адресу вашого сайту в поле Address (наприклад, https://www.yourdomain.com)
  2. Виберіть Whole website у випадаючому списку під полем адреси
  3. Натисніть Start scanning the website (Почати сканування вебсайту)

Система просканує ваш вебсайт, переходячи за посиланнями для виявлення всіх сторінок. Ви можете стежити за прогресом на вкладці Trainings (Навчання), де в реальному часі відображатимуться кількість просканованих посилань і зібрані символи для навчання.

Модальне вікно нового навчання з виділеною кнопкою Start scanning the website

Навчання на одній сторінці

  1. Введіть URL-адресу конкретної сторінки в поле Address (наприклад, https://www.yourdomain.com/pricing)
  2. Виберіть Single address у випадаючому списку
  3. Натисніть Start scanning the website

Це зручно, коли вам потрібно додати до бази знань вашого чатбота лише одну конкретну сторінку - наприклад, щойно опубліковану статтю або оновлену сторінку FAQ.

Навчання за допомогою мапи сайту

  1. Введіть URL-адресу вашої мапи сайту в поле Sitemap (наприклад, https://www.yourdomain.com/sitemap.xml)
  2. Натисніть Start scanning the website

Сканування за мапою сайту забезпечує точний контроль над тим, які саме сторінки буде додано, оскільки обробляються лише URL-адреси, зазначені у вашому файлі sitemap.

Вибір окремих сторінок для навчання

Перед початком сканування ви можете ввімкнути перемикач I want to select individual urls for training after scanning the website (Я хочу вибрати окремі URL-адреси для навчання після сканування вебсайту). Ця опція доступна лише під час сканування всього вебсайту (і недоступна для режиму окремої адреси).

Якщо перемикач увімкнено:

  1. Система сканує ваш вебсайт і виявляє всі сторінки
  2. Після завершення сканування з'являється деревоподібний список усіх знайдених сторінок із кількістю символів у кожній із них
  3. Позначте або зніміть прапорці зі сторінок, щоб додати їх до навчання або виключити з нього
  4. Натисніть Start the Training (Почати навчання), щоб розпочати навчання на вибраних сторінках

Це корисно, коли на вашому вебсайті є сторінки, на яких чатботу не потрібно навчатися: сторінки входу, розділи панелі керування або нерелевантний вміст.

Сканування мов вебсайту

Якщо ваш вебсайт опубліковано кількома мовами, ChatLab виявляє доступні мови під час сканування й дозволяє вирішити, які з них слід включити до бази знань чатбота. Ці налаштування розташовані в розділі Languages (Мови) форми навчання, над пунктом Advanced settings (Розширені налаштування).

Розділ Languages форми навчання з параметрами вибору мовного обсягу та методу розпізнавання

Обсяг сканування мов

Випадаючий список Language scope (Обсяг мов) визначає, яку частину багатомовного сайту буде проскановано:

  • Main website language (recommended) (Основна мова вебсайту (рекомендовано)) - варіант за замовчуванням. Сканується лише основна мова сайту. Інші мовні версії пропускаються. Це зберігає ваші дані для навчання лаконічними й точними, а також економить ліміт навчання.
  • All languages (Усі мови) - сканує кожну мовну версію сайту. Це дає змогу зібрати всі ваші локалізовані сторінки, проте накопичує більше контенту та використовує більше ліміту навчання.
  • Selected language (Вибрана мова) - сканує лише одну вибрану мову з-поміж тих, які було виявлено на сайті.

ChatLab автоматично визначає основну мову вашого сайту й використовує її за замовчуванням. Якщо вибрати Selected language, виявлена основна мова буде вибрана автоматично та позначена як "main" у списку. Ви можете змінити її на будь-яку іншу виявлену мову.

Виявлення мов доступне на всіх планах, включно з планом FREE. На плані FREE мова сторінки все одно визначається, і сканується лише основна мова, якщо ви не зміните обсяг на All languages.

Метод виявлення мови

Якщо в обсязі сканування встановлено значення Main website language або Selected language, ви можете вибрати спосіб розпізнавання мовних версій на сайті за допомогою випадаючого списку Language detection method (Метод виявлення мови):

  • Hreflang attributes (recommended) (Атрибути hreflang (рекомендовано)) - варіант за замовчуванням. Використовує розмітку hreflang і lang, яку більшість багатомовних сайтів уже має для зв'язування своїх мовних версій.
  • URL path prefix (/en/, /de/, ...) (Префікс шляху URL (/en/, /de/, ...)) - для сайтів, де кожна мова винесена в окремий сегмент шляху, наприклад /en/, /de/ або /fr/, без розмітки hreflang.

Якщо ChatLab не вдається виявити мови автоматично, ви все одно можете просканувати основну мову або всі мови. Обираючи Selected language, спочатку введіть адресу вебсайту в полях вище, а потім виберіть цю опцію знову, щоб система могла проаналізувати сайт.

Огляд того, як чатбот використовує ці мовні версії під час формування відповідей, див. у статтях Багатомовні чатботи та Налаштування мови чатбота. Описані там мовні режими бази знань спираються на джерела, проскановані з використанням розпізнавання мов, тому старі джерела може знадобитися перевчити для повноцінного використання цих можливостей.

Розширені налаштування

Натисніть кнопку Advanced settings у формі навчання, щоб отримати доступ до точних налаштувань сканування.

Модальне вікно нового навчання з виділеною панеллю Advanced settings

Розширені налаштування поділено на чотири розділи:

URL Filtering (Фільтрація URL-адрес)

  • Include only URLs that contain (Включати лише URL-адреси, що містять) - сканувати тільки ті URL-адреси, які відповідають цим шаблонам (розділяються крапкою з комою, наприклад /en;/help)
  • Exclude URLs that contain (Виключати URL-адреси, що містять) - пропускати URL-адреси, що відповідають цим шаблонам (наприклад, /news;/pictures). Типові шаблони, такі як /wp-admin/, /feed/ і сторінки кошика, за замовчуванням виключаються

Query Parameters (Параметри запиту)

  • Ignore all query parameters (Ігнорувати всі параметри запиту) - вважати сторінки з різними параметрами запиту однією і тією самою сторінкою (наприклад, /page?id=1 і /page?id=2 перетворюються на /page)
  • Ignore specific query parameters (Ігнорувати конкретні параметри запиту) - ігнорувати лише окремі параметри (поширені параметри відстеження на кшталт utm_source, fbclid, gclid ігноруються автоматично)

Content Filtering (Фільтрація вмісту)

  • Include element IDs (Включати ID елементів) - витягувати вміст лише з конкретних елементів HTML (використовуйте #id для ідентифікаторів, .classname для класів, [data-id="82874db"] для елементів із зазначеним атрибутом, через крапку з комою)
  • Exclude element IDs (Виключати ID елементів) - пропускати вміст конкретних елементів HTML (наприклад, footer;header;#navigation;[data-nosnippet])
  • Якщо налаштовано елементи включення або виключення, з'являються додаткові перемикачі, які дозволяють керувати тим, чи повинен краулер переходити за посиланнями всередині цих елементів

Scraping Behavior (Поведінка парсингу)

  • Scrape documents (Парсити документи) - також витягувати вміст із файлів PDF, знайдених на вебсайті
  • Exclude image links (Виключати посилання на зображення) - не додавати URL-адреси зображень до набору даних для навчання
  • Scrape hidden contents (Парсити прихований вміст) - включати вміст із прихованих елементів HTML (увімкнено за замовчуванням)
  • Delay between pages (Затримка між сторінками) - додати затримку в секундах між запитами сторінок для зменшення навантаження на сервер
  • Country code (Код країни) - спрямовувати запити парсингу через проксі-сервер певної країни (дволітерний код, наприклад us)

Сповіщення електронною поштою

Перемикач Email me when training is finished or needs my attention (Надіслати листа, коли навчання завершиться або потребуватиме моєї уваги) увімкнено за замовчуванням. Коли він активний, ви отримуєте сповіщення на електронну пошту, коли:

  • Навчання успішно завершено
  • Системі потрібні ваші дії (наприклад, вибір сторінок після завершення сканування)
  • Під час навчання виникли проблеми

Ви можете змінити адресу електронної пошти для сповіщень у полі поруч із перемикачем.

Відстеження прогресу навчання

Після запуску сканування перейдіть на вкладку Trainings, щоб контролювати прогрес. Для кожного завдання навчання відображається:

  • Вихідна URL-адреса
  • Поточний статус (Scanning links, Awaiting links selection, Training, Training completed)
  • Індикатор прогресу під час активного сканування або навчання
  • Дата останнього оновлення

Вкладка Trainings із завершеним завданням навчання та виділеною назвою вкладки

Натисніть More details (Детальніше), щоб побачити всі параметри конкретного завдання навчання, включно з налаштованими розширеними параметрами.

Розгорнуті деталі завдання навчання з усіма параметрами

Керування посиланнями для навчання

Після завершення навчання всі проскановані сторінки з'являються на вкладці Links. Для кожного посилання відображаються:

  • Заголовок сторінки та її URL-адреса
  • Кількість символів (розмір даних для навчання)
  • Статус навчання
  • Дата останнього оновлення

Для кожного посилання ви можете:

  • Retrain (Перевчити) - повторно просканувати й оновити вміст цієї конкретної сторінки
  • View (Переглянути) - переглянути точний вміст, витягнутий зі сторінки
  • Delete (Видалити) - вилучити цю сторінку з бази знань чатбота

Використовуйте прапорець Select all (Вибрати все) і кнопки групових дій, щоб перевчити або видалити кілька посилань одночасно.

Перегляд просканованого вмісту

Натисніть кнопку View поруч із будь-яким навченим посиланням, щоб переглянути, який саме контент було витягнуто з цієї сторінки.

Список посилань із виділеною кнопкою View

Модальне вікно перегляду джерела містить назву сторінки, її URL-адресу, кількість символів, дату останнього оновлення та повний текст, на якому навчався ваш чатбот. Це допомагає перевірити правильність зібраного контенту та зрозуміти склад бази знань вашого чатбота.

Модальне вікно перегляду джерела з витягнутим вмістом сторінки

Пов'язані статті