Добавление источников в виде веб-сайтов позволяет вашему чатботу обучаться напрямую на материалах вашего сайта. Будь то информация о товарах, разделы FAQ или статьи в блоге, сканирование сайта гарантирует, что чатбот сможет предоставлять точные и актуальные ответы на основе реального контента ваших страниц.
Где найти обучение по веб-сайту
Выберите своего чатбота, затем перейдите на вкладку Training (Обучение). В левой боковой панели выберите Links (Ссылки). Здесь вы управляете всеми источниками обучения на основе веб-сайтов.
Нажмите Add New Training: Website (Добавить новое обучение: Веб-сайт), чтобы открыть форму настройки обучения.
Варианты сканирования
Форма настройки обучения предлагает два способа добавления контента сайта, разделенных блоком OR (ИЛИ).
Scan website contents (Сканировать содержимое сайта) - введите URL в поле Address (Адрес) и выберите один из вариантов:
- Whole website (Весь веб-сайт) - сканирует все доступные страницы, начиная с указанного вами URL
- Single address (Один адрес) - сканирует только конкретную введенную страницу
Use sitemap (Использовать карту сайта) - введите URL вашей карты сайта (например, https://www.yourdomain.com/sitemap.xml) в поле Sitemap (Карта сайта). В этом случае сканируются только страницы, перечисленные в файле карты сайта.
При использовании карты сайта поле Address автоматически отключается (и наоборот), так как в рамках одной задачи обучения можно использовать только один метод.
Обучение по всему сайту
- Введите корневой URL вашего сайта в поле Address (например,
https://www.yourdomain.com) - В выпадающем списке под полем адреса выберите Whole website
- Нажмите Start scanning the website (Начать сканирование сайта)
Система начнет сканирование вашего сайта, переходя по ссылкам для обнаружения всех страниц. Вы можете отслеживать прогресс на вкладке Trainings (Обучения), где в реальном времени отображается количество просканированных ссылок и собранных символов обучения.
Обучение по одной странице
- Введите URL конкретной страницы в поле Address (например,
https://www.yourdomain.com/pricing) - В выпадающем списке выберите Single address
- Нажмите Start scanning the website
Это удобно, когда вам нужно добавить в базу знаний чатбота только одну конкретную страницу, например недавно опубликованную статью или обновленный раздел FAQ.
Обучение по карте сайта
- Введите URL вашей карты сайта в поле Sitemap (например,
https://www.yourdomain.com/sitemap.xml) - Нажмите Start scanning the website
Сканирование по карте сайта дает точный контроль над тем, какие страницы попадут в базу, поскольку обрабатываются только адреса, указанные в файле sitemap.
Выбор отдельных страниц для обучения
Перед запуском сканирования вы можете включить переключатель I want to select individual urls for training after scanning the website (Я хочу выбрать отдельные URL для обучения после сканирования сайта). Эта опция доступна только при сканировании всего сайта (не для режима одной страницы).
При включении этой опции:
- Система сканирует ваш сайт и находит все страницы
- После завершения сканирования вы увидите древовидный список всех обнаруженных страниц с количеством символов на каждой
- Отметьте нужные страницы галочками или снимите их, чтобы включить или исключить материалы из обучения
- Нажмите Start the Training (Начать обучение), чтобы запустить процесс по выбранным страницам
Это полезно, если на вашем сайте есть разделы, по которым чатботу обучаться не нужно: страницы входа, панель администратора или неактуальные служебные страницы.
Сканирование языковых версий сайта
Если ваш сайт опубликован на нескольких языках, ChatLab определяет доступные языки в процессе сканирования и позволяет выбрать, какие из них следует включить в базу знаний чатбота. Эти параметры находятся в разделе Languages (Языки) формы обучения, непосредственно над блоком Advanced settings (Расширенные настройки).
Охват языков
Выпадающий список Language scope (Охват языков) управляет тем, какая часть многоязычного сайта будет просканирована:
- Main website language (recommended) (Основной язык сайта (рекомендуется)) - вариант по умолчанию. Сканируется только основной язык сайта, остальные языковые версии пропускаются. Это позволяет сохранить обучающие данные компактными и экономит лимит символов.
- All languages (Все языки) - сканирует все языковые версии сайта. Это охватывает все локализованные страницы, но собирает больше контента и расходует больше лимита обучения.
- Selected language (Выбранный язык) - сканирует один определенный язык, выбранный вами из числа обнаруженных на сайте.
ChatLab автоматически определяет основной язык вашего сайта и использует его по умолчанию. При выборе варианта Selected language определенный основной язык выбирается предварительно и помечается в списке как «main». Вы можете изменить его на любой другой обнаруженный язык.
Определение языка доступно на всех тарифах, включая бесплатный план. На бесплатном плане язык страниц также определяется, но сканируется только основной язык, если вы вручную не переключите охват на All languages.
Метод определения языка
Когда охват установлен на Main website language или Selected language, вы можете выбрать способ распознавания языковых версий с помощью выпадающего списка Language detection method (Метод определения языка):
- Hreflang attributes (recommended) (Атрибуты hreflang (рекомендуется)) - вариант по умолчанию. Использует разметку
hreflangиlang, которую большинство многоязычных сайтов уже применяет для связывания своих языковых версий. - URL path prefix (/en/, /de/, ...) (Префикс пути URL (/en/, /de/, ...)) - для сайтов, где каждый язык вынесен в отдельный сегмент пути, например
/en/,/de/или/fr/, без использования разметкиhreflang.
Если ChatLab не удается определить языки автоматически, вы по-прежнему можете запустить сканирование основного языка или всех языков. Если вы хотите использовать Selected language, сначала укажите адрес сайта в верхних полях, а затем снова выберите эту опцию, чтобы сайт был проанализирован.
Подробнее о том, как чатбот использует языковые версии при формировании ответов, читайте в статьях Многоязычные чатботы и Настройка языка чатбота. Описанные там режимы базы знаний работают на основе источников, просканированных с распознаванием языков, поэтому более старые источники может потребоваться переобучить.
Расширенные настройки
Нажмите кнопку Advanced settings (Расширенные настройки) в форме обучения, чтобы открыть параметры тонкой настройки сканирования.
Расширенные настройки разделены на четыре секции:
URL Filtering (Фильтрация URL)
- Include only URLs that contain (Включать только URL, содержащие) - сканировать только адреса, соответствующие указанным шаблонам (через точку с запятой, например
/en;/help) - Exclude URLs that contain (Исключать URL, содержащие) - пропускать адреса, содержащие указанные фрагменты (например,
/news;/pictures). Стандартные шаблоны вроде/wp-admin/,/feed/и страниц корзины исключаются по умолчанию
Query Parameters (Параметры запроса)
- Ignore all query parameters (Игнорировать все параметры запроса) - считать адреса с разными параметрами одной страницей (например,
/page?id=1и/page?id=2будут обработаны как/page) - Ignore specific query parameters (Игнорировать определенные параметры запроса) - игнорировать только указанные параметры (стандартные метки аналитики, такие как
utm_source,fbclid,gclid, игнорируются автоматически)
Content Filtering (Фильтрация контента)
- Include element IDs (Включать идентификаторы элементов) - извлекать контент только из определенных HTML-элементов (используйте
#idдля идентификаторов,.classnameдля классов,[data-id="82874db"]для элементов с заданным атрибутом, через точку с запятой) - Exclude element IDs (Исключать идентификаторы элементов) - пропускать контент из определенных HTML-элементов (например,
footer;header;#navigation;[data-nosnippet]) - При указании включаемых или исключаемых элементов появляются дополнительные переключатели, позволяющие настроить, должен ли робот переходить по ссылкам, найденным внутри этих блоков
Scraping Behavior (Поведение парсера)
- Scrape documents (Сканировать документы) - извлекать контент из файлов PDF, обнаруженных на сайте
- Exclude image links (Исключать ссылки на изображения) - не добавлять URL изображений в набор данных для обучения
- Scrape hidden contents (Сканировать скрытое содержимое) - извлекать текст из скрытых HTML-элементов (включено по умолчанию)
- Delay between pages (Задержка между страницами) - пауза в секундах между запросами к страницам для снижения нагрузки на сервер
- Country code (Код страны) - выполнять сканирование через прокси-сервер конкретной страны (двухбуквенный код, например
us)
Уведомления по электронной почте
Переключатель Email me when training is finished or needs my attention (Сообщить мне по email, когда обучение завершится или потребует внимания) включен по умолчанию. При активной опции вы получите письмо в следующих случаях:
- Обучение успешно завершено
- Системе требуются ваши действия (например, выбор страниц после сканирования)
- В процессе обучения возникли какие-либо ошибки
Вы можете изменить адрес электронной почты для уведомлений в поле рядом с переключателем.
Отслеживание процесса обучения
После запуска сканирования перейдите на вкладку Trainings (Обучения), чтобы следить за процессом. Для каждой задачи отображаются:
- Исходный URL
- Текущий статус (Scanning links, Awaiting links selection, Training, Training completed)
- Индикатор выполнения во время активного сканирования или обучения
- Дата последнего обновления
Нажмите More details (Подробнее), чтобы просмотреть все параметры конкретной задачи, включая заданные расширенные настройки.
Управление обученными ссылками
После завершения обучения все просканированные страницы появляются на вкладке Links (Ссылки). Для каждой ссылки отображаются:
- Заголовок страницы и URL
- Количество символов (объем обучающих данных)
- Статус обучения
- Дата последнего обновления
Для каждой ссылки доступны действия:
- Retrain (Обучить повторно) - заново просканировать и обновить содержимое конкретной страницы
- View (Просмотр) - посмотреть точный текст, который был извлечен со страницы
- Delete (Удалить) - удалить страницу из базы знаний чатбота
Используйте чекбокс Select all (Выбрать все) и кнопки массовых действий, чтобы повторно обучить или удалить несколько ссылок одновременно.
Просмотр просканированного контента
Нажмите кнопку View рядом с любой обученной ссылкой, чтобы увидеть, какой именно контент был извлечен с этой страницы.
В окне просмотра отображаются заголовок страницы, URL, количество символов, дата обновления и полный текст, на котором обучался чатбот. Это позволяет проверить корректность собранных данных и точно знать, какая информация хранится в базе знаний.
Похожие статьи
- Обучение в фоновом режиме - узнайте, как работает фоновое обучение
- Повторное обучение чатбота - как обновлять базу знаний чатбота свежими материалами
- Как уменьшить количество символов обучения при сканировании сайта - советы по оптимизации объема данных
- Обучение чатбота: основы и лимиты - информация о лимитах обучающих данных