При обучении чатбота на сайте ограничение объема сканируемых данных только самой полезной информацией помогает снизить расход символов, ускоряет обучение и повышает качество ответов за счет концентрации исключительно на релевантном контенте.
В этом руководстве объясняется, как оптимизировать сканирование с помощью раздела Advanced settings (Расширенные настройки) в модальном окне обучения по сайту (Training > Links > Add New Training: Website).
Почему меньший объем данных для обучения может быть лучше
ChatLab использует архитектуру RAG (Retrieval-Augmented Generation). Вместо того чтобы запоминать все содержимое сайта наизусть, искусственный интеллект ищет наиболее релевантные фрагменты информации непосредственно в момент вопроса пользователя и использует их для генерации ответа.
Проблема избытка данных
Больше данных - не всегда значит более качественные ответы. Добавление нерелевантного или дублирующегося контента может нарушить процесс поиска нужной информации:
- RAG оценивает фрагменты контента на предмет релевантности вопросу пользователя. Если ваш сайт содержит много страниц с повторяющимся, нечетким или шаблонным текстом (меню, футеры, пресс-релизы, страницы тегов блога), они снижают качество результатов поиска.
- Когда чатбот извлекает несколько малополезных фрагментов, которые содержат ключевые слова, но лишены полезного контекста, он может генерировать неточные, слишком общие или не относящиеся к теме ответы.
- Например: если в вашем футере на каждой странице есть ссылки вроде «Главная», «Контакты», «Конфиденциальность», «FAQ», бот на вопрос пользователя «Как с вами связаться?» может ответить шаблонным абзацем из футера вместо полезного номера телефона или адреса электронной почты.
Больше пользы, меньше шума = более точные ответы
Сканируя только полезный контент, вы помогаете ИИ находить четкий, конкретный и качественный контекст для каждого вопроса. Сфокусируйтесь на следующих разделах:
- Описания товаров
- Страницы FAQ (Часто задаваемые вопросы)
- Статьи службы поддержки
- Документы с правилами и условиями
- Ключевые посадочные страницы
Используйте Sitemap вместо полного сканирования сайта
Рекомендуется: используйте вариант sitemap (карта сайта) всегда, когда это возможно.
Полное сканирование сайта переходит по всем видимым ссылкам на странице, включая ссылки из футеров, меню и боковых панелей, что часто приводит к сканированию повторяющегося или бесполезного контента. Эти блоки обычно присутствуют на каждой странице и крайне редко содержат уникальную информацию, полезную для ответов в чате.
Используя карту сайта (которая обычно находится по адресу https://yourdomain.com/sitemap.xml), вы:
- Избегаете обхода ненужных страниц (например, юридических документов, ссылок на соцсети, повторяющихся страниц тегов блога)
- Точно контролируете, какие именно URL сканируются
- Предотвращаете случайный перерасход символов из-за меню, футеров и шапок сайта
Обзор расширенных настроек
Чтобы перейти к расширенным настройкам, нажмите Add New Training: Website (Добавить новое обучение: Веб-сайт) на вкладке Training (Обучение), а затем разверните раздел Advanced settings (Расширенные настройки). Настройки разделены на четыре категории:
- URL Filtering (Фильтрация URL) - управление включением или исключением определенных URL
- Query Parameters (Параметры запроса) - обработка параметров URL
- Content Filtering (Фильтрация контента) - фильтрация определенных элементов страницы
- Scraping Behavior (Поведение парсинга) - настройка способов извлечения контента
URL Filtering
Включение только определенных URL
Поле: Advanced Settings > URL Filtering > Include only URLs that contain (Включать только URL, содержащие)
Добавьте ключевые слова, разделенные точкой с запятой, чтобы включить в сканирование только определенные URL.
Пример: чтобы сканировать только англоязычные страницы справки:
/en;/help
В этом случае будут сканироваться только те страницы, которые содержат /en или help в адресе URL, что сэкономит символы за счет пропуска нерелевантных разделов.
Исключение нерелевантных URL
Поле: Advanced Settings > URL Filtering > Exclude URLs that contain (Исключать URL, содержащие)
Добавьте ключевые слова, разделенные точкой с запятой, чтобы пропустить такие разделы, как блоги, изображения или новости.
Пример:
/news;/pictures;/press
Это предотвратит сканирование тяжелых по объему, но бесполезных для чатбота разделов, таких как новости или галереи изображений.
Query Parameters
Игнорирование всех параметров запроса
Поле: Advanced Settings > Query Parameters > Ignore all query parameters (Игнорировать все параметры запроса)
Включите этот чекбокс, чтобы обрабатывать URL с различными параметрами запроса как одну и ту же страницу. Это предотвращает сканирование повторяющегося контента.
Игнорирование определенных параметров запроса
Поле: Advanced Settings > Query Parameters > Ignore specific query parameters (Игнорировать определенные параметры запроса)
Добавьте имена параметров, разделенные точкой с запятой, чтобы игнорировать определенные параметры отслеживания или фильтрации.
Пример:
ref;source;campaign;utm_source
В этом случае адреса page.html?ref=email и page.html?ref=social будут распознаваться как один и тот же URL.
Content Filtering
Включение определенных элементов
Поле: Advanced Settings > Content Filtering > Include element IDs (Включить идентификаторы элементов)
Добавьте идентификаторы элементов, разделенные точкой с запятой, чтобы сканировать только определенные части страницы. Используйте #id для идентификаторов элементов, .classname для классов и квадратные скобки для атрибутов: [data-id="82874db"] находит элементы с точно таким значением атрибута, а [data-content] находит любой элемент, содержащий данный атрибут.
Пример:
#main-content;.article-body;[data-section="product"]
Будут отсканированы только основная область контента, тело статьи и блоки с товарами, а все остальное будет проигнорировано.
Переход по ссылкам только внутри включенных элементов
Поле: Advanced Settings > Content Filtering > Follow only links in included elements (Переходить по ссылкам только во включенных элементах)
Этот переключатель появляется, когда вы заполняете поле Include element IDs. При его включении краулер будет переходить только по тем ссылкам, которые находятся внутри включенных элементов. Это полезно, если вы хотите ограничить обход конкретными разделами сайта, например областью статей, игнорируя навигационные меню в шапке или футере.
По умолчанию: выключено (краулер переходит по всем ссылкам на странице)
Исключение элементов страницы
Поле: Advanced Settings > Content Filtering > Exclude element IDs (Исключить идентификаторы элементов)
Позволяет предотвратить сканирование шапок, футеров и других элементов разметки. Используется тот же синтаксис селекторов: header и footer без префикса, #id, .classname или атрибут в квадратных скобках, например [data-id="82874db"] или [data-nosnippet]. Селекторы атрибутов удобны, когда у исключаемого элемента нет постоянного id или класса, но есть атрибут data-*, который можно скопировать из инструментов разработчика в браузере.
Пример:
header;footer;#navigation;.sidebar;[data-nosnippet]
Это удаляет блоки HTML, которые повторяются на каждой странице и обычно не несут никакой полезной информации для чатбота.
Переход по ссылкам в исключенных элементах
Поле: Advanced Settings > Content Filtering > Follow links in excluded elements (Переходить по ссылкам в исключенных элементах)
Этот переключатель появляется, когда вы заполняете поле Exclude element IDs. При его включении краулер продолжит переходить по ссылкам, расположенным внутри исключенных элементов (таким как навигационные меню в шапке), даже если сам их контент исключен из обучения.
По умолчанию: выключено (ссылки в исключенных элементах игнорируются)
Сценарий использования: включайте эту опцию, когда хотите исключить текст шапки или футера из обучения, но при этом краулеру необходимо находить новые страницы через навигационные ссылки в этих блоках. Так вы получаете лучшее из двух вариантов: чистые данные для обучения без лишних меню при сохранении полного обхода сайта.
Важно: если вы используете полное сканирование сайта и исключаете такие элементы, как header, не включив переключатель «Follow links in excluded elements», сканер может не обнаружить ссылки на более глубокие страницы (поскольку меню часто находятся внутри header). В таком случае либо включите этот переключатель, либо используйте карту сайта как наиболее надежный и эффективный способ.
Scraping Behavior
Парсинг документов
Поле: Advanced Settings > Scraping Behavior > Scrape documents (Парсить документы)
При включении система извлекает и обрабатывает содержимое документов, найденных на сайте. В настоящее время поддерживаются файлы PDF.
Исключение ссылок на изображения
Поле: Advanced Settings > Scraping Behavior > Exclude image links (Исключать ссылки на изображения)
Включите этот переключатель, чтобы исключить все ссылки на изображения из набора данных для обучения. По умолчанию система извлекает все ссылки на изображения, что может существенно увеличить расход символов.
Активация этой опции позволяет заметно сократить объем используемых символов.
Парсинг скрытого контента
Поле: Advanced Settings > Scraping Behavior > Scrape hidden contents (Парсить скрытое содержимое)
Если опция включена (по умолчанию), система извлекает контент из скрытых HTML-элементов (элементов с CSS-свойствами display:none, visibility:hidden или аналогичными).
По умолчанию: включено
Когда отключать: отключите эту опцию, чтобы пропустить скрытый контент и собирать данные только с видимых элементов. Это полезно, если на сайте есть скрытые блоки:
- Свернутые секции аккордеонов
- Контент только для мобильных устройств или только для компьютеров
- Скрытые поля форм
- Комментарии разработчиков или отладочная информация
Отключение этой функции позволяет уменьшить количество символов и предотвратить попадание нерелевантного скрытого контента в данные для обучения.
Задержка между страницами
Поле: Advanced Settings > Scraping Behavior > Delay between pages (Задержка между страницами)
Добавьте задержку (в секундах) между сканированием страниц, чтобы избежать перегрузки вашего сервера. Полезно для сайтов с ограничением частоты запросов (rate limiting).
Имитация посещения из определенной страны
Поле: Advanced Settings > Scraping Behavior > Country code (Код страны)
Если ваш сайт отображает разный контент в зависимости от местоположения посетителя, укажите двухбуквенный код страны (например, US, PL, DE), чтобы имитировать сканирование из этой локации.
Рекомендуемая конфигурация для большинства сайтов
Для большинства веб-сайтов следующая конфигурация обеспечивает оптимальный баланс между полнотой информации и экономией символов:
- Используйте sitemap, если она доступна, для точного контроля URL
- Exclude element IDs:
header;footer;#navigation;.sidebar - Включите «Exclude image links», чтобы убрать ссылки на изображения из обучения
- Отключите «Scrape hidden contents», если на вашем сайте много скрытых элементов
- Рассмотрите включение «Follow links in excluded elements», если используете полное сканирование с исключенными шапками
Такая настройка обычно сокращает количество символов на 20-40%, сохраняя при этом всю ценную информацию.
Итоги: рекомендации
- Используйте sitemap вместо полного сканирования для точного контроля
- Включайте нужные URL, чтобы собирать только ценный контент
- Исключайте лишние URL, чтобы пропускать нерелевантные или перегруженные страницы
- Игнорируйте параметры запроса, чтобы избежать дублирования контента
- Исключайте идентификаторы элементов, чтобы удалить повторяющиеся части страниц, такие как шапки и футеры
- Управляйте переходом по ссылкам с помощью опций «Follow only links in included elements» или «Follow links in excluded elements» для точной настройки обхода
- Исключайте ссылки на изображения, чтобы существенно сократить объем символов
- Отключайте парсинг скрытого контента, если на сайте есть ненужные скрытые блоки
- Фокусируйтесь на полезной информации для вашего бота (FAQ, страницы товаров, статьи поддержки)