Центр допомоги
Навчання вашого чатбота

Як зменшити кількість символів для навчання під час сканування вебсайту

Останнє оновлення:

Під час навчання вашого чатбота на основі вебсайту обмеження обсягу сканованих даних лише найкориснішою інформацією допомагає зменшити витрати символів, прискорює навчання та покращує якість відповідей завдяки концентрації суто на релевантному контенті.

Цей посібник пояснює, як оптимізувати сканування за допомогою розділу Advanced settings (Розширені налаштування) у модальному вікні навчання сайту (Training > Links > Add New Training: Website (Навчання > Посилання > Додати нове навчання: Вебсайт)).


Чому менший обсяг навчання може бути кращим

ChatLab використовує архітектуру RAG (Retrieval-Augmented Generation). Замість запам'ятовування всього контенту вебсайту, штучний інтелект знаходить найбільш релевантні фрагменти інформації безпосередньо під час запитання користувача та використовує їх для формування відповіді.

Проблема із надлишком даних

Більше даних не завжди означає кращі відповіді. Додавання нерелевантного або повторюваного контенту може заплутати процес пошуку:

  • RAG оцінює фрагменти контенту на відповідність запитанню користувача. Якщо ваш сайт містить багато сторінок із повторюваним, нечітким або шаблонним текстом (меню, футери, пресрелізи, сторінки тегів блогу), вони погіршують якість результатів пошуку.
  • Коли чатбот отримує кілька фрагментів низької якості, які містять спільні ключові слова, але позбавлені корисного контексту, він може генерувати неточні, занадто загальні або невідповідні відповіді.
  • Наприклад: якщо ваш футер містить посилання на кшталт "Головна", "Контакти", "Конфіденційність", "FAQ" на кожній сторінці, бот може відповісти загальним абзацом із футера замість надання корисного номера телефону чи електронної пошти, коли користувач запитує "Як із вами зв'язатися?".

Високий рівень корисного сигналу, низький рівень шуму = кращі відповіді

Скануючи лише корисний контент, ви допомагаєте штучному інтелекту знаходити чіткий, конкретний і якісний контекст для кожного запитання. Зосередьтеся на наступному:

  • Описи товарів
  • Сторінки FAQ
  • Статті підтримки
  • Документи з політиками та правилами
  • Ключові цільові сторінки

Використовуйте карту сайту замість повного сканування сайту

Рекомендовано: використовуйте варіант sitemap (карта сайту) завжди, коли це можливо.

Повне сканування вебсайту переходить за всіма видимими посиланнями на сторінці, включно з посиланнями з футерів, меню та бічних панелей, що часто призводить до сканування повторюваного або малокорисного контенту. Ці розділи зазвичай присутні на кожній сторінці й рідко містять унікальну інформацію, корисну для відповідей у чаті.

Використовуючи карту сайту (зазвичай розміщену за адресою https://yourdomain.com/sitemap.xml), ви:

  • Уникаєте сканування непотрібних сторінок (наприклад, юридичних сторінок, посилань на соцмережі, повторюваних тегів блогу)
  • Чітко контролюєте, які саме URL-адреси скануються
  • Запобігаєте випадковому перевитрачанню символів через меню, футери та шапки сайту

Огляд розширених налаштувань

Щоб отримати доступ до розширених налаштувань, натисніть Add New Training: Website на вкладці Training, після чого розгорніть розділ Advanced settings. Налаштування розподілені за чотирма категоріями:

  • URL Filtering (Фільтрація URL) - керування тим, які URL слід включати або виключати
  • Query Parameters (Параметри запиту) - обробка параметрів URL
  • Content Filtering (Фільтрація контенту) - фільтрація окремих елементів сторінки
  • Scraping Behavior (Поведінка скрапінгу) - налаштування способу вилучення контенту

URL Filtering

Параметри фільтрації URL

Включення лише конкретних URL

Поле: Advanced Settings > URL Filtering > Include only URLs that contain (Включати лише URL-адреси, що містять)

Додайте ключові слова, розділені крапкою з комою, щоб включити у сканування лише певні URL-адреси.

Приклад: Щоб сканувати лише англомовні сторінки довідки:

/en;/help

Це сканує лише сторінки, що містять /en або help в URL, заощаджуючи символи шляхом пропуску нерелевантних розділів.

Виключення нерелевантних URL

Поле: Advanced Settings > URL Filtering > Exclude URLs that contain (Виключати URL-адреси, що містять)

Додайте ключові слова, розділені крапкою з комою, щоб пропускати такі розділи, як блоги, зображення або новини.

Приклад:

/news;/pictures;/press

Це дозволяє уникнути сканування розділів із великим обсягом контенту, які не є релевантними для чатбота, наприклад новин або галерей зображень.


Query Parameters

Параметри запиту

Ігнорування всіх параметрів запиту

Поле: Advanced Settings > Query Parameters > Ignore all query parameters (Ігнорувати всі параметри запиту)

Увімкніть цей прапорець, щоб розглядати URL-адреси з різними параметрами запиту як одну й ту саму сторінку. Це запобігає скануванню дубльованого контенту.

Ігнорування конкретних параметрів запиту

Поле: Advanced Settings > Query Parameters > Ignore specific query parameters (Ігнорувати конкретні параметри запиту)

Додайте назви параметрів, розділені крапкою з комою, щоб ігнорувати окремі параметри відстеження або фільтрації.

Приклад:

ref;source;campaign;utm_source

Це розглядає page.html?ref=email та page.html?ref=social як одну й ту саму URL-адресу.


Content Filtering

Параметри фільтрації контенту

Включення конкретних елементів

Поле: Advanced Settings > Content Filtering > Include element IDs (Включити ID елементів)

Додайте ідентифікатори елементів, розділені крапкою з комою, щоб сканувати лише певні частини сторінки. Використовуйте #id для ідентифікаторів елементів, .classname для класів та квадратні дужки для атрибутів: [data-id="82874db"] відповідає елементам із точно таким значенням атрибута, [data-content] відповідає кожному елементу, який взагалі має цей атрибут.

Приклад:

#main-content;.article-body;[data-section="product"]

Це сканує лише область основного вмісту, текст статей і розділи товарів, ігноруючи все інше.

Перехід за посиланнями лише у включених елементах

Поле: Advanced Settings > Content Filtering > Follow only links in included elements (Переходити лише за посиланнями у включених елементах)

Цей перемикач з'являється після того, як ви вкажете значення в полі Include element IDs. Якщо його увімкнено, краулер переходитиме лише за тими посиланнями, які знайдено всередині включених елементів. Це корисно, коли ви бажаєте обмежити сканування певними розділами сайту, наприклад областями статей, ігноруючи навігаційні меню в шапці або футері.

За замовчуванням: вимкнено (перехід здійснюється за всіма посиланнями на сторінці)

Виключення елементів сторінки

Поле: Advanced Settings > Content Filtering > Exclude element IDs (Виключити ID елементів)

Запобігайте скануванню шапок, футерів та інших елементів макета. Застосовується той самий синтаксис селекторів: header та footer без префікса, #id, .classname або атрибут у квадратних дужках, наприклад [data-id="82874db"] чи [data-nosnippet]. Селектори атрибутів зручні, коли елемент, який потрібно вилучити, не має постійного id або класу, але містить атрибут data-*, який можна скопіювати з інструментів розробника у браузері.

Приклад:

header;footer;#navigation;.sidebar;[data-nosnippet]

Це видаляє блоки HTML, які повторюються на кожній сторінці й зазвичай не містять корисної інформації для вашого чатбота.

Перехід за посиланнями у виключених елементах

Поле: Advanced Settings > Content Filtering > Follow links in excluded elements (Переходити за посиланнями у виключених елементах)

Цей перемикач з'являється після того, як ви вкажете значення в полі Exclude element IDs. Якщо його увімкнено, краулер все одно переходитиме за посиланнями, знайденими всередині виключених елементів (наприклад, у навігаційних меню в шапці сайту), навіть якщо сам контент виключено з навчання.

За замовчуванням: вимкнено (перехід за посиланнями у виключених елементах не здійснюється)

Варіант використання: увімкніть цю опцію, коли бажаєте виключити контент шапки чи футера з навчання, але вам все одно потрібно, щоб краулер знаходив сторінки через навігаційні посилання в цих областях. Це дає подвійну перевагу: чисті дані для навчання без зайвого вмісту меню та водночас повне сканування всього вашого сайту.

Важливо: якщо ви використовуєте повне сканування сайту та виключаєте такі елементи, як header, не ввімкнувши опцію "Follow links in excluded elements", сканер може не знайти глибші посилання (меню часто розміщені всередині шапки). У такому разі або увімкніть цей перемикач, або скористайтеся картою сайту як найбільш надійним та ефективним способом.


Scraping Behavior

Параметри поведінки скрапінгу

Скрапінг документів

Поле: Advanced Settings > Scraping Behavior > Scrape documents (Скрапінг документів)

Якщо опцію ввімкнено, система вилучає та обробляє контент документів, знайдених на вебсайті. Наразі підтримуються файли PDF.

Виключення посилань на зображення

Поле: Advanced Settings > Scraping Behavior > Exclude image links (Виключати посилання на зображення)

Увімкніть цей перемикач, щоб виключити всі посилання на зображення з навчального набору даних. За замовчуванням система вилучає всі посилання на зображення, що може суттєво збільшити кількість використаних символів.

Увімкнення цієї опції дозволяє суттєво скоротити обсяг символів.

Скрапінг прихованого контенту

Поле: Advanced Settings > Scraping Behavior > Scrape hidden contents (Скрапінг прихованого контенту)

Якщо опцію ввімкнено (за замовчуванням), система вилучає контент із прихованих елементів HTML (елементів із властивостями display:none, visibility:hidden або схожими властивостями CSS).

За замовчуванням: увімкнено

Коли вимикати: вимикайте цю опцію, щоб пропустити прихований вміст і збирати дані лише з видимих елементів. Це корисно, якщо вебсайти містять такий прихований контент, як:

  • Згорнуті блоки акордеонів
  • Контент лише для мобільних або лише для десктопних пристроїв
  • Приховані поля форм
  • Коментарі розробників або інформацію для налагодження

Вимкнення цієї опції може зменшити кількість символів і запобігти потраплянню нерелевантного прихованого контенту до ваших даних навчання.

Затримка між сторінками

Поле: Advanced Settings > Scraping Behavior > Delay between pages (Затримка між сторінками)

Додайте затримку (у секундах) між скануванням кожної сторінки, щоб уникнути перевантаження вашого сервера. Корисно для сайтів із лімітами на частоту запитів (rate limiting).

Симуляція відвідування з конкретної країни

Поле: Advanced Settings > Scraping Behavior > Country code (Код країни)

Якщо ваш сайт показує різний контент залежно від місцезнаходження відвідувача, введіть 2-буквений код країни (наприклад, US, PL, DE), щоб симулювати сканування з цієї локації.


Рекомендована конфігурація для більшості вебсайтів

Для більшості сайтів наступна конфігурація забезпечує найкращий баланс між повнотою контенту та зменшенням кількості символів:

  1. Використовуйте sitemap, коли вона доступна, для точного контролю URL
  2. Exclude element IDs: header;footer;#navigation;.sidebar
  3. Увімкніть "Exclude image links", щоб видалити посилання на зображення з навчання
  4. Вимкніть "Scrape hidden contents", якщо ваш сайт містить багато прихованих елементів
  5. Розгляньте використання "Follow links in excluded elements", якщо застосовуєте повне сканування з виключеними шапками

Ця конфігурація зазвичай скорочує кількість символів на 20-40%, зберігаючи весь цінний контент.


Підсумок: найкращі практики

  • Використовуйте карту сайту замість повного сканування для точного контролю
  • Застосовуйте включення URL, щоб спрямувати сканування лише на цінний контент
  • Застосовуйте виключення URL, щоб пропускати нерелевантні або перевантажені сторінки
  • Ігноруйте параметри запиту, щоб уникнути появи дублікатів контенту
  • Виключайте ID елементів, щоб прибрати повторювані частини сторінок, такі як шапки та футери
  • Керуйте переходом за посиланнями за допомогою параметрів "Follow only links in included elements" або "Follow links in excluded elements" для детального контролю краулінгу
  • Виключайте посилання на зображення, щоб суттєво зменшити кількість символів
  • Вимикайте скрапінг прихованого контенту, якщо ваш сайт має непотрібні приховані елементи
  • Зосереджуйтеся на корисному контенті для вашого бота (FAQ, сторінки товарів, статті підтримки)