Когато обучавате своя чатбот върху уебсайт, ограничаването на обема на сканираните данни до най-полезните помага за намаляване на използването на символи, ускорява обучението и подобрява качеството на отговорите, като се фокусира само върху съдържание с реална стойност.
Това ръководство обяснява как да оптимизирате сканирането чрез Advanced settings (Разширени настройки) в модала за обучение на уебсайт (Training > Links > Add New Training: Website).
Защо по-малкото обучение може да бъде по-добро
ChatLab използва архитектура RAG (Retrieval-Augmented Generation). Вместо да запаметява цялото съдържание на уебсайта, изкуственият интелект търси най-подходящите фрагменти информация към момента на всеки потребителски въпрос и ги използва за генериране на отговор.
Проблемът с твърде многото данни
Повече данни не винаги означава по-добри отговори. Добавянето на нерелевантно или излишно съдържание може да обърка процеса на извличане:
- RAG оценява фрагментите от съдържание според тяхната уместност спрямо въпроса на потребителя. Ако Вашият сайт съдържа много страници с повтарящ се, неясен или общ текст (менюта, долни колонтитули, съобщения за пресата, страници с етикети на блогове), те размиват качеството на резултатите от търсенето.
- Когато чатботът извлече множество фрагменти с ниска стойност, които съдържат същите ключови думи, но нямат полезен контекст, той може да генерира неточни, прекалено общи или отклоняващи се от темата отговори.
- Например: ако Вашият долен колонтитул съдържа връзки като "Начало", "Контакти", "Поверителност", "ЧЗВ" на всяка страница, ботът може да отговори с общ параграф от долния колонтитул вместо с полезен телефонен номер или имейл, когато потребителят попита "Как мога да се свържа с вас?".
Повече сигнал, по-малко шум = по-добри отговори
Чрез сканиране само на полезно съдържание помагате на AI да извлича ясен, конкретен и висококачествен контекст за всеки въпрос. Фокусирайте се върху:
- Описания на продукти
- Страници с ЧЗВ
- Помощни статии
- Документи с политики и общи условия
- Ключови целеви страници
Използвайте карта на сайта (sitemap) вместо пълно сканиране на сайта
Препоръчително: Използвайте опцията sitemap, когато е възможно.
Пълното сканиране на уебсайта проследява всички видими връзки на страницата, включително връзки от долни колонтитули, менюта и странични ленти, което често води до сканиране на повтарящо се или безполезно съдържание. Тези раздели обикновено присъстват на всяка страница и рядко съдържат уникална информация, полезна за отговорите в чата.
Чрез използването на карта на сайта (обикновено намираща се на адрес https://yourdomain.com/sitemap.xml), Вие:
- Избягвате обхождането на ненужни страници (напр. правни страници, връзки към социални мрежи, повтарящи се етикети на блогове)
- Контролирате точно кои URL адреси да бъдат сканирани
- Предотвратявате случайно преразходване на символи от менюта, долни колонтитули и заглавни части
Преглед на Advanced settings (Разширени настройки)
За достъп до разширените настройки кликнете върху Add New Training: Website (Добави ново обучение: Уебсайт) в раздела Training, след което разгънете раздела Advanced settings. Настройките са организирани в четири категории:
- URL Filtering (Филтриране на URL адреси) - Контрол кои URL адреси да бъдат включени или изключени
- Query Parameters (Параметри на заявката) - Обработка на URL параметри
- Content Filtering (Филтриране на съдържанието) - Филтриране на конкретни елементи от страницата
- Scraping Behavior (Поведение при извличане) - Конфигуриране на начина на извличане на съдържанието
URL Filtering
Включване само на конкретни URL адреси
Поле: Advanced Settings > URL Filtering > Include only URLs that contain (Включвай само URL, съдържащи)
Добавете ключови думи, разделени с точка и запетая, за да включите само определени URL адреси в сканирането.
Пример: За да сканирате само помощни страници на английски език:
/en;/help
Това сканира само страници, съдържащи /en или help в URL адреса, спестявайки символи чрез пропускане на нерелевантните раздели.
Изключване на нерелевантни URL адреси
Поле: Advanced Settings > URL Filtering > Exclude URLs that contain (Изключвай URL, съдържащи)
Добавете ключови думи, разделени с точка и запетая, за да пропуснете раздели като блогове, изображения или новини.
Пример:
/news;/pictures;/press
Това предотвратява сканирането на тежки откъм съдържание, но неподходящи за чатбота раздели като новини или галерии с изображения.
Query Parameters
Игнориране на всички параметри на заявката
Поле: Advanced Settings > Query Parameters > Ignore all query parameters (Игнорирай всички параметри на заявката)
Поставете отметка в това квадратче, за да се третират URL адреси с различни параметри на заявката като една и съща страница. Това предотвратява сканирането на дублиращо се съдържание.
Игнориране на конкретни параметри на заявката
Поле: Advanced Settings > Query Parameters > Ignore specific query parameters (Игнорирай конкретни параметри на заявката)
Добавете имена на параметри, разделени с точка и запетая, за да игнорирате конкретни параметри за проследяване или филтриране.
Пример:
ref;source;campaign;utm_source
Това третира page.html?ref=email и page.html?ref=social като един и същ URL адрес.
Content Filtering
Включване на конкретни елементи
Поле: Advanced Settings > Content Filtering > Include element IDs (Включи идентификатори на елементи)
Добавете идентификатори на елементи, разделени с точка и запетая, за да сканирате само конкретни части от страницата. Използвайте #id за идентификатори на елементи, .classname за класове и квадратни скоби за атрибути: [data-id="82874db"] съответства на елементи с точно тази стойност на атрибута, а [data-content] съответства на всеки елемент, който съдържа този атрибут.
Пример:
#main-content;.article-body;[data-section="product"]
Това сканира само основната зона със съдържание, телата на статиите и продуктовите раздели, като игнорира всичко останало.
Проследяване само на връзки във включените елементи
Поле: Advanced Settings > Content Filtering > Follow only links in included elements (Проследявай само връзки във включените елементи)
Този превключвател се появява, когато посочите Include element IDs. Когато е активиран, роботът ще проследява само връзки, намерени във включените елементи. Това е полезно, когато искате да ограничите обхождането до конкретни раздели на уебсайта, като например зоните със съдържание на статиите, като същевременно игнорирате навигационните менюта в горния или долния колонтитул.
По подразбиране: Деактивирано (проследяват се всички връзки на страницата)
Изключване на елементи от страницата
Поле: Advanced Settings > Content Filtering > Exclude element IDs (Изключи идентификатори на елементи)
Предотвратете сканирането на заглавни части, долни колонтитули и други елементи на оформлението. Прилага се същият синтаксис за селектори: header и footer без префикс, #id, .classname или атрибут в квадратни скоби като [data-id="82874db"] или [data-nosnippet]. Селекторите на атрибути са удобни, когато елементът, който искате да премахнете, няма постоянен id или клас, но съдържа data-* атрибут, който можете да копирате от инструментите за разработчици на браузъра.
Пример:
header;footer;#navigation;.sidebar;[data-nosnippet]
Това премахва HTML блокове, които се повтарят на всяка страница и обикновено не съдържат полезна информация за Вашия чатбот.
Проследяване на връзки в изключените елементи
Поле: Advanced Settings > Content Filtering > Follow links in excluded elements (Проследявай връзки в изключените елементи)
Този превключвател се появява, когато посочите Exclude element IDs. Когато е активиран, роботът ще продължи да проследява връзките, намерени в изключените елементи (като навигационни менюта в горните колонтитули), въпреки че самото им съдържание е изключено от обучението.
По подразбиране: Деактивирано (връзките в изключените елементи не се проследяват)
Случай на употреба: Активирайте това, когато искате да изключите съдържанието на горния/долния колонтитул от обучението, но все пак е необходимо роботът да открива страници чрез навигационните връзки в тези зони. Това Ви дава най-доброто от двата свята: чисти данни за обучение без излишен шум от менютата, като същевременно обхожда целия Ви сайт.
Важно: Ако използвате пълно сканиране на уебсайта и изключите елементи като header, без да активирате "Follow links in excluded elements", скенерът може да не открие по-дълбоките връзки (менютата често се намират вътре в заглавните части). В такъв случай или активирайте превключвателя, или използвайте sitemap като най-сигурния и ефективен метод.
Scraping Behavior
Извличане на документи
Поле: Advanced Settings > Scraping Behavior > Scrape documents (Извличай документи)
Когато е активирано, системата извлича и обработва съдържанието на документи, намерени на уебсайта. В момента се поддържат PDF файлове.
Изключване на връзки към изображения
Поле: Advanced Settings > Scraping Behavior > Exclude image links (Изключи връзки към изображения)
Активирайте този превключвател, за да изключите всички връзки към изображения от набора от данни за обучение. По подразбиране системата извлича всички връзки към изображения, което може значително да увеличи броя на символите.
Активирането на тази опция може значително да намали използвания брой символи.
Извличане на скрито съдържание
Поле: Advanced Settings > Scraping Behavior > Scrape hidden contents (Извличай скрито съдържание)
Когато е активирано (по подразбиране), системата извлича съдържание от скрити HTML елементи (елементи с display:none, visibility:hidden или подобни CSS свойства).
По подразбиране: Активирано
Кога да се деактивира: Деактивирайте тази опция, за да пропуснете скритото съдържание и да извличате само видимите елементи. Това е полезно, когато уебсайтовете съдържат скрито съдържание като:
- Свити секции тип акордеон
- Съдържание само за мобилни или само за настолни устройства
- Скрити полета във формуляри
- Коментари на разработчици или информация за отстраняване на грешки
Деактивирането на това може да намали броя на символите и да предотврати навлизането на нерелевантно скрито съдържание във Вашите данни за обучение.
Забавяне между страниците
Поле: Advanced Settings > Scraping Behavior > Delay between pages (Забавяне между страниците)
Добавете забавяне (в секунди) между сканирането на всяка страница, за да предотвратите претоварване на Вашия сървър. Полезно за уебсайтове с ограничения на честотата на заявките (rate limiting).
Симулиране на посещение от конкретна държава
Поле: Advanced Settings > Scraping Behavior > Country code (Код на държава)
Ако Вашият сайт показва различно съдържание в зависимост от местоположението на посетителя, въведете двубуквен код на държава (напр. US, PL, DE), за да симулирате сканиране от това местоположение.
Препоръчителна конфигурация за повечето уебсайтове
За повечето уебсайтове следната конфигурация осигурява най-добрия баланс между изчерпателно съдържание и намален брой символи:
- Използвайте sitemap, когато е наличен, за прецизен контрол върху URL адресите
- Exclude element IDs:
header;footer;#navigation;.sidebar - Активирайте "Exclude image links", за да премахнете URL адресите на изображения от обучението
- Деактивирайте "Scrape hidden contents", ако сайтът Ви съдържа много скрити елементи
- Обмислете "Follow links in excluded elements", ако използвате пълно сканиране с изключени заглавни части
Тази конфигурация обикновено намалява броя на символите с 20-40%, като същевременно запазва цялото ценно съдържание.
Обобщение: добри практики
- Използвайте sitemap вместо пълно сканиране за прецизен контрол
- Включвайте определени URL адреси, за да насочите бота само към ценно съдържание
- Изключвайте URL адреси, за да пропуснете нерелевантни или тежки страници
- Игнорирайте параметрите на заявката, за да избегнете дублиращо се съдържание
- Изключвайте идентификатори на елементи, за да премахнете повтарящи се части от страниците като горни и долни колонтитули
- Контролирайте проследяването на връзки чрез "Follow only links in included elements" или "Follow links in excluded elements" за прецизен контрол върху обхождането
- Изключвайте връзките към изображения, за да намалите значително броя на символите
- Деактивирайте извличането на скрито съдържание, ако сайтът Ви съдържа ненужни скрити елементи
- Фокусирайте се върху полезно съдържание за Вашия бот (ЧЗВ, продуктови страници, помощни статии)