Amikor egy weboldalon trenírozza a chatbotját, a beolvasott adatok mennyiségének a leghasznosabb részekre való korlátozása segít csökkenteni a felhasznált karakterek számát, felgyorsítja a trenírozást, és a válaszok minőségét is javítja azáltal, hogy kizárólag a releváns tartalomra összpontosít.
Ez az útmutató bemutatja, hogyan optimalizálhatja a beolvasást az Advanced settings (Speciális beállítások) használatával a weboldal-trenírozási ablakban (Training > Links > Add New Training: Website).
Miért lehet jobb a kevesebb trenírozás?
A ChatLab RAG (Retrieval-Augmented Generation) architektúrát használ. Ahelyett, hogy a weboldal teljes tartalmát megjegyezné, a mesterséges intelligencia minden egyes felhasználói kérdés feltevésekor megkeresi a leginkább releváns információrészleteket, és ezek alapján állítja össze a választ.
A túl sok adat problémája
A több adat nem mindig jelent jobb válaszokat. A nem releváns vagy feleslegesen ismétlődő tartalmak hozzáadása megzavarhatja a visszakeresési folyamatot:
- A RAG pontozza a tartalomrészleteket a felhasználó kérdéséhez mért relevancia alapján. Ha az Ön webhelye sok olyan oldalt tartalmaz, amelyeken ismétlődő, pontatlan vagy általános szövegek találhatók (menük, láblécek, sajtóközlemények, blogcímke-oldalak), ezek felhígítják a keresési eredmények minőségét.
- Amikor a chatbot több olyan alacsony értékű szövegrészletet kérdez le, amelyek kulcsszavai megegyeznek, de hiányzik belőlük a hasznos kontextus, pontatlan, túlságosan általános vagy a témához nem kapcsolódó válaszokat generálhat.
- Például: Ha a lábléc minden oldalon olyan linkeket tartalmaz, mint a „Kezdőlap”, „Kapcsolat”, „Adatvédelem”, „GYIK”, a bot egy általános láblécrészlettel válaszolhat a hasznos telefonszám vagy e-mail-cím helyett, amikor egy felhasználó megkérdezi: „Hogyan léphetek kapcsolatba Önökkel?”.
Erős jel, kevés zaj = jobb válaszok
Ha kizárólag a hasznos tartalmakat olvassa be, azzal segíti az AI-t abban, hogy minden kérdéshez világos, konkrét és kiváló minőségű kontextust hívjon le. Fókuszáljon az alábbiakra:
- Termékleírások
- GYIK-oldalak
- Támogatási cikkek
- Irányelveket tartalmazó dokumentumok
- Fontos érkezőoldalak (landing page-ek)
Használjon sitemapot a teljes weboldal-beolvasás helyett
Ajánlott: Amikor csak lehetséges, használja a sitemap opciót.
A teljes weboldal-beolvasás az oldalon található összes látható hivatkozást követi, beleértve a láblécekből, menükből és oldalsávokból származó linkeket is, ami gyakran ismétlődő vagy értéktelen tartalmak beolvasásához vezet. Ezek a szakaszok általában minden oldalon megtalálhatók, és ritkán tartalmaznak olyan egyedi információt, amely hasznos lenne a csevegési válaszokhoz.
Egy sitemap (webhelytérkép, amely általában a https://azondomainje.hu/sitemap.xml címen található) használatával Ön:
- Elkerüli a felesleges oldalak (pl. jogi oldalak, közösségimédia-linkek, ismétlődő blogcímkék) feltérképezését
- Pontosan szabályozhatja, hogy mely URL-címeket olvassa be a rendszer
- Megelőzheti a karakterek véletlenszerű túlfogyasztását a menükből, láblécekből és fejlécekből
Az Advanced settings áttekintése
A speciális beállítások eléréséhez kattintson az Add New Training: Website (Új trenírozás hozzáadása: Weboldal) lehetőségre a Training (Trenírozás) lapon, majd nyissa le az Advanced settings (Speciális beállítások) szakaszt. A beállítások négy kategóriába vannak rendezve:
- URL Filtering (URL-szűrés) - A belefoglalni vagy kizárni kívánt URL-ek kezelése
- Query Parameters (Lekérdezési paraméterek) - URL-paraméterek kezelése
- Content Filtering (Tartalomszűrés) - Adott oldalelemek szűrése
- Scraping Behavior (Beolvasási viselkedés) - A tartalom kinyerési módjának konfigurálása
URL Filtering
Csak adott URL-ek belefoglalása
Mező: Advanced Settings > URL Filtering > Include only URLs that contain (Csak az alábbiakat tartalmazó URL-ek belefoglalása)
Adjon meg pontosvesszővel elválasztott kulcsszavakat, hogy a beolvasásba csak konkrét URL-ek kerüljenek bele.
Példa: Csak az angol nyelvű súgóoldalak beolvasásához:
/en;/help
Ez csak azokat az oldalakat olvassa be, amelyek URL-jében szerepel a /en vagy a help, így a nem releváns részek kihagyásával karaktereket takarít meg.
Relevanciával nem rendelkező URL-ek kizárása
Mező: Advanced Settings > URL Filtering > Exclude URLs that contain (Az alábbiakat tartalmazó URL-ek kizárása)
Adjon meg pontosvesszővel elválasztott kulcsszavakat az olyan szakaszok kihagyásához, mint a blogok, képek vagy hírek.
Példa:
/news;/pictures;/press
Ezzel elkerülhető az olyan, sok tartalmat magában foglaló, de a chatbot szempontjából nem releváns szekciók beolvasása, mint a hírek vagy a képgalériák.
Query Parameters
Minden lekérdezési paraméter figyelmen kívül hagyása
Mező: Advanced Settings > Query Parameters > Ignore all query parameters (Minden lekérdezési paraméter figyelmen kívül hagyása)
Jelölje be ezt a négyzetet, hogy a rendszer a különböző lekérdezési paraméterekkel rendelkező URL-eket ugyanazon oldalként kezelje. Ez megakadályozza a duplikált tartalmak beolvasását.
Konkrét lekérdezési paraméterek figyelmen kívül hagyása
Mező: Advanced Settings > Query Parameters > Ignore specific query parameters (Adott lekérdezési paraméterek figyelmen kívül hagyása)
Adjon meg pontosvesszővel elválasztott paraméterneveket a meghatározott nyomkövetési vagy szűrési paraméterek figyelmen kívül hagyásához.
Példa:
ref;source;campaign;utm_source
Ez a page.html?ref=email és a page.html?ref=social hivatkozásokat ugyanazon URL-ként kezeli.
Content Filtering
Konkrét elemek belefoglalása
Mező: Advanced Settings > Content Filtering > Include element IDs (Elem-azonosítók belefoglalása)
Adjon meg pontosvesszővel elválasztott elem-azonosítókat, hogy csak az oldal adott részeit olvassa be a rendszer. Használja a #id formátumot az elem-azonosítókhoz, a .classname formátumot az osztályokhoz, és szögletes zárójeleket az attribútumokhoz: a [data-id="82874db"] pontosan az ezzel az attribútumértékkel rendelkező elemekre illeszkedik, míg a [data-content] minden olyan elemre, amely egyáltalán rendelkezik ezzel az attribútummal.
Példa:
#main-content;.article-body;[data-section="product"]
Ez kizárólag a fő tartalmi területet, a cikkek törzsét és a termékszekciókat olvassa be, minden mást figyelmen kívül hagyva.
Csak a belefoglalt elemekben található linkek követése
Mező: Advanced Settings > Content Filtering > Follow only links in included elements (Csak a belefoglalt elemekben található linkek követése)
Ez a kapcsoló akkor jelenik meg, ha megadja az Include element IDs értékét. Ha be van kapcsolva, a bejáró csak a belefoglalt elemeken belül található linkeket követi. Ez akkor hasznos, ha a feltérképezést a weboldal meghatározott részeire szeretné korlátozni - például a cikkek tartalmi területeire -, miközben figyelmen kívül hagyja a fejlécekben vagy láblécekben lévő navigációs menüket.
Alapértelmezés: Kikapcsolva (az oldalon található összes linket követi)
Oldalelemek kizárása
Mező: Advanced Settings > Content Filtering > Exclude element IDs (Elem-azonosítók kizárása)
Akadályozza meg a fejlécek, láblécek és egyéb elrendezési elemek beolvasását. Ugyanaz a szelektor-szintaxis érvényes: előtag nélkül header és footer, #id, .classname, vagy egy attribútum szögletes zárójelben, mint például a [data-id="82874db"] vagy a [data-nosnippet]. Az attribútumszelektorok akkor praktikusak, ha az elhagyni kívánt elem nem rendelkezik stabil azonosítóval (ID) vagy osztállyal (class), de tartalmaz egy olyan data-* attribútumot, amelyet kimásolhat a böngésző fejlesztői eszközeiből.
Példa:
header;footer;#navigation;.sidebar;[data-nosnippet]
Ez eltávolítja azokat a HTML-blokkokat, amelyek minden oldalon megismétlődnek, és általában semmilyen hasznos tartalmat nem hordoznak a chatbotja számára.
Linkek követése a kizárt elemekben
Mező: Advanced Settings > Content Filtering > Follow links in excluded elements (Linkek követése a kizárt elemekben)
Ez a kapcsoló akkor jelenik meg, ha megadja az Exclude element IDs mezőt. Ha be van kapcsolva, a bejáró a kizárt elemekben (például a fejlécek navigációs menüiben) található linkeket továbbra is követi, még akkor is, ha magát a tartalmat kizárja a trenírozásból.
Alapértelmezés: Kikapcsolva (a kizárt elemekben lévő linkeket nem követi)
Gyakori használati eset: Kapcsolja be ezt a lehetőséget, ha ki szeretné zárni a fejléc/lábléc tartalmát a trenírozásból, de továbbra is szüksége van arra, hogy a bejáró az ezeken a területeken található navigációs linkeken keresztül fedezze fel az oldalakat. Ez mindkét szempontból optimális megoldást nyújt: tiszta trenírozási adatokat kap menúzavar nélkül, miközben a teljes webhelyét feltérképezi.
Fontos: Ha teljes weboldal-beolvasást használ, és kizár olyan elemeket, mint a header, anélkül, hogy bekapcsolná a „Follow links in excluded elements” funkciót, előfordulhat, hogy a szkenner nem találja meg a mélyebben fekvő hivatkozásokat (a menük gyakran a fejlécekben találhatók). Ebben az esetben kapcsolja be a kapcsolót, vagy használjon sitemapot a legbiztonságosabb és leghatékonyabb módszerként.
Scraping Behavior
Dokumentumok beolvasása
Mező: Advanced Settings > Scraping Behavior > Scrape documents (Dokumentumok beolvasása)
Ha be van kapcsolva, a rendszer kinyeri és feldolgozza a weboldalon talált dokumentumok tartalmát. Jelenleg a PDF-fájlokat támogatja.
Képhivatkozások kizárása
Mező: Advanced Settings > Scraping Behavior > Exclude image links (Képhivatkozások kizárása)
Kapcsolja be ezt a lehetőséget, ha az összes képhivatkozást ki szeretné zárni a trenírozási adatkészletből. Alapértelmezés szerint a rendszer kinyeri az összes képlinket, ami jelentősen növelheti a karakterszámot.
Ennek az opciónak a bekapcsolása számottevően csökkentheti a felhasznált karakterek számát.
Rejtett tartalmak beolvasása
Mező: Advanced Settings > Scraping Behavior > Scrape hidden contents (Rejtett tartalmak beolvasása)
Ha be van kapcsolva (alapértelmezett), a rendszer kinyeri a tartalmat a rejtett HTML-elemekből is (display:none, visibility:hidden vagy hasonló CSS-tulajdonságokkal rendelkező elemekből).
Alapértelmezés: Bekapcsolva
Mikor érdemes kikapcsolni: Kapcsolja ki ezt az opciót a rejtett tartalmak átugrásához, és csak a látható elemek beolvasásához. Ez akkor hasznos, ha a webhelyek olyan rejtett tartalmakat tartalmaznak, mint például:
- Összecsukott harmonikaszekciók (accordionok)
- Csak mobilon vagy csak asztali gépen megjelenő tartalom
- Rejtett űrlapmezők
- Fejlesztői megjegyzések vagy hibakeresési (debug) információk
Ennek kikapcsolása csökkentheti a karakterszámot, és megakadályozhatja, hogy nem releváns, rejtett tartalom kerüljön a trenírozási adatok közé.
Késleltetés az oldalak között
Mező: Advanced Settings > Scraping Behavior > Delay between pages (Késleltetés az oldalak között)
Állítson be késleltetést (másodpercben) az egyes oldalak beolvasása közé, hogy elkerülje a szerver túlterhelését. Olyan webhelyeknél hasznos, ahol sebességkorlátozás (rate limiting) van érvényben.
Látogatás szimulálása adott országból
Mező: Advanced Settings > Scraping Behavior > Country code (Országkód)
Ha az Ön webhelye a látogató tartózkodási helyétől függően eltérő tartalmat jelenít meg, adjon meg egy 2 betűs országkódot (pl. US, PL, DE), hogy az adott helyről történő beolvasást szimulálja.
Ajánlott konfiguráció a legtöbb weboldalhoz
A legtöbb webhely esetében az alábbi konfiguráció biztosítja a legjobb egyensúlyt az átfogó tartalom és a csökkentett karakterszám között:
- Használjon sitemapot, ha elérhető, a pontos URL-vezérlés érdekében
- Elem-azonosítók kizárása:
header;footer;#navigation;.sidebar - Kapcsolja be az „Exclude image links” funkciót, hogy eltávolítsa a kép-URL-eket a trenírozásból
- Kapcsolja ki a „Scrape hidden contents” opciót, ha a webhelye sok rejtett elemet tartalmaz
- Fontolja meg a „Follow links in excluded elements” használatát, ha teljes beolvasást végez kizárt fejlécekkel
Ez a konfiguráció jellemzően 20-40%-kal csökkenti a karakterszámot, miközben minden értékes tartalmat megőriz.
Összegzés: Bevált gyakorlatok
- Használjon sitemapot a teljes beolvasás helyett a pontos szabályozáshoz
- Foglaljon bele URL-eket, hogy csak az értékes tartalmakat célozza meg
- Zárjon ki URL-eket a nem releváns vagy nagy terjedelmű oldalak kihagyásához
- Hagyja figyelmen kívül a lekérdezési paramétereket a duplikált tartalom elkerülése érdekében
- Zárjon ki elem-azonosítókat az ismétlődő oldalrészek, például a fejlécek és láblécek eltávolításához
- Irányítsa a linkkövetést a „Follow only links in included elements” vagy a „Follow links in excluded elements” funkcióval a feltérképezés finomhangolásához
- Zárja ki a képhivatkozásokat a karakterszám jelentős csökkentéséhez
- Kapcsolja ki a rejtett tartalmak beolvasását, ha a webhelyén felesleges rejtett elemek találhatók
- Összpontosítson a hasznos tartalomra a botja számára (GYIK, termékoldalak, támogatási cikkek)