Súgóközpont
A chatbot betanítása

Hogyan csökkenthető a betanítási karakterek száma egy weboldal beolvasásakor

Utoljára frissítve:

Amikor egy weboldalon trenírozza a chatbotját, a beolvasott adatok mennyiségének a leghasznosabb részekre való korlátozása segít csökkenteni a felhasznált karakterek számát, felgyorsítja a trenírozást, és a válaszok minőségét is javítja azáltal, hogy kizárólag a releváns tartalomra összpontosít.

Ez az útmutató bemutatja, hogyan optimalizálhatja a beolvasást az Advanced settings (Speciális beállítások) használatával a weboldal-trenírozási ablakban (Training > Links > Add New Training: Website).


Miért lehet jobb a kevesebb trenírozás?

A ChatLab RAG (Retrieval-Augmented Generation) architektúrát használ. Ahelyett, hogy a weboldal teljes tartalmát megjegyezné, a mesterséges intelligencia minden egyes felhasználói kérdés feltevésekor megkeresi a leginkább releváns információrészleteket, és ezek alapján állítja össze a választ.

A túl sok adat problémája

A több adat nem mindig jelent jobb válaszokat. A nem releváns vagy feleslegesen ismétlődő tartalmak hozzáadása megzavarhatja a visszakeresési folyamatot:

  • A RAG pontozza a tartalomrészleteket a felhasználó kérdéséhez mért relevancia alapján. Ha az Ön webhelye sok olyan oldalt tartalmaz, amelyeken ismétlődő, pontatlan vagy általános szövegek találhatók (menük, láblécek, sajtóközlemények, blogcímke-oldalak), ezek felhígítják a keresési eredmények minőségét.
  • Amikor a chatbot több olyan alacsony értékű szövegrészletet kérdez le, amelyek kulcsszavai megegyeznek, de hiányzik belőlük a hasznos kontextus, pontatlan, túlságosan általános vagy a témához nem kapcsolódó válaszokat generálhat.
  • Például: Ha a lábléc minden oldalon olyan linkeket tartalmaz, mint a „Kezdőlap”, „Kapcsolat”, „Adatvédelem”, „GYIK”, a bot egy általános láblécrészlettel válaszolhat a hasznos telefonszám vagy e-mail-cím helyett, amikor egy felhasználó megkérdezi: „Hogyan léphetek kapcsolatba Önökkel?”.

Erős jel, kevés zaj = jobb válaszok

Ha kizárólag a hasznos tartalmakat olvassa be, azzal segíti az AI-t abban, hogy minden kérdéshez világos, konkrét és kiváló minőségű kontextust hívjon le. Fókuszáljon az alábbiakra:

  • Termékleírások
  • GYIK-oldalak
  • Támogatási cikkek
  • Irányelveket tartalmazó dokumentumok
  • Fontos érkezőoldalak (landing page-ek)

Használjon sitemapot a teljes weboldal-beolvasás helyett

Ajánlott: Amikor csak lehetséges, használja a sitemap opciót.

A teljes weboldal-beolvasás az oldalon található összes látható hivatkozást követi, beleértve a láblécekből, menükből és oldalsávokból származó linkeket is, ami gyakran ismétlődő vagy értéktelen tartalmak beolvasásához vezet. Ezek a szakaszok általában minden oldalon megtalálhatók, és ritkán tartalmaznak olyan egyedi információt, amely hasznos lenne a csevegési válaszokhoz.

Egy sitemap (webhelytérkép, amely általában a https://azondomainje.hu/sitemap.xml címen található) használatával Ön:

  • Elkerüli a felesleges oldalak (pl. jogi oldalak, közösségimédia-linkek, ismétlődő blogcímkék) feltérképezését
  • Pontosan szabályozhatja, hogy mely URL-címeket olvassa be a rendszer
  • Megelőzheti a karakterek véletlenszerű túlfogyasztását a menükből, láblécekből és fejlécekből

Az Advanced settings áttekintése

A speciális beállítások eléréséhez kattintson az Add New Training: Website (Új trenírozás hozzáadása: Weboldal) lehetőségre a Training (Trenírozás) lapon, majd nyissa le az Advanced settings (Speciális beállítások) szakaszt. A beállítások négy kategóriába vannak rendezve:

  • URL Filtering (URL-szűrés) - A belefoglalni vagy kizárni kívánt URL-ek kezelése
  • Query Parameters (Lekérdezési paraméterek) - URL-paraméterek kezelése
  • Content Filtering (Tartalomszűrés) - Adott oldalelemek szűrése
  • Scraping Behavior (Beolvasási viselkedés) - A tartalom kinyerési módjának konfigurálása

URL Filtering

URL Filtering options

Csak adott URL-ek belefoglalása

Mező: Advanced Settings > URL Filtering > Include only URLs that contain (Csak az alábbiakat tartalmazó URL-ek belefoglalása)

Adjon meg pontosvesszővel elválasztott kulcsszavakat, hogy a beolvasásba csak konkrét URL-ek kerüljenek bele.

Példa: Csak az angol nyelvű súgóoldalak beolvasásához:

/en;/help

Ez csak azokat az oldalakat olvassa be, amelyek URL-jében szerepel a /en vagy a help, így a nem releváns részek kihagyásával karaktereket takarít meg.

Relevanciával nem rendelkező URL-ek kizárása

Mező: Advanced Settings > URL Filtering > Exclude URLs that contain (Az alábbiakat tartalmazó URL-ek kizárása)

Adjon meg pontosvesszővel elválasztott kulcsszavakat az olyan szakaszok kihagyásához, mint a blogok, képek vagy hírek.

Példa:

/news;/pictures;/press

Ezzel elkerülhető az olyan, sok tartalmat magában foglaló, de a chatbot szempontjából nem releváns szekciók beolvasása, mint a hírek vagy a képgalériák.


Query Parameters

Query Parameters options

Minden lekérdezési paraméter figyelmen kívül hagyása

Mező: Advanced Settings > Query Parameters > Ignore all query parameters (Minden lekérdezési paraméter figyelmen kívül hagyása)

Jelölje be ezt a négyzetet, hogy a rendszer a különböző lekérdezési paraméterekkel rendelkező URL-eket ugyanazon oldalként kezelje. Ez megakadályozza a duplikált tartalmak beolvasását.

Konkrét lekérdezési paraméterek figyelmen kívül hagyása

Mező: Advanced Settings > Query Parameters > Ignore specific query parameters (Adott lekérdezési paraméterek figyelmen kívül hagyása)

Adjon meg pontosvesszővel elválasztott paraméterneveket a meghatározott nyomkövetési vagy szűrési paraméterek figyelmen kívül hagyásához.

Példa:

ref;source;campaign;utm_source

Ez a page.html?ref=email és a page.html?ref=social hivatkozásokat ugyanazon URL-ként kezeli.


Content Filtering

Content Filtering options

Konkrét elemek belefoglalása

Mező: Advanced Settings > Content Filtering > Include element IDs (Elem-azonosítók belefoglalása)

Adjon meg pontosvesszővel elválasztott elem-azonosítókat, hogy csak az oldal adott részeit olvassa be a rendszer. Használja a #id formátumot az elem-azonosítókhoz, a .classname formátumot az osztályokhoz, és szögletes zárójeleket az attribútumokhoz: a [data-id="82874db"] pontosan az ezzel az attribútumértékkel rendelkező elemekre illeszkedik, míg a [data-content] minden olyan elemre, amely egyáltalán rendelkezik ezzel az attribútummal.

Példa:

#main-content;.article-body;[data-section="product"]

Ez kizárólag a fő tartalmi területet, a cikkek törzsét és a termékszekciókat olvassa be, minden mást figyelmen kívül hagyva.

Csak a belefoglalt elemekben található linkek követése

Mező: Advanced Settings > Content Filtering > Follow only links in included elements (Csak a belefoglalt elemekben található linkek követése)

Ez a kapcsoló akkor jelenik meg, ha megadja az Include element IDs értékét. Ha be van kapcsolva, a bejáró csak a belefoglalt elemeken belül található linkeket követi. Ez akkor hasznos, ha a feltérképezést a weboldal meghatározott részeire szeretné korlátozni - például a cikkek tartalmi területeire -, miközben figyelmen kívül hagyja a fejlécekben vagy láblécekben lévő navigációs menüket.

Alapértelmezés: Kikapcsolva (az oldalon található összes linket követi)

Oldalelemek kizárása

Mező: Advanced Settings > Content Filtering > Exclude element IDs (Elem-azonosítók kizárása)

Akadályozza meg a fejlécek, láblécek és egyéb elrendezési elemek beolvasását. Ugyanaz a szelektor-szintaxis érvényes: előtag nélkül header és footer, #id, .classname, vagy egy attribútum szögletes zárójelben, mint például a [data-id="82874db"] vagy a [data-nosnippet]. Az attribútumszelektorok akkor praktikusak, ha az elhagyni kívánt elem nem rendelkezik stabil azonosítóval (ID) vagy osztállyal (class), de tartalmaz egy olyan data-* attribútumot, amelyet kimásolhat a böngésző fejlesztői eszközeiből.

Példa:

header;footer;#navigation;.sidebar;[data-nosnippet]

Ez eltávolítja azokat a HTML-blokkokat, amelyek minden oldalon megismétlődnek, és általában semmilyen hasznos tartalmat nem hordoznak a chatbotja számára.

Linkek követése a kizárt elemekben

Mező: Advanced Settings > Content Filtering > Follow links in excluded elements (Linkek követése a kizárt elemekben)

Ez a kapcsoló akkor jelenik meg, ha megadja az Exclude element IDs mezőt. Ha be van kapcsolva, a bejáró a kizárt elemekben (például a fejlécek navigációs menüiben) található linkeket továbbra is követi, még akkor is, ha magát a tartalmat kizárja a trenírozásból.

Alapértelmezés: Kikapcsolva (a kizárt elemekben lévő linkeket nem követi)

Gyakori használati eset: Kapcsolja be ezt a lehetőséget, ha ki szeretné zárni a fejléc/lábléc tartalmát a trenírozásból, de továbbra is szüksége van arra, hogy a bejáró az ezeken a területeken található navigációs linkeken keresztül fedezze fel az oldalakat. Ez mindkét szempontból optimális megoldást nyújt: tiszta trenírozási adatokat kap menúzavar nélkül, miközben a teljes webhelyét feltérképezi.

Fontos: Ha teljes weboldal-beolvasást használ, és kizár olyan elemeket, mint a header, anélkül, hogy bekapcsolná a „Follow links in excluded elements” funkciót, előfordulhat, hogy a szkenner nem találja meg a mélyebben fekvő hivatkozásokat (a menük gyakran a fejlécekben találhatók). Ebben az esetben kapcsolja be a kapcsolót, vagy használjon sitemapot a legbiztonságosabb és leghatékonyabb módszerként.


Scraping Behavior

Scraping Behavior options

Dokumentumok beolvasása

Mező: Advanced Settings > Scraping Behavior > Scrape documents (Dokumentumok beolvasása)

Ha be van kapcsolva, a rendszer kinyeri és feldolgozza a weboldalon talált dokumentumok tartalmát. Jelenleg a PDF-fájlokat támogatja.

Képhivatkozások kizárása

Mező: Advanced Settings > Scraping Behavior > Exclude image links (Képhivatkozások kizárása)

Kapcsolja be ezt a lehetőséget, ha az összes képhivatkozást ki szeretné zárni a trenírozási adatkészletből. Alapértelmezés szerint a rendszer kinyeri az összes képlinket, ami jelentősen növelheti a karakterszámot.

Ennek az opciónak a bekapcsolása számottevően csökkentheti a felhasznált karakterek számát.

Rejtett tartalmak beolvasása

Mező: Advanced Settings > Scraping Behavior > Scrape hidden contents (Rejtett tartalmak beolvasása)

Ha be van kapcsolva (alapértelmezett), a rendszer kinyeri a tartalmat a rejtett HTML-elemekből is (display:none, visibility:hidden vagy hasonló CSS-tulajdonságokkal rendelkező elemekből).

Alapértelmezés: Bekapcsolva

Mikor érdemes kikapcsolni: Kapcsolja ki ezt az opciót a rejtett tartalmak átugrásához, és csak a látható elemek beolvasásához. Ez akkor hasznos, ha a webhelyek olyan rejtett tartalmakat tartalmaznak, mint például:

  • Összecsukott harmonikaszekciók (accordionok)
  • Csak mobilon vagy csak asztali gépen megjelenő tartalom
  • Rejtett űrlapmezők
  • Fejlesztői megjegyzések vagy hibakeresési (debug) információk

Ennek kikapcsolása csökkentheti a karakterszámot, és megakadályozhatja, hogy nem releváns, rejtett tartalom kerüljön a trenírozási adatok közé.

Késleltetés az oldalak között

Mező: Advanced Settings > Scraping Behavior > Delay between pages (Késleltetés az oldalak között)

Állítson be késleltetést (másodpercben) az egyes oldalak beolvasása közé, hogy elkerülje a szerver túlterhelését. Olyan webhelyeknél hasznos, ahol sebességkorlátozás (rate limiting) van érvényben.

Látogatás szimulálása adott országból

Mező: Advanced Settings > Scraping Behavior > Country code (Országkód)

Ha az Ön webhelye a látogató tartózkodási helyétől függően eltérő tartalmat jelenít meg, adjon meg egy 2 betűs országkódot (pl. US, PL, DE), hogy az adott helyről történő beolvasást szimulálja.


Ajánlott konfiguráció a legtöbb weboldalhoz

A legtöbb webhely esetében az alábbi konfiguráció biztosítja a legjobb egyensúlyt az átfogó tartalom és a csökkentett karakterszám között:

  1. Használjon sitemapot, ha elérhető, a pontos URL-vezérlés érdekében
  2. Elem-azonosítók kizárása: header;footer;#navigation;.sidebar
  3. Kapcsolja be az „Exclude image links” funkciót, hogy eltávolítsa a kép-URL-eket a trenírozásból
  4. Kapcsolja ki a „Scrape hidden contents” opciót, ha a webhelye sok rejtett elemet tartalmaz
  5. Fontolja meg a „Follow links in excluded elements” használatát, ha teljes beolvasást végez kizárt fejlécekkel

Ez a konfiguráció jellemzően 20-40%-kal csökkenti a karakterszámot, miközben minden értékes tartalmat megőriz.


Összegzés: Bevált gyakorlatok

  • Használjon sitemapot a teljes beolvasás helyett a pontos szabályozáshoz
  • Foglaljon bele URL-eket, hogy csak az értékes tartalmakat célozza meg
  • Zárjon ki URL-eket a nem releváns vagy nagy terjedelmű oldalak kihagyásához
  • Hagyja figyelmen kívül a lekérdezési paramétereket a duplikált tartalom elkerülése érdekében
  • Zárjon ki elem-azonosítókat az ismétlődő oldalrészek, például a fejlécek és láblécek eltávolításához
  • Irányítsa a linkkövetést a „Follow only links in included elements” vagy a „Follow links in excluded elements” funkcióval a feltérképezés finomhangolásához
  • Zárja ki a képhivatkozásokat a karakterszám jelentős csökkentéséhez
  • Kapcsolja ki a rejtett tartalmak beolvasását, ha a webhelyén felesleges rejtett elemek találhatók
  • Összpontosítson a hasznos tartalomra a botja számára (GYIK, termékoldalak, támogatási cikkek)