Palīdzības centrs
Jūsu tērzēšanas robota apmācība

Kā samazināt apmācības rakstzīmju skaitu, skenējot vietni

Pēdējo reizi atjaunināts:

Kad Jūsu chatbots tiek apmācīts, izmantojot tīmekļa vietni, skenēto datu apjoma ierobežošana līdz pašu noderīgākajam saturam palīdz samazināt izmantoto rakstzīmju skaitu, paātrina apmācību un uzlabo atbilžu kvalitāti, koncentrējoties tikai uz būtisku saturu.

Šajā pamācībā ir paskaidrots, kā optimizēt skenēšanu, izmantojot Advanced settings (Papildu iestatījumi) tīmekļa vietnes apmācības modālajā logā (Training > Links > Add New Training: Website).


Kāpēc mazāks apmācības datu apjoms var būt labāks

ChatLab izmanto RAG (Retrieval-Augmented Generation) arhitektūru. Tā vietā, lai iegaumētu visu tīmekļa vietnes saturu, mākslīgais intelekts katra lietotāja jautājuma brīdī meklē visatbilstošākos informācijas fragmentus un izmanto tos atbildes ģenerēšanai.

Problēma ar pārāk lielu datu apjomu

Lielāks datu apjoms ne vienmēr nozīmē labākas atbildes. Pievienojot nebūtisku vai lieku saturu, var tikt traucēts informācijas atlases process:

  • RAG novērtē satura fragmentu atbilstību lietotāja jautājumam. Ja Jūsu vietnē ir daudz lapu ar atkārtotu, neskaidru vai vispārīgu tekstu (izvēlnes, kājenes, preses relīzes, emuāru birku lapas), tās pasliktina meklēšanas rezultātu kvalitāti.
  • Kad chatbots atlasa vairākus zemas vērtības fragmentus, kuriem ir kopīgi atslēgvārdi, bet trūkst noderīga konteksta, tas var ģenerēt neprecīzas, pārāk vispārīgas vai ar tēmu nesaistītas atbildes.
  • Piemēram: ja Jūsu kājenē katrā lapā ir saites, piemēram, "Home", "Contact", "Privacy", "FAQ", bots lietotāja jautājumam "Kā es varu ar jums sazināties?" var atbildēt ar vispārīgu rindkopu no kājenes, nevis noderīgu tālruņa numuru vai e-pastu.

Augsts signāls, mazs troksnis = labākas atbildes

Skenējot tikai noderīgu saturu, Jūs palīdzat mākslīgajam intelektam katram jautājumam atlasīt skaidru, konkrētu un augstas kvalitātes kontekstu. Koncentrējieties uz:

  • Produktu aprakstiem
  • BUJ (FAQ) lapām
  • Atbalsta rakstiem
  • Politiku dokumentiem
  • Galvenajām mērķlapām

Izmantojiet vietnes karti (sitemap), nevis pilnu vietnes skenēšanu

Ieteicams: kad vien iespējams, izmantojiet opciju sitemap.

Pilna tīmekļa vietnes skenēšana seko visām lapā redzamajām saitēm, tostarp saitēm no kājenēm, izvēlnēm un sānjoslām, kas bieži noved pie atkārtota vai nevērtīga satura skenēšanas. Šīs sadaļas parasti atrodas katrā lapā un reti satur unikālu informāciju, kas būtu noderīga čata atbildēm.

Izmantojot vietnes karti (parasti tā atrodas https://yourdomain.com/sitemap.xml), Jūs:

  • Izvairāties no nevajadzīgu lapu pārmeklēšanas (piemēram, juridisko lapu, sociālo saišu, atkārtotu emuāru birku)
  • Precīzi kontrolējat, kuri URL tiek skenēti
  • Novēršat nejaušu rakstzīmju pārtēriņu no izvēlnēm, kājenēm un galvenēm

Papildu iestatījumu pārskats

Lai piekļūtu papildu iestatījumiem, cilnē Training noklikšķiniet uz Add New Training: Website (Pievienot jaunu apmācību: tīmekļa vietne), pēc tam izvērsiet sadaļu Advanced settings. Iestatījumi ir sakārtoti četrās kategorijās:

  • URL Filtering (URL filtrēšana) - kontrolējiet, kurus URL iekļaut vai izslēgt
  • Query Parameters (Vaicājuma parametri) - apstrādājiet URL parametrus
  • Content Filtering (Satura filtrēšana) - filtrējiet konkrētus lapas elementus
  • Scraping Behavior (Iegūšanas rīcība) - konfigurējiet, kā tiek iegūts saturs

URL Filtering

URL Filtering options

Iekļaut tikai konkrētus URL

Lauks: Advanced Settings > URL Filtering > Include only URLs that contain (Iekļaut tikai URL, kas satur)

Pievienojiet ar semikolu atdalītus atslēgvārdus, lai skenēšanā iekļautu tikai konkrētus URL.

Piemērs: lai skenētu tikai palīdzības lapas angļu valodā:

/en;/help

Tādējādi tiek skenētas tikai tās lapas, kuru URL satur /en vai help, ietaupot rakstzīmes un izlaižot nebūtiskas sadaļas.

Izslēgt nebūtiskus URL

Lauks: Advanced Settings > URL Filtering > Exclude URLs that contain (Izslēgt URL, kas satur)

Pievienojiet ar semikolu atdalītus atslēgvārdus, lai izlaistu tādas sadaļas kā emuāri, attēli vai ziņas.

Piemērs:

/news;/pictures;/press

Tādējādi tiek novērsta apjomīgu, bet chatbotam nebūtisku sadaļu, piemēram, ziņu vai attēlu galeriju, skenēšana.


Query Parameters

Query Parameters options

Ignorēt visus vaicājuma parametrus

Lauks: Advanced Settings > Query Parameters > Ignore all query parameters (Ignorēt visus vaicājuma parametrus)

Atzīmējiet šo izvēles rūtiņu, lai URL ar dažādiem vaicājuma parametriem tiktu uzskatīti par vienu un to pašu lapu. Tas novērš dublējoša satura skenēšanu.

Ignorēt konkrētus vaicājuma parametrus

Lauks: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignorēt konkrētus vaicājuma parametrus)

Pievienojiet ar semikolu atdalītus parametru nosaukumus, lai ignorētu konkrētus izsekošanas vai filtrēšanas parametrus.

Piemērs:

ref;source;campaign;utm_source

Tādējādi page.html?ref=email un page.html?ref=social tiek uzskatīti par vienu un to pašu URL.


Content Filtering

Content Filtering options

Iekļaut konkrētus elementus

Lauks: Advanced Settings > Content Filtering > Include element IDs (Iekļaut elementu ID)

Pievienojiet ar semikolu atdalītus elementu identifikatorus, lai skenētu tikai konkrētas lapas daļas. Izmantojiet #id elementu identifikatoriem, .classname klasēm un kvadrātiekavas atribūtiem: [data-id="82874db"] atlasīs elementus ar precīzi šādu atribūta vērtību, bet [data-content] atlasīs visus elementus, kuriem šāds atribūts vispār pastāv.

Piemērs:

#main-content;.article-body;[data-section="product"]

Tādējādi tiek skenēta tikai galvenā satura zona, rakstu pamatteksts un produktu sadaļas, ignorējot visu pārējo.

Sekot saitēm tikai iekļautajos elementos

Lauks: Advanced Settings > Content Filtering > Follow only links in included elements (Sekot saitēm tikai iekļautajos elementos)

Šis pārslēgs parādās, kad norādāt Include element IDs. Kad tas ir iespējots, pārmeklētājs sekos tikai saitēm, kas atrastas iekļautajos elementos. Tas ir noderīgi, ja vēlaties ierobežot pārmeklēšanu līdz konkrētām vietnes sadaļām, piemēram, rakstu satura zonām, ignorējot navigācijas izvēlnes galvenēs vai kājenēs.

Noklusējums: atspējots (tiek sekots visām saitēm lapā)

Izslēgt lapas elementus

Lauks: Advanced Settings > Content Filtering > Exclude element IDs (Izslēgt elementu ID)

Novērsiet galveņu, kājeņu un citu izkārtojuma elementu skenēšanu. Tiek piemērota tā pati selektoru sintakse: header un footer bez prefiksa, #id, .classname vai atribūts kvadrātiekavās, piemēram, [data-id="82874db"] vai [data-nosnippet]. Atribūtu selektori ir parocīgi, ja elementam, kuru vēlaties noņemt, nav stabila id vai klases, bet ir data-* atribūts, kuru varat iekopēt no pārlūkprogrammas izstrādātāja rīkiem.

Piemērs:

header;footer;#navigation;.sidebar;[data-nosnippet]

Tādējādi tiek noņemti HTML bloki, kas atkārtojas katrā lapā un parasti nesatur Jūsu chatbotam noderīgu saturu.

Sekot saitēm izslēgtajos elementos

Lauks: Advanced Settings > Content Filtering > Follow links in excluded elements (Sekot saitēm izslēgtajos elementos)

Šis pārslēgs parādās, kad norādāt Exclude element IDs. Kad tas ir iespējots, pārmeklētājs joprojām sekos saitēm, kas atrastas izslēgtajos elementos (piemēram, navigācijas izvēlnēm galvenēs), lai gan pats saturs no apmācības tiek izslēgts.

Noklusējums: atspējots (saitēm izslēgtajos elementos netiek sekots)

Pielietojums: iespējojiet to, ja vēlaties izslēgt galvenes/kājenes saturu no apmācības, taču pārmeklētājam joprojām ir jāatrod lapas, izmantojot navigācijas saites šajās zonās. Tādējādi Jūs iegūstat labāko no abām iespējām: tīrus apmācības datus bez liekas izvēļņu informācijas, vienlaikus pārmeklējot visu vietni.

Svarīgi: ja izmantojat pilnu tīmekļa vietnes skenēšanu un izslēdzat tādus elementus kā header, neiespējojot "Follow links in excluded elements", skeneris var neatrast dziļākas saites (izvēlnes bieži atrodas galvenēs). Šādā gadījumā vai nu iespējojiet šo pārslēgu, vai arī izmantojiet vietnes karti, kas ir drošākā un efektīvākā metode.


Scraping Behavior

Scraping Behavior options

Iegūt dokumentus

Lauks: Advanced Settings > Scraping Behavior > Scrape documents (Iegūt dokumentus)

Kad tas ir iespējots, sistēma izvelk un apstrādā vietnē atrasto dokumentu saturu. Pašlaik tiek atbalstīti PDF faili.

Izslēgt attēlu saites

Lauks: Advanced Settings > Scraping Behavior > Exclude image links (Izslēgt attēlu saites)

Iespējojiet šo pārslēgu, lai no apmācības datu kopas izslēgtu visas attēlu saites. Pēc noklusējuma sistēma izvelk visas attēlu saites, kas var ievērojami palielināt rakstzīmju skaitu.

Šīs opcijas iespējošana var būtiski samazināt rakstzīmju patēriņu.

Iegūt slēpto saturu

Lauks: Advanced Settings > Scraping Behavior > Scrape hidden contents (Iegūt slēpto saturu)

Kad tas ir iespējots (noklusējums), sistēma iegūst saturu no slēptiem HTML elementiem (elementiem ar display:none, visibility:hidden vai līdzīgiem CSS rekvizītiem).

Noklusējums: iespējots

Kad atspējot: atspējojiet šo opciju, lai izlaistu slēpto saturu un iegūtu datus tikai no redzamajiem elementiem. Tas ir noderīgi, ja vietnēs ir slēpts saturs, piemēram:

  • Sakļautas akordeona sadaļas
  • Tikai mobilajām ierīcēm vai tikai datoriem paredzēts saturs
  • Slēpti veidlapu lauki
  • Izstrādātāju komentāri vai atkļūdošanas informācija

Šīs opcijas atspējošana var samazināt rakstzīmju skaitu un novērst nebūtiska slēptā satura iekļūšanu Jūsu apmācības datos.

Aizkave starp lapām

Lauks: Advanced Settings > Scraping Behavior > Delay between pages (Aizkave starp lapām)

Pievienojiet aizkavi (sekundēs) starp katras lapas skenēšanu, lai nenoslogotu savu serveri. Noderīgi tīmekļa vietnēm ar pieprasījumu skaita ierobežojumiem (rate limiting).

Simulēt apmeklējumu no konkrētas valsts

Lauks: Advanced Settings > Scraping Behavior > Country code (Valsts kods)

Ja Jūsu vietne rāda atšķirīgu saturu atkarībā no apmeklētāja atrašanās vietas, ievadiet 2 burtu valsts kodu (piemēram, US, PL, DE), lai simulētu skenēšanu no šīs vietas.


Ieteicamā konfigurācija lielākajai daļai tīmekļa vietņu

Lielākajai daļai vietņu šī konfigurācija nodrošina vislabāko līdzsvaru starp visaptverošu saturu un samazinātu rakstzīmju skaitu:

  1. Izmantojiet vietnes karti (sitemap), kad tā ir pieejama, lai precīzi kontrolētu URL
  2. Exclude element IDs: header;footer;#navigation;.sidebar
  3. Iespējojiet "Exclude image links", lai no apmācības noņemtu attēlu URL
  4. Atspējojiet "Scrape hidden contents", ja Jūsu vietnē ir daudz slēptu elementu
  5. Apsveriet iespēju izmantot "Follow links in excluded elements", ja izmantojat pilnu skenēšanu ar izslēgtām galvenēm

Šī konfigurācija parasti samazina rakstzīmju skaitu par 20-40%, vienlaikus saglabājot visu vērtīgo saturu.


Kopsavilkums: paraugprakse

  • Izmantojiet vietnes karti, nevis pilnu skenēšanu, lai iegūtu precīzu kontroli
  • Iekļaujiet URL, lai mērķētu tikai uz vērtīgu saturu
  • Izslēdziet URL, lai izlaistu nebūtiskas vai apjomīgas lapas
  • Ignorējiet vaicājuma parametrus, lai izvairītos no satura dublēšanās
  • Izslēdziet elementu ID, lai noņemtu atkārtotas lapas daļas, piemēram, galvenes un kājenes
  • Kontrolējiet saišu sekošanu ar "Follow only links in included elements" vai "Follow links in excluded elements", lai precīzi pielāgotu vietnes pārmeklēšanu
  • Izslēdziet attēlu saites, lai ievērojami samazinātu rakstzīmju skaitu
  • Atspējojiet slēptā satura iegūšanu, ja Jūsu vietnē ir nevajadzīgi slēptie elementi
  • Koncentrējieties uz noderīgu saturu savam botam (BUJ, produktu lapas, atbalsta raksti)