Tīmekļa vietnes avotu pievienošana ļauj jūsu tērzēšanas robotam mācīties tieši no jūsu vietnes satura. Neatkarīgi no tā, vai tā ir informācija par produktiem, BUJ vai emuāra ieraksti, vietnes skenēšana nodrošina, ka tērzēšanas robots spēj sniegt precīzas un aktuālas atbildes, pamatojoties uz faktisko jūsu vietnes saturu.
Kur atrast tīmekļa vietnes apmācību
Izvēlieties savu tērzēšanas robotu un pēc tam atveriet cilni Training (Apmācība). Kreisajā sānjoslā izvēlieties Links (Saites). Šeit jūs pārvaldāt visus uz tīmekļa vietnēm balstītos apmācības avotus.
Noklikšķiniet uz Add New Training: Website (Pievienot jaunu apmācību: Tīmekļa vietne), lai atvērtu apmācības veidlapu.
Skenēšanas iespējas
Apmācības veidlapa piedāvā divus veidus, kā pievienot vietnes saturu, ko atdala OR (VAI) dalītājs.
Scan website contents (Skenēt tīmekļa vietnes saturu) - ievadiet URL laukā Address (Adrese) un izvēlieties kādu no šīm iespējām:
- Whole website (Visa tīmekļa vietne) - pārmeklē visas atrodamās lapas, sākot no jūsu norādītā URL
- Single address (Viena adrese) - skenē tikai konkrēto ievadīto lapu
Use sitemap (Izmantot vietnes karti) - ievadiet savas vietnes kartes URL (piemēram, https://www.yourdomain.com/sitemap.xml) laukā Sitemap (Vietnes karte). Tādējādi tiek skenētas tikai lapas, kas norādītas jūsu vietnes kartes failā.
Izmantojot vietnes karti, lauks Address tiek automātiski atspējots (un otrādi), jo vienam apmācības uzdevumam varat izmantot tikai vienu metodi.
Apmācība, izmantojot visu tīmekļa vietni
- Ievadiet savas vietnes saknes URL laukā Address (piemēram,
https://www.yourdomain.com) - Nolaižamajā izvēlnē zem adreses lauka izvēlieties Whole website
- Noklikšķiniet uz Start scanning the website (Sākt vietnes skenēšanu)
Sistēma pārmeklēs jūsu tīmekļa vietni, sekojot saitēm, lai atklātu visas lapas. Progresam varat sekot līdzi cilnē Trainings (Apmācības), kur reāllaikā redzēsiet noskenēto saišu skaitu un apkopotās apmācības rakstzīmes.
Apmācība, izmantojot vienu lapu
- Ievadiet konkrētās lapas URL laukā Address (piemēram,
https://www.yourdomain.com/pricing) - Nolaižamajā izvēlnē izvēlieties Single address
- Noklikšķiniet uz Start scanning the website
Tas ir noderīgi, ja tērzēšanas robota zināšanu bāzei nepieciešams pievienot tikai vienu konkrētu lapu, piemēram, nesen publicētu rakstu vai atjauninātu BUJ lapu.
Apmācība, izmantojot vietnes karti
- Ievadiet savas vietnes kartes URL laukā Sitemap (piemēram,
https://www.yourdomain.com/sitemap.xml) - Noklikšķiniet uz Start scanning the website
Vietnes kartes skenēšana sniedz precīzu kontroli pār to, kuras lapas tiek iekļautas, jo tiek apstrādāti tikai tie URL, kas norādīti jūsu vietnes kartes failā.
Atsevišķu lapu atlase apmācībai
Pirms skenēšanas sākšanas varat ieslēgt pārslēgu I want to select individual urls for training after scanning the website (Pēc vietnes skenēšanas vēlos atlasīt atsevišķus URL apmācībai). Šī opcija ir pieejama tikai tad, ja tiek skenēta visa vietne (nav pieejama vienas adreses režīmā).
Kad tā ir ieslēgta:
- Sistēma noskenē jūsu vietni un atklāj visas lapas
- Pēc skenēšanas pabeigšanas jūs redzat visu atrasto lapu koka skatu ar to rakstzīmju skaitu
- Atzīmējiet vai noņemiet atzīmi no lapām, lai tās iekļautu apmācībā vai izslēgtu no tās
- Noklikšķiniet uz Start the Training (Sākt apmācību), lai sāktu apmācību par atlasītajām lapām
Tas ir noderīgi, ja jūsu vietnē ir lapas, no kurām nevēlaties, lai tērzēšanas robots mācītos, piemēram, pieteikšanās lapas, administratora sadaļas vai neatbilstošas sadaļas.
Tīmekļa vietnes valodu skenēšana
Ja jūsu tīmekļa vietne ir publicēta vairāk nekā vienā valodā, ChatLab skenēšanas laikā nosaka pieejamās valodas un ļauj jums izlemt, kuras no tām iekļaut sava tērzēšanas robota zināšanu bāzē. Šīs vadīklas atradīsiet apmācības veidlapas sadaļā Languages (Valodas), tieši virs Advanced settings (Papildu iestatījumi).
Valodas tvērums
Nolaižamā izvēlne Language scope (Valodas tvērums) nosaka, cik liela daļa daudzvalodu vietnes tiek skenēta:
- Main website language (recommended) (Vietnes galvenā valoda (ieteicams)) - noklusējuma iestatījums. Tiek skenēta tikai vietnes galvenā valoda. Citu valodu versijas tiek izlaistas. Tas palīdz saglabāt jūsu apmācības datus lakoniskus un mērķtiecīgus, kā arī patērē mazāk apmācības kapacitātes.
- All languages (Visas valodas) - skenē katru vietnes valodas versiju. Tas aptver visas jūsu lokalizētās lapas, taču apkopo vairāk satura un patērē vairāk apmācības kapacitātes.
- Selected language (Atlasītā valoda) - skenē vienu valodu, kuru izvēlaties no vietnē noteiktajām valodām.
ChatLab automātiski nosaka jūsu vietnes galveno valodu un izmanto to kā noklusējumu. Kad izvēlaties Selected language, noteiktā galvenā valoda jau ir iepriekš atlasīta un sarakstā atzīmēta kā "main" (galvenā). Varat to nomainīt pret jebkuru citu noteikto valodu.
Valodu noteikšana ir pieejama visos plānos, tostarp bezmaksas plānā. Bezmaksas plānā lapas valoda joprojām tiek noteikta, un tiek skenēta tikai galvenā valoda, ja vien nepārslēdzat tvērumu uz All languages.
Valodas noteikšanas metode
Ja tvērums ir iestatīts uz Main website language vai Selected language, nolaižamajā izvēlnē Language detection method (Valodas noteikšanas metode) varat izvēlēties, kā ChatLab atpazīst valodu versijas jūsu vietnē:
- Hreflang attributes (recommended) (Hreflang atribūti (ieteicams)) - noklusējuma iestatījums. Izmanto
hreflangunlangiezīmējumu, ko lielākā daļa daudzvalodu vietņu jau nodrošina, lai savstarpēji sasaistītu savas valodu versijas. - URL path prefix (/en/, /de/, ...) (URL ceļa prefikss (/en/, /de/, ...)) - vietnēm, kurās katra valoda atrodas zem atsevišķa ceļa segmenta, piemēram,
/en/,/de/vai/fr/, bez jebkādahreflangiezīmējuma.
Ja ChatLab nevar automātiski noteikt valodas, jūs joprojām varat skenēt galveno valodu vai visas valodas. Izvēloties Selected language, vispirms ievadiet savas vietnes adresi augstāk esošajos laukos un pēc tam vēlreiz izvēlieties šo opciju, lai vietni varētu analizēt.
Pārskatu par to, kā tērzēšanas robots vēlāk izmanto šīs valodu versijas atbilžu sniegšanā, skatiet rakstos Daudzvalodu tērzēšanas roboti un Tērzēšanas robota valodas iestatīšana. Tur aprakstītie zināšanu bāzes valodu režīmi balstās uz avotiem, kas skenēti ar valodu noteikšanu, tāpēc vecākiem avotiem var būt nepieciešama atkārtota apmācība, lai pilnībā izmantotu šīs iespējas.
Papildu iestatījumi
Noklikšķiniet uz pogas Advanced settings apmācības veidlapā, lai piekļūtu detalizētām skenēšanas vadīklām.
Papildu iestatījumi ir sadalīti četrās sadaļās:
URL Filtering (URL filtrēšana)
- Include only URLs that contain (Iekļaut tikai URL, kas satur) - skenēt tikai tos URL, kas atbilst šiem šabloniem (atdalīti ar semikolu, piemēram,
/en;/help) - Exclude URLs that contain (Izslēgt URL, kas satur) - izlaist URL, kas atbilst šiem šabloniem (piemēram,
/news;/pictures). Bieži sastopami šabloni, piemēram,/wp-admin/,/feed/un iepirkumu groza lapas, pēc noklusējuma tiek izslēgti
Query Parameters (Vaicājuma parametri)
- Ignore all query parameters (Ignorēt visus vaicājuma parametrus) - uzskatīt URL ar atšķirīgiem vaicājuma parametriem par vienu un to pašu lapu (piemēram,
/page?id=1un/page?id=2abi kļūst par/page) - Ignore specific query parameters (Ignorēt konkrētus vaicājuma parametrus) - ignorēt tikai noteiktus parametrus (bieži izmantotie izsekošanas parametri, piemēram,
utm_source,fbclid,gclid, tiek ignorēti automātiski)
Content Filtering (Satura filtrēšana)
- Include element IDs (Iekļaut elementu ID) - izvilkt saturu tikai no konkrētiem HTML elementiem (lietojiet
#ididentifikatoriem,.classnameklasēm,[data-id="82874db"]elementiem ar konkrētu atribūtu, atdalot tos ar semikolu) - Exclude element IDs (Izslēgt elementu ID) - izlaist saturu no konkrētiem HTML elementiem (piemēram,
footer;header;#navigation;[data-nosnippet]) - Ja ir iestatīti iekļaujamie/izslēdzamie elementi, parādās nosacījumu pārslēgi, kas ļauj kontrolēt, vai rāpulis seko saitēm, kas atrastas šajos elementos
Scraping Behavior (Datu ieguves darbība)
- Scrape documents (Iegūt datu no dokumentiem) - izvilkt saturu arī no tīmekļa vietnē atrastajiem PDF failiem
- Exclude image links (Izslēgt attēlu saites) - izlaist attēlu URL no apmācības datu kopas
- Scrape hidden contents (Iegūt slēpto saturu) - iekļaut saturu no paslēptiem HTML elementiem (ieslēgts pēc noklusējuma)
- Delay between pages (Aizture starp lapām) - pievienot aizturi sekundēs starp lapu pieprasījumiem, lai samazinātu servera noslodzi
- Country code (Valsts kods) - novirzīt datu ieguvi caur starpniekserveri konkrētā valstī (divu burtu kods, piemēram,
us)
E-pasta paziņojumi
Pārslēgs Email me when training is finished or needs my attention (Sūtīt man e-pastu, kad apmācība ir pabeigta vai tai nepieciešama mana uzmanība) ir iespējots pēc noklusējuma. Kad tas ir aktīvs, jūs saņemat e-pasta paziņojumu, ja:
- Apmācība ir veiksmīgi pabeigta
- Sistēmai nepieciešama jūsu darbība (piemēram, lapu atlase pēc skenēšanas)
- Apmācības laikā rodas jebkādas problēmas
Paziņojumu e-pasta adresi varat mainīt laukā blakus pārslēgam.
Apmācības progresa uzraudzība
Pēc skenēšanas sākšanas pārslēdzieties uz cilni Trainings, lai uzraudzītu progresu. Katrs apmācības uzdevums rāda:
- Avota URL
- Pašreizējo statusu (Scanning links, Awaiting links selection, Training, Training completed)
- Progresa joslu aktīvas skenēšanas vai apmācības laikā
- Pēdējā atjauninājuma datumu
Noklikšķiniet uz More details (Plašāka informācija), lai skatītu visus konkrētajam apmācības uzdevumam izmantotos parametrus, tostarp visus nokonfigurētos papildu iestatījumus.
Apmācīto saišu pārvaldība
Kad apmācība ir pabeigta, visas noskenētās lapas parādās cilnē Links. Katra saite rāda:
- Lapas nosaukumu un URL
- Rakstzīmju skaitu (apmācības datu apjomu)
- Apmācības statusu
- Pēdējā atjauninājuma datumu
Katrai saitei varat veikt šādas darbības:
- Retrain (Apmācīt no jauna) - vēlreiz noskenēt un atjaunināt šīs konkrētās lapas saturu
- View (Skatīt) - apskatīt precīzu saturu, kas tika izvilkts no šīs lapas
- Delete (Dzēst) - noņemt šo lapu no sava tērzēšanas robota zināšanu bāzes
Izmantojiet izvēles rūtiņu Select all (Atlasīt visu) un masveida darbību pogas, lai apmācītu no jauna vai dzēstu vairākas saites vienlaikus.
Noskenētā satura skatīšana
Noklikšķiniet uz pogas View blakus jebkurai apmācītajai saitei, lai redzētu precīzu saturu, kas tika iegūts no konkrētās lapas.
Avota skatīšanas modālais logs parāda lapas nosaukumu, URL, rakstzīmju skaitu, pēdējā atjauninājuma datumu un pilnu teksta saturu, uz kura tērzēšanas robots tika apmācīts. Tas palīdz jums pārliecināties, ka ir iegūts pareizais saturs, un labāk izprast tērzēšanas robota zināšanu bāzi.
Saistītie raksti
- Apmācība fonā - uzziniet, kā apmācība norit fonā
- Tērzēšanas robota atkārtota apmācība - kā atjaunināt tērzēšanas robotu ar jaunu saturu
- Kā samazināt apmācības rakstzīmju skaitu, skenējot tīmekļa vietni - padomi apmācības datu apjoma optimizēšanai
- Tērzēšanas robota apmācība: pamati un ierobežojumi - izprotiet apmācības datu ierobežojumus