Adicionar fontes de websites permite que o seu chatbot aprenda diretamente a partir do conteúdo do seu website. Quer se trate de detalhes de produtos, FAQs ou artigos de blogue, a análise do seu website garante que o chatbot possa fornecer respostas precisas e atualizadas com base no conteúdo real do seu site.
Onde encontrar o treino por website
Selecione o seu chatbot e, em seguida, aceda ao separador Training (Treino). Na barra lateral esquerda, selecione Links (Ligações). É aqui que gere todas as fontes de treino baseadas em websites.
Clique em Add New Training: Website (Adicionar novo treino: Website) para abrir o formulário de treino.
Opções de análise
O formulário de treino oferece duas formas de adicionar conteúdo do website, separadas por um divisor OR (OU).
Scan website contents (Analisar conteúdos do website) - Introduza um URL no campo Address (Endereço) e selecione entre:
- Whole website (Website completo) - Percorre todas as páginas detetáveis a partir do URL introduzido
- Single address (Endereço único) - Analisa apenas a página específica que introduzir
Use sitemap (Utilizar sitemap) - Introduza o URL do seu sitemap (ex.: https://www.yourdomain.com/sitemap.xml) no campo Sitemap. Esta opção analisa apenas as páginas listadas no seu ficheiro sitemap.
Ao utilizar um sitemap, o campo Address é automaticamente desativado (e vice-versa), uma vez que só pode utilizar um método por tarefa de treino.
Treinar com o website completo
- Introduza o URL raiz do seu website no campo Address (ex.:
https://www.yourdomain.com) - Selecione Whole website no menu pendente abaixo do campo de endereço
- Clique em Start scanning the website (Começar a analisar o website)
O sistema irá percorrer o seu website, seguindo as ligações para descobrir todas as páginas. Pode acompanhar o progresso no separador Trainings (Treinos), onde verá em tempo real o número de ligações analisadas e os carateres de treino recolhidos.
Treinar com uma página individual
- Introduza o URL específico da página no campo Address (ex.:
https://www.yourdomain.com/pricing) - Selecione Single address no menu pendente
- Clique em Start scanning the website
Isto é útil quando precisa apenas de adicionar uma página específica à base de conhecimento do seu chatbot, por exemplo um artigo recém-publicado ou uma página de FAQ atualizada.
Treinar com sitemap
- Introduza o URL do seu sitemap no campo Sitemap (ex.:
https://www.yourdomain.com/sitemap.xml) - Clique em Start scanning the website
A análise por sitemap confere um controlo preciso sobre as páginas incluídas, uma vez que apenas processa os URLs listados no seu ficheiro sitemap.
Selecionar páginas individuais para treino
Antes de iniciar uma análise, pode ativar a opção I want to select individual urls for training after scanning the website (Pretendo selecionar URLs individuais para treino após analisar o website). Esta opção está disponível apenas ao analisar um website completo (não no modo de endereço único).
Quando ativada:
- O sistema analisa o seu website e descobre todas as páginas
- Após a conclusão da análise, é apresentada uma vista em árvore de todas as páginas descobertas com a respetiva contagem de carateres
- Marque ou desmarque páginas para as incluir ou excluir do treino
- Clique em Start the Training (Iniciar o treino) para começar o treino nas páginas selecionadas
Isto é útil quando o seu website contém páginas a partir das quais não pretende que o chatbot aprenda, tais como páginas de início de sessão, áreas de administração ou secções irrelevantes.
Analisar idiomas do website
Se o seu website estiver publicado em mais de um idioma, o ChatLab deteta os idiomas disponíveis durante a análise e permite-lhe decidir quais incluir na base de conhecimento do seu chatbot. Encontrará estes controlos na secção Languages (Idiomas) do formulário de treino, imediatamente acima de Advanced settings (Definições avançadas).
Âmbito do idioma
O menu pendente Language scope (Âmbito do idioma) controla que parte de um site multilíngue é analisada:
- Main website language (recommended) (Idioma principal do website (recomendado)) - a opção predefinida. Apenas o idioma principal do site é analisado. As outras versões de idioma são ignoradas. Isto mantém os seus dados de treino compactos e focados, consumindo menos da sua capacidade de treino.
- All languages (Todos os idiomas) - analisa todas as versões de idioma do site. Isto inclui todas as suas páginas localizadas, mas recolhe mais conteúdo e utiliza mais da sua capacidade de treino.
- Selected language (Idioma selecionado) - analisa um único idioma que escolher de entre os detetados no site.
O ChatLab deteta automaticamente o main language (idioma principal) do seu website e utiliza-o como predefinição. Quando seleciona Selected language, o idioma principal detetado fica pré-selecionado e marcado como "main" na lista. Pode alterá-lo para qualquer outro idioma detetado.
A deteção de idioma está disponível em todos os planos, incluindo o plano gratuito. No plano gratuito, o idioma da página continua a ser detetado e apenas o idioma principal é analisado, a menos que altere o âmbito para All languages.
Método de deteção de idioma
Quando o âmbito estiver definido como Main website language ou Selected language, pode escolher como o ChatLab reconhece as versões de idioma no seu site através do menu pendente Language detection method (Método de deteção de idioma):
- Hreflang attributes (recommended) (Atributos hreflang (recomendado)) - a opção predefinida. Utiliza as marcações
hreflangelangque a maioria dos sites multilíngues já disponibiliza para associar as respetivas versões de idioma. - URL path prefix (/en/, /de/, ...) (Prefixo de caminho do URL (/en/, /de/, ...)) - para sites que mantêm cada idioma sob um segmento de caminho como
/en/,/de/ou/fr/sem qualquer marcaçãohreflang.
Se o ChatLab não conseguir detetar os idiomas automaticamente, pode ainda assim analisar o idioma principal ou todos os idiomas. Quando escolher Selected language, introduza primeiro o endereço do seu website nos campos acima e, em seguida, volte a selecionar a opção para que o site possa ser analisado.
Para uma visão geral de como o seu chatbot utiliza estas versões de idioma ao responder, consulte Chatbots multilíngues e Configuração de idioma do chatbot. Os modos de idioma da base de conhecimento aí descritos dependem de fontes que foram analisadas com deteção de idioma, pelo que as fontes mais antigas podem ter de ser treinadas novamente para tirar o máximo partido deles.
Definições avançadas
Clique no botão Advanced settings no formulário de treino para aceder a controlos de análise detalhados.
As definições avançadas estão organizadas em quatro secções:
URL Filtering (Filtragem de URLs)
- Include only URLs that contain (Incluir apenas URLs que contenham) - Analisar apenas URLs que correspondam a estes padrões (separados por ponto e vírgula, ex.:
/en;/help) - Exclude URLs that contain (Excluir URLs que contenham) - Ignorar URLs que correspondam a estes padrões (ex.:
/news;/pictures). Padrões comuns como/wp-admin/,/feed/e páginas de carrinho são excluídos por predefinição
Query Parameters (Parâmetros de consulta)
- Ignore all query parameters (Ignorar todos os parâmetros de consulta) - Tratar URLs com diferentes parâmetros de consulta como a mesma página (ex.:
/page?id=1e/page?id=2tornam-se ambos/page) - Ignore specific query parameters (Ignorar parâmetros de consulta específicos) - Ignorar apenas determinados parâmetros (parâmetros comuns de rastreio como
utm_source,fbclid,gclidsão ignorados automaticamente)
Content Filtering (Filtragem de conteúdo)
- Include element IDs (Incluir IDs de elementos) - Extrair conteúdo apenas de elementos HTML específicos (utilize
#idpara IDs,.classnamepara classes,[data-id="82874db"]para elementos com um determinado atributo, separados por ponto e vírgula) - Exclude element IDs (Excluir IDs de elementos) - Ignorar conteúdo de elementos HTML específicos (ex.:
footer;header;#navigation;[data-nosnippet]) - Opções condicionais surgem quando os elementos de inclusão/exclusão são definidos, permitindo controlar se o rastreador segue as ligações encontradas dentro desses elementos
Scraping Behavior (Comportamento de extração)
- Scrape documents (Extrair documentos) - Extrair também conteúdo de ficheiros PDF encontrados no website
- Exclude image links (Excluir ligações de imagens) - Ignorar URLs de imagens do conjunto de dados de treino
- Scrape hidden contents (Extrair conteúdos ocultos) - Incluir conteúdo de elementos HTML ocultos (ativado por predefinição)
- Delay between pages (Atraso entre páginas) - Adicionar um atraso em segundos entre pedidos de páginas para reduzir a carga no servidor
- Country code (Código de país) - Encaminhar a extração através de um servidor proxy num país específico (código de duas letras, ex.:
us)
Notificações por e-mail
A opção Email me when training is finished or needs my attention (Enviar-me um e-mail quando o treino terminar ou necessitar da minha atenção) está ativada por predefinição. Quando ativa, recebe uma notificação por e-mail quando:
- O treino é concluído com sucesso
- O sistema necessita da sua intervenção (ex.: selecionar páginas após uma análise)
- Surge algum problema durante o treino
Pode alterar o endereço de e-mail de notificação no campo junto à opção.
Monitorizar o progresso do treino
Depois de iniciar uma análise, mude para o separador Trainings para monitorizar o progresso. Cada tarefa de treino apresenta:
- O URL de origem
- O estado atual (Scanning links, Awaiting links selection, Training, Training completed)
- Uma barra de progresso durante a análise ou o treino ativo
- A data da última atualização
Clique em More details (Mais detalhes) para ver todos os parâmetros utilizados numa tarefa de treino específica, incluindo quaisquer definições avançadas que tenham sido configuradas.
Gerir ligações treinadas
Após a conclusão do treino, todas as páginas analisadas surgem no separador Links. Cada ligação mostra:
- Título da página e URL
- Contagem de carateres (tamanho dos dados de treino)
- Estado do treino
- Data da última atualização
Para cada ligação, pode:
- Retrain (Treinar novamente) - Voltar a analisar e atualizar o conteúdo desta página específica
- View (Ver) - Consultar o conteúdo exato que foi extraído da página
- Delete (Eliminar) - Remover esta página da base de conhecimento do seu chatbot
Utilize a caixa de seleção Select all (Selecionar tudo) e os botões de ação em massa para treinar novamente ou eliminar várias ligações de uma só vez.
Visualizar conteúdo analisado
Clique no botão View junto a qualquer ligação treinada para ver exatamente que conteúdo foi extraído dessa página.
O modal de visualização da fonte mostra o título da página, URL, contagem de carateres, data da última atualização e o conteúdo de texto integral no qual o seu chatbot foi treinado. Isto ajuda a verificar se o conteúdo correto foi recolhido e a compreender a base de conhecimento do seu chatbot.
Artigos relacionados
- Treino em segundo plano - Saiba como funciona o treino em segundo plano
- Treinar o seu chatbot novamente - Como atualizar o seu chatbot com conteúdo novo
- Como reduzir os carateres de treino ao analisar um website - Sugestões para otimizar o tamanho dos seus dados de treino
- Treinar o seu chatbot: conceitos básicos e limites - Compreender os limites de dados de treino