Centro de Ajuda
Treinar o seu chatbot

Como reduzir os carateres de treino ao verificar um website

Última atualização:

Ao treinar o seu chatbot num website, limitar a quantidade de dados verificados ao que é estritamente útil ajuda a reduzir a utilização de carateres, acelera o treino e melhora a qualidade das respostas, focando-se apenas em conteúdo relevante.

Este guia explica como otimizar a sua análise utilizando as Advanced settings (Definições avançadas) no modal de treino por website (Training > Links > Add New Training: Website [Treino > Hiperligações > Adicionar novo treino: Website]).


Por que motivo menos treino pode ser melhor

O ChatLab utiliza a arquitetura RAG (Retrieval-Augmented Generation). Em vez de memorizar todo o conteúdo do website, a IA procura os blocos de informação mais relevantes no momento em que cada utilizador faz uma pergunta, utilizando-os para gerar uma resposta.

O problema do excesso de dados

Mais dados nem sempre significam melhores respostas. Adicionar conteúdo irrelevante ou redundante pode prejudicar o processo de recuperação de dados:

  • O RAG pontua partes do conteúdo pela sua relevância em relação à pergunta do utilizador. Se o seu site contiver muitas páginas com texto repetitivo, vago ou genérico (menus, rodapés, comunicados de imprensa, páginas de etiquetas de blogue), a qualidade dos resultados de pesquisa fica comprometida.
  • Quando o chatbot recupera múltiplos blocos de baixo valor que partilham palavras-chave mas não contêm contexto útil, pode acabar por gerar respostas imprecisas, demasiado generalistas ou despropositadas.
  • Por exemplo: se o seu rodapé contiver hiperligações como "Início", "Contacto", "Privacidade" e "FAQ" em todas as páginas, o bot poderá responder com um parágrafo genérico do rodapé em vez de indicar um número de telefone ou e-mail útil quando um utilizador pergunta "Como posso contactar-vos?".

Sinal forte, ruído baixo = melhores respostas

Ao analisar apenas conteúdo útil, ajuda a IA a recuperar um contexto claro, específico e de alta qualidade para cada questão. Foque-se em:

  • Descrições de produtos
  • Páginas de FAQ
  • Artigos de suporte
  • Documentos de políticas
  • Landing pages principais

Utilize o sitemap em vez da análise completa do website

Recomendado: utilize a opção de sitemap sempre que possível.

A análise completa do website segue todas as hiperligações visíveis na página, incluindo as de rodapés, menus e barras laterais, o que costuma levar à análise de conteúdo repetitivo ou sem valor. Estas secções encontram-se tipicamente em todas as páginas e raramente trazem informação única e útil para responder no chat.

Ao utilizar um sitemap (normalmente localizado em https://yourdomain.com/sitemap.xml):

  • Evita a recolha de páginas desnecessárias (por exemplo: páginas legais, hiperligações de redes sociais, páginas repetidas de etiquetas de blogue)
  • Controla exatamente que URLs são verificados
  • Evita o consumo acidental e excessivo de carateres provenientes de menus, rodapés e cabeçalhos

Visão geral das Advanced settings

Para aceder às definições avançadas, clique em Add New Training: Website (Adicionar novo treino: Website) no separador Training e, de seguida, expanda a secção Advanced settings (Definições avançadas). As definições estão organizadas em quatro categorias:

  • URL Filtering (Filtragem de URLs) - Controle que URLs incluir ou excluir
  • Query Parameters (Parâmetros de consulta) - Faça a gestão dos parâmetros de URL
  • Content Filtering (Filtragem de conteúdo) - Filtre elementos de página específicos
  • Scraping Behavior (Comportamento de extração) - Configure a forma como o conteúdo é extraído

URL Filtering

Opções de filtragem de URLs

Incluir apenas URLs específicos

Campo: Advanced Settings > URL Filtering > Include only URLs that contain (Incluir apenas URLs que contenham)

Adicione palavras-chave separadas por ponto e vírgula para incluir apenas URLs específicos na análise.

Exemplo: para analisar apenas páginas de ajuda em inglês:

/en;/help

Desta forma, analisa apenas as páginas que contenham /en ou help no URL, poupando carateres ao ignorar secções irrelevantes.

Excluir URLs irrelevantes

Campo: Advanced Settings > URL Filtering > Exclude URLs that contain (Excluir URLs que contenham)

Adicione palavras-chave separadas por ponto e vírgula para ignorar secções como blogues, imagens ou notícias.

Exemplo:

/news;/pictures;/press

Isto evita a análise de secções com muito conteúdo mas irrelevantes para o chatbot, como notícias ou galerias de imagens.


Query Parameters

Opções de parâmetros de consulta

Ignorar todos os parâmetros de consulta

Campo: Advanced Settings > Query Parameters > Ignore all query parameters (Ignorar todos os parâmetros de consulta)

Ative esta caixa de seleção para processar URLs com diferentes parâmetros de consulta como sendo a mesma página. Desta forma, evita a análise de conteúdo duplicado.

Ignorar parâmetros de consulta específicos

Campo: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignorar parâmetros de consulta específicos)

Adicione nomes de parâmetros separados por ponto e vírgula para ignorar parâmetros de rastreio ou de filtragem específicos.

Exemplo:

ref;source;campaign;utm_source

Isto trata page.html?ref=email e page.html?ref=social como o mesmo URL.


Content Filtering

Opções de filtragem de conteúdo

Incluir elementos específicos

Campo: Advanced Settings > Content Filtering > Include element IDs (Incluir IDs de elementos)

Adicione identificadores de elementos separados por ponto e vírgula para analisar apenas partes específicas da página. Utilize #id para IDs de elementos, .classname para classes e parênteses retos para atributos: [data-id="82874db"] corresponde a elementos com esse valor exato de atributo, enquanto [data-content] corresponde a qualquer elemento que simplesmente contenha o atributo.

Exemplo:

#main-content;.article-body;[data-section="product"]

Isto analisa apenas a área de conteúdo principal, o corpo dos artigos e as secções de produtos, ignorando o resto.

Seguir apenas hiperligações nos elementos incluídos

Campo: Advanced Settings > Content Filtering > Follow only links in included elements (Seguir apenas hiperligações nos elementos incluídos)

Esta opção surge quando define IDs em Include element IDs. Quando ativada, o crawler apenas segue as hiperligações encontradas dentro dos elementos incluídos. Isto é útil quando pretende restringir o rastreio a secções específicas do website, como as áreas de texto dos artigos, ignorando os menus de navegação nos cabeçalhos ou rodapés.

Predefinição: Desativado (todas as hiperligações da página são seguidas)

Excluir elementos da página

Campo: Advanced Settings > Content Filtering > Exclude element IDs (Excluir IDs de elementos)

Evite a recolha de cabeçalhos, rodapés e outros elementos de layout. Aplica-se a mesma sintaxe de seletores: header e footer sem prefixo, #id, .classname, ou um atributo em parênteses retos como [data-id="82874db"] ou [data-nosnippet]. Os seletores de atributos são convenientes quando o elemento a excluir não possui um ID ou classe estável, mas tem um atributo data-* que pode copiar a partir das ferramentas de programador do navegador.

Exemplo:

header;footer;#navigation;.sidebar;[data-nosnippet]

Isto remove blocos de HTML que se repetem em todas as páginas e que geralmente não trazem conteúdo útil para o seu chatbot.

Seguir hiperligações em elementos excluídos

Campo: Advanced Settings > Content Filtering > Follow links in excluded elements (Seguir hiperligações em elementos excluídos)

Esta opção surge quando define IDs em Exclude element IDs. Quando ativada, o crawler continua a seguir as hiperligações encontradas dentro dos elementos excluídos (como menus de navegação nos cabeçalhos), mesmo que o conteúdo textual desses elementos seja excluído do treino.

Predefinição: Desativado (as hiperligações em elementos excluídos não são seguidas)

Caso de utilização: ative esta opção quando pretender excluir o conteúdo do cabeçalho ou rodapé do treino, mas ainda assim precisar de que o crawler descubra novas páginas através das hiperligações de navegação nessas áreas. Obtém assim o melhor dos dois mundos: dados de treino limpos e sem a poluição dos menus, sem abdicar de analisar o site por completo.

Importante: se utilizar a análise completa do website e excluir elementos como o cabeçalho sem ativar "Follow links in excluded elements", o crawler pode não conseguir descobrir páginas mais profundas (uma vez que os menus ficam frequentemente dentro dos cabeçalhos). Neste caso, ative esta opção ou utilize um sitemap, que representa o método mais seguro e eficiente.


Scraping Behavior

Opções de comportamento de extração

Extrair documentos

Campo: Advanced Settings > Scraping Behavior > Scrape documents (Extrair documentos)

Quando esta opção está ativada, o sistema extrai e processa o conteúdo de documentos encontrados no website. Atualmente, suporta ficheiros PDF.

Excluir hiperligações de imagens

Campo: Advanced Settings > Scraping Behavior > Exclude image links (Excluir hiperligações de imagens)

Ative esta opção para excluir todas as hiperligações de imagens do conjunto de dados de treino. Por predefinição, o sistema extrai todas as hiperligações de imagens, o que pode aumentar significativamente a contagem de carateres.

Ativar esta funcionalidade permite reduzir substancialmente a utilização de carateres.

Extrair conteúdo oculto

Campo: Advanced Settings > Scraping Behavior > Scrape hidden contents (Extrair conteúdo oculto)

Quando esta opção está ativada (predefinição), o sistema extrai o conteúdo de elementos HTML ocultos (elementos com display:none, visibility:hidden ou propriedades CSS semelhantes).

Predefinição: Ativado

Quando desativar: desative esta opção para ignorar conteúdo oculto e extrair apenas elementos visíveis. Isto é útil caso o website contenha conteúdo oculto como:

  • Secções expansíveis (accordions) recolhidas
  • Conteúdo exclusivo para telemóvel ou para computador
  • Campos ocultos de formulários
  • Comentários de programadores ou informações de depuração

Desativar esta opção pode poupar carateres e evitar que conteúdo oculto e desnecessário entre nos dados de treino.

Intervalo entre páginas

Campo: Advanced Settings > Scraping Behavior > Delay between pages (Intervalo entre páginas)

Adicione um intervalo (em segundos) entre a análise de cada página para evitar sobrecarregar o seu servidor. Muito útil para websites com limites de frequência de pedidos (rate limiting).

Simular visita a partir de um país específico

Campo: Advanced Settings > Scraping Behavior > Country code (Código de país)

Se o seu site apresentar conteúdos diferentes consoante a localização do visitante, introduza um código de país de 2 letras (por exemplo: US, PL, DE) para simular a análise a partir dessa região.


Configuração recomendada para a maioria dos websites

Para a generalidade dos websites, a configuração seguinte oferece o equilíbrio ideal entre uma cobertura de conteúdo abrangente e um consumo reduzido de carateres:

  1. Utilize o sitemap sempre que disponível para um controlo rigoroso dos URLs
  2. Exclua IDs de elementos: header;footer;#navigation;.sidebar
  3. Ative "Exclude image links" para remover os URLs de imagens do treino
  4. Desative "Scrape hidden contents" caso o seu site tenha muitos elementos ocultos
  5. Considere "Follow links in excluded elements" se optar pela análise completa e tiver excluído os cabeçalhos

Esta configuração reduz tipicamente a contagem de carateres entre 20-40%, mantendo todo o conteúdo de valor.


Resumo: boas práticas

  • Utilize o sitemap em vez da análise completa para ter o controlo exato
  • Inclua URLs para visar apenas conteúdos de valor
  • Exclua URLs para ignorar páginas pesadas ou irrelevantes
  • Ignore parâmetros de consulta para evitar conteúdo duplicado
  • Exclua IDs de elementos para remover secções repetidas de páginas, como cabeçalhos e rodapés
  • Controle a navegação em hiperligações com as opções "Follow only links in included elements" ou "Follow links in excluded elements" para um controlo detalhado do rastreio
  • Exclua hiperligações de imagens para diminuir significativamente a contagem de carateres
  • Desative a extração de conteúdo oculto se o seu site apresentar elementos ocultos dispensáveis
  • Concentre-se em conteúdo útil para o seu bot (FAQs, páginas de produto, artigos de suporte)