Ao treinar o seu chatbot num website, limitar a quantidade de dados verificados ao que é estritamente útil ajuda a reduzir a utilização de carateres, acelera o treino e melhora a qualidade das respostas, focando-se apenas em conteúdo relevante.
Este guia explica como otimizar a sua análise utilizando as Advanced settings (Definições avançadas) no modal de treino por website (Training > Links > Add New Training: Website [Treino > Hiperligações > Adicionar novo treino: Website]).
Por que motivo menos treino pode ser melhor
O ChatLab utiliza a arquitetura RAG (Retrieval-Augmented Generation). Em vez de memorizar todo o conteúdo do website, a IA procura os blocos de informação mais relevantes no momento em que cada utilizador faz uma pergunta, utilizando-os para gerar uma resposta.
O problema do excesso de dados
Mais dados nem sempre significam melhores respostas. Adicionar conteúdo irrelevante ou redundante pode prejudicar o processo de recuperação de dados:
- O RAG pontua partes do conteúdo pela sua relevância em relação à pergunta do utilizador. Se o seu site contiver muitas páginas com texto repetitivo, vago ou genérico (menus, rodapés, comunicados de imprensa, páginas de etiquetas de blogue), a qualidade dos resultados de pesquisa fica comprometida.
- Quando o chatbot recupera múltiplos blocos de baixo valor que partilham palavras-chave mas não contêm contexto útil, pode acabar por gerar respostas imprecisas, demasiado generalistas ou despropositadas.
- Por exemplo: se o seu rodapé contiver hiperligações como "Início", "Contacto", "Privacidade" e "FAQ" em todas as páginas, o bot poderá responder com um parágrafo genérico do rodapé em vez de indicar um número de telefone ou e-mail útil quando um utilizador pergunta "Como posso contactar-vos?".
Sinal forte, ruído baixo = melhores respostas
Ao analisar apenas conteúdo útil, ajuda a IA a recuperar um contexto claro, específico e de alta qualidade para cada questão. Foque-se em:
- Descrições de produtos
- Páginas de FAQ
- Artigos de suporte
- Documentos de políticas
- Landing pages principais
Utilize o sitemap em vez da análise completa do website
Recomendado: utilize a opção de sitemap sempre que possível.
A análise completa do website segue todas as hiperligações visíveis na página, incluindo as de rodapés, menus e barras laterais, o que costuma levar à análise de conteúdo repetitivo ou sem valor. Estas secções encontram-se tipicamente em todas as páginas e raramente trazem informação única e útil para responder no chat.
Ao utilizar um sitemap (normalmente localizado em https://yourdomain.com/sitemap.xml):
- Evita a recolha de páginas desnecessárias (por exemplo: páginas legais, hiperligações de redes sociais, páginas repetidas de etiquetas de blogue)
- Controla exatamente que URLs são verificados
- Evita o consumo acidental e excessivo de carateres provenientes de menus, rodapés e cabeçalhos
Visão geral das Advanced settings
Para aceder às definições avançadas, clique em Add New Training: Website (Adicionar novo treino: Website) no separador Training e, de seguida, expanda a secção Advanced settings (Definições avançadas). As definições estão organizadas em quatro categorias:
- URL Filtering (Filtragem de URLs) - Controle que URLs incluir ou excluir
- Query Parameters (Parâmetros de consulta) - Faça a gestão dos parâmetros de URL
- Content Filtering (Filtragem de conteúdo) - Filtre elementos de página específicos
- Scraping Behavior (Comportamento de extração) - Configure a forma como o conteúdo é extraído
URL Filtering
Incluir apenas URLs específicos
Campo: Advanced Settings > URL Filtering > Include only URLs that contain (Incluir apenas URLs que contenham)
Adicione palavras-chave separadas por ponto e vírgula para incluir apenas URLs específicos na análise.
Exemplo: para analisar apenas páginas de ajuda em inglês:
/en;/help
Desta forma, analisa apenas as páginas que contenham /en ou help no URL, poupando carateres ao ignorar secções irrelevantes.
Excluir URLs irrelevantes
Campo: Advanced Settings > URL Filtering > Exclude URLs that contain (Excluir URLs que contenham)
Adicione palavras-chave separadas por ponto e vírgula para ignorar secções como blogues, imagens ou notícias.
Exemplo:
/news;/pictures;/press
Isto evita a análise de secções com muito conteúdo mas irrelevantes para o chatbot, como notícias ou galerias de imagens.
Query Parameters
Ignorar todos os parâmetros de consulta
Campo: Advanced Settings > Query Parameters > Ignore all query parameters (Ignorar todos os parâmetros de consulta)
Ative esta caixa de seleção para processar URLs com diferentes parâmetros de consulta como sendo a mesma página. Desta forma, evita a análise de conteúdo duplicado.
Ignorar parâmetros de consulta específicos
Campo: Advanced Settings > Query Parameters > Ignore specific query parameters (Ignorar parâmetros de consulta específicos)
Adicione nomes de parâmetros separados por ponto e vírgula para ignorar parâmetros de rastreio ou de filtragem específicos.
Exemplo:
ref;source;campaign;utm_source
Isto trata page.html?ref=email e page.html?ref=social como o mesmo URL.
Content Filtering
Incluir elementos específicos
Campo: Advanced Settings > Content Filtering > Include element IDs (Incluir IDs de elementos)
Adicione identificadores de elementos separados por ponto e vírgula para analisar apenas partes específicas da página. Utilize #id para IDs de elementos, .classname para classes e parênteses retos para atributos: [data-id="82874db"] corresponde a elementos com esse valor exato de atributo, enquanto [data-content] corresponde a qualquer elemento que simplesmente contenha o atributo.
Exemplo:
#main-content;.article-body;[data-section="product"]
Isto analisa apenas a área de conteúdo principal, o corpo dos artigos e as secções de produtos, ignorando o resto.
Seguir apenas hiperligações nos elementos incluídos
Campo: Advanced Settings > Content Filtering > Follow only links in included elements (Seguir apenas hiperligações nos elementos incluídos)
Esta opção surge quando define IDs em Include element IDs. Quando ativada, o crawler apenas segue as hiperligações encontradas dentro dos elementos incluídos. Isto é útil quando pretende restringir o rastreio a secções específicas do website, como as áreas de texto dos artigos, ignorando os menus de navegação nos cabeçalhos ou rodapés.
Predefinição: Desativado (todas as hiperligações da página são seguidas)
Excluir elementos da página
Campo: Advanced Settings > Content Filtering > Exclude element IDs (Excluir IDs de elementos)
Evite a recolha de cabeçalhos, rodapés e outros elementos de layout. Aplica-se a mesma sintaxe de seletores: header e footer sem prefixo, #id, .classname, ou um atributo em parênteses retos como [data-id="82874db"] ou [data-nosnippet]. Os seletores de atributos são convenientes quando o elemento a excluir não possui um ID ou classe estável, mas tem um atributo data-* que pode copiar a partir das ferramentas de programador do navegador.
Exemplo:
header;footer;#navigation;.sidebar;[data-nosnippet]
Isto remove blocos de HTML que se repetem em todas as páginas e que geralmente não trazem conteúdo útil para o seu chatbot.
Seguir hiperligações em elementos excluídos
Campo: Advanced Settings > Content Filtering > Follow links in excluded elements (Seguir hiperligações em elementos excluídos)
Esta opção surge quando define IDs em Exclude element IDs. Quando ativada, o crawler continua a seguir as hiperligações encontradas dentro dos elementos excluídos (como menus de navegação nos cabeçalhos), mesmo que o conteúdo textual desses elementos seja excluído do treino.
Predefinição: Desativado (as hiperligações em elementos excluídos não são seguidas)
Caso de utilização: ative esta opção quando pretender excluir o conteúdo do cabeçalho ou rodapé do treino, mas ainda assim precisar de que o crawler descubra novas páginas através das hiperligações de navegação nessas áreas. Obtém assim o melhor dos dois mundos: dados de treino limpos e sem a poluição dos menus, sem abdicar de analisar o site por completo.
Importante: se utilizar a análise completa do website e excluir elementos como o cabeçalho sem ativar "Follow links in excluded elements", o crawler pode não conseguir descobrir páginas mais profundas (uma vez que os menus ficam frequentemente dentro dos cabeçalhos). Neste caso, ative esta opção ou utilize um sitemap, que representa o método mais seguro e eficiente.
Scraping Behavior
Extrair documentos
Campo: Advanced Settings > Scraping Behavior > Scrape documents (Extrair documentos)
Quando esta opção está ativada, o sistema extrai e processa o conteúdo de documentos encontrados no website. Atualmente, suporta ficheiros PDF.
Excluir hiperligações de imagens
Campo: Advanced Settings > Scraping Behavior > Exclude image links (Excluir hiperligações de imagens)
Ative esta opção para excluir todas as hiperligações de imagens do conjunto de dados de treino. Por predefinição, o sistema extrai todas as hiperligações de imagens, o que pode aumentar significativamente a contagem de carateres.
Ativar esta funcionalidade permite reduzir substancialmente a utilização de carateres.
Extrair conteúdo oculto
Campo: Advanced Settings > Scraping Behavior > Scrape hidden contents (Extrair conteúdo oculto)
Quando esta opção está ativada (predefinição), o sistema extrai o conteúdo de elementos HTML ocultos (elementos com display:none, visibility:hidden ou propriedades CSS semelhantes).
Predefinição: Ativado
Quando desativar: desative esta opção para ignorar conteúdo oculto e extrair apenas elementos visíveis. Isto é útil caso o website contenha conteúdo oculto como:
- Secções expansíveis (accordions) recolhidas
- Conteúdo exclusivo para telemóvel ou para computador
- Campos ocultos de formulários
- Comentários de programadores ou informações de depuração
Desativar esta opção pode poupar carateres e evitar que conteúdo oculto e desnecessário entre nos dados de treino.
Intervalo entre páginas
Campo: Advanced Settings > Scraping Behavior > Delay between pages (Intervalo entre páginas)
Adicione um intervalo (em segundos) entre a análise de cada página para evitar sobrecarregar o seu servidor. Muito útil para websites com limites de frequência de pedidos (rate limiting).
Simular visita a partir de um país específico
Campo: Advanced Settings > Scraping Behavior > Country code (Código de país)
Se o seu site apresentar conteúdos diferentes consoante a localização do visitante, introduza um código de país de 2 letras (por exemplo: US, PL, DE) para simular a análise a partir dessa região.
Configuração recomendada para a maioria dos websites
Para a generalidade dos websites, a configuração seguinte oferece o equilíbrio ideal entre uma cobertura de conteúdo abrangente e um consumo reduzido de carateres:
- Utilize o sitemap sempre que disponível para um controlo rigoroso dos URLs
- Exclua IDs de elementos:
header;footer;#navigation;.sidebar - Ative "Exclude image links" para remover os URLs de imagens do treino
- Desative "Scrape hidden contents" caso o seu site tenha muitos elementos ocultos
- Considere "Follow links in excluded elements" se optar pela análise completa e tiver excluído os cabeçalhos
Esta configuração reduz tipicamente a contagem de carateres entre 20-40%, mantendo todo o conteúdo de valor.
Resumo: boas práticas
- Utilize o sitemap em vez da análise completa para ter o controlo exato
- Inclua URLs para visar apenas conteúdos de valor
- Exclua URLs para ignorar páginas pesadas ou irrelevantes
- Ignore parâmetros de consulta para evitar conteúdo duplicado
- Exclua IDs de elementos para remover secções repetidas de páginas, como cabeçalhos e rodapés
- Controle a navegação em hiperligações com as opções "Follow only links in included elements" ou "Follow links in excluded elements" para um controlo detalhado do rastreio
- Exclua hiperligações de imagens para diminuir significativamente a contagem de carateres
- Desative a extração de conteúdo oculto se o seu site apresentar elementos ocultos dispensáveis
- Concentre-se em conteúdo útil para o seu bot (FAQs, páginas de produto, artigos de suporte)