Añadir fuentes web permite que tu chatbot aprenda directamente del contenido de tu sitio web. Ya sea información de productos, preguntas frecuentes o publicaciones de blog, rastrear tu sitio web garantiza que el chatbot pueda ofrecer respuestas precisas y actualizadas basadas en el contenido real de tu sitio.
Dónde encontrar el entrenamiento mediante sitios web
Selecciona tu chatbot y, a continuación, dirígete a la pestaña Training (Entrenamiento). En la barra lateral izquierda, elige Links (Enlaces). Aquí es donde gestionas todas las fuentes de entrenamiento basadas en sitios web.
Haz clic en Add New Training: Website (Añadir nuevo entrenamiento: Sitio web) para abrir el formulario de entrenamiento.
Opciones de rastreo
El formulario de entrenamiento te ofrece dos formas de añadir contenido web, separadas por el divisor OR (O).
Scan website contents (Escanear contenidos del sitio web) - Introduce una URL en el campo Address (Dirección) y elige entre:
- Whole website (Todo el sitio web) - Rastrea todas las páginas detectables a partir de la URL que indiques
- Single address (Dirección única) - Escanea únicamente la página específica que introduzcas
Use sitemap (Usar mapa del sitio) - Introduce la URL de tu sitemap (p. ej. https://www.tudominio.com/sitemap.xml) en el campo Sitemap (Mapa del sitio). Esto escanea únicamente las páginas enumeradas en tu archivo sitemap.
Al usar un sitemap, el campo Address se desactiva automáticamente (y viceversa), ya que solo puedes usar un método por tarea de entrenamiento.
Entrenar con todo el sitio web
- Introduce la URL raíz de tu sitio web en el campo Address (p. ej.
https://www.tudominio.com) - Selecciona Whole website en el menú desplegable situado bajo el campo de dirección
- Haz clic en Start scanning the website (Iniciar escaneo del sitio web)
El sistema rastreará tu sitio web siguiendo los enlaces para descubrir todas las páginas. Puedes monitorizar el progreso en la pestaña Trainings (Entrenamientos), donde verás el número de enlaces escaneados y los caracteres de entrenamiento recopilados en tiempo real.
Entrenar con una sola página
- Introduce la URL de la página específica en el campo Address (p. ej.
https://www.tudominio.com/pricing) - Selecciona Single address en el menú desplegable
- Haz clic en Start scanning the website
Esto resulta útil cuando solo necesitas añadir una página concreta a la base de conocimiento de tu chatbot, por ejemplo un artículo recién publicado o una página de preguntas frecuentes actualizada.
Entrenar con un sitemap
- Introduce la URL de tu sitemap en el campo Sitemap (p. ej.
https://www.tudominio.com/sitemap.xml) - Haz clic en Start scanning the website
El rastreo mediante sitemap te da un control preciso sobre qué páginas se incluyen, ya que solo procesa las URL enumeradas en tu archivo sitemap.
Seleccionar páginas individuales para el entrenamiento
Antes de iniciar un escaneo, puedes activar la opción I want to select individual urls for training after scanning the website (Quiero seleccionar URL individuales para el entrenamiento después de escanear el sitio web). Esta opción solo está disponible al escanear un sitio web completo (no en el modo de dirección única).
Cuando está activada:
- El sistema escanea tu sitio web y detecta todas las páginas
- Al terminar el escaneo, verás una vista en árbol de todas las páginas descubiertas junto con su recuento de caracteres
- Marca o desmarca páginas para incluirlas o excluirlas del entrenamiento
- Haz clic en Start the Training (Iniciar el entrenamiento) para comenzar a entrenar con las páginas seleccionadas
Esto resulta útil cuando tu sitio web contiene páginas con las que no quieres que el chatbot aprenda, como pantallas de inicio de sesión, áreas de administración o secciones no pertinentes.
Escanear idiomas del sitio web
Si tu sitio web está publicado en más de un idioma, ChatLab detecta los idiomas disponibles durante el escaneo y te permite decidir cuáles incluir en la base de conocimiento de tu chatbot. Encontrarás estos controles en la sección Languages (Idiomas) del formulario de entrenamiento, justo encima de Advanced settings (Ajustes avanzados).
Alcance de idiomas
El menú desplegable Language scope (Alcance de idioma) controla qué parte de un sitio multilingüe se escanea:
- Main website language (recommended) (Idioma principal del sitio web [recomendado]) - la opción predeterminada. Solo se escanea el idioma principal del sitio. Las demás versiones de idioma se omiten. Esto mantiene tus datos de entrenamiento ordenados y centrados, y consume menos capacidad de entrenamiento.
- All languages (Todos los idiomas) - escanea cada versión de idioma del sitio. Esto recopila todas tus páginas localizadas, pero extrae más contenido y utiliza más capacidad de entrenamiento.
- Selected language (Idioma seleccionado) - escanea un solo idioma que elijas entre los detectados en el sitio.
ChatLab detecta automáticamente el idioma principal de tu sitio web y lo utiliza de forma predeterminada. Cuando eliges Selected language, el idioma principal detectado aparece preseleccionado y marcado como "main" en la lista. Puedes cambiarlo a cualquier otro idioma detectado.
La detección de idiomas está disponible en todos los planes, incluido el plan FREE. En el plan FREE, el idioma de la página también se detecta y solo se escanea el idioma principal, a menos que cambies el alcance a All languages.
Método de detección de idiomas
Cuando el alcance está configurado en Main website language o Selected language, puedes elegir cómo reconoce ChatLab las versiones de idioma de tu sitio mediante el menú desplegable Language detection method (Método de detección de idioma):
- Hreflang attributes (recommended) (Atributos hreflang [recomendado]) - la opción predeterminada. Utiliza el marcado
hreflangylangque la mayoría de los sitios multilingües ya incluyen para vincular sus versiones de idioma. - URL path prefix (/en/, /de/, ...) (Prefijo de ruta de URL [/en/, /de/, ...]) - para sitios que organizan cada idioma bajo un segmento de ruta como
/en/,/de/o/fr/sin ningún marcadohreflang.
Si ChatLab no puede detectar los idiomas automáticamente, aun así puedes escanear el idioma principal o todos los idiomas. Al elegir Selected language, introduce primero la dirección de tu sitio web en los campos superiores y luego vuelve a seleccionar la opción para que el sitio pueda analizarse.
Para obtener una visión general de cómo utiliza tu chatbot estas versiones de idioma al responder, consulta Chatbots multilingües y Configuración de idioma del chatbot. Los modos de idioma de la base de conocimiento descritos allí dependen de fuentes que se escanearon con detección de idioma, por lo que es posible que debas reentrenar las fuentes más antiguas para aprovecharlos al máximo.
Ajustes avanzados
Haz clic en el botón Advanced settings en el formulario de entrenamiento para acceder a controles de escaneo más específicos.
Los ajustes avanzados se organizan en cuatro secciones:
Filtrado de URL
- Include only URLs that contain (Incluir solo las URL que contengan) - Escanea únicamente las URL que coincidan con estos patrones (separados por punto y coma, p. ej.
/en;/help) - Exclude URLs that contain (Excluir las URL que contengan) - Omite las URL que coincidan con estos patrones (p. ej.
/news;/pictures). Patrones comunes como/wp-admin/,/feed/y páginas del carrito de compra se excluyen de forma predeterminada
Parámetros de consulta
- Ignore all query parameters (Ignorar todos los parámetros de consulta) - Trata las URL con diferentes parámetros de consulta como la misma página (p. ej.
/page?id=1y/page?id=2pasan a ser ambas/page) - Ignore specific query parameters (Ignorar parámetros de consulta específicos) - Ignora solo ciertos parámetros (los parámetros de seguimiento comunes como
utm_source,fbclid,gclidse ignoran automáticamente)
Filtrado de contenido
- Include element IDs (Incluir IDs de elementos) - Extrae contenido solo de elementos HTML específicos (usa
#idpara identificadores,.classnamepara clases,[data-id="82874db"]para elementos con un atributo determinado, separados por punto y coma) - Exclude element IDs (Excluir IDs de elementos) - Omite el contenido de elementos HTML específicos (p. ej.
footer;header;#navigation;[data-nosnippet]) - Al definir elementos para incluir o excluir, aparecen selectores condicionales que te permiten controlar si el rastreador debe seguir los enlaces encontrados dentro de dichos elementos
Comportamiento de rastreo
- Scrape documents (Extraer documentos) - Extrae también el contenido de los archivos PDF encontrados en el sitio web
- Exclude image links (Excluir enlaces de imágenes) - Omite las URL de imágenes del conjunto de datos de entrenamiento
- Scrape hidden contents (Extraer contenidos ocultos) - Incluye el contenido de elementos HTML ocultos (activado de forma predeterminada)
- Delay between pages (Retardo entre páginas) - Añade un retardo en segundos entre las solicitudes de páginas para reducir la carga del servidor
- Country code (Código de país) - Enruta el rastreo a través de un servidor proxy en un país específico (código de dos letras, p. ej.
us)
Notificaciones por correo electrónico
La opción Email me when training is finished or needs my attention (Enviarme un correo electrónico cuando el entrenamiento termine o requiera mi atención) está activada de forma predeterminada. Cuando está activa, recibes una notificación por correo electrónico cuando:
- El entrenamiento finaliza correctamente
- El sistema necesita tu intervención (p. ej., seleccionar páginas tras un escaneo)
- Surge algún problema durante el entrenamiento
Puedes cambiar la dirección de correo para las notificaciones en el campo situado junto a la opción.
Monitorizar el progreso del entrenamiento
Tras iniciar un escaneo, cambia a la pestaña Trainings para monitorizar el progreso. Cada tarea de entrenamiento muestra:
- La URL de origen
- El estado actual (Scanning links, Awaiting links selection, Training, Training completed)
- Una barra de progreso durante el escaneo o entrenamiento activo
- La fecha de la última actualización
Haz clic en More details (Más detalles) para ver todos los parámetros utilizados en una tarea de entrenamiento específica, incluidos los ajustes avanzados que se hayan configurado.
Gestionar enlaces entrenados
Una vez completado el entrenamiento, todas las páginas escaneadas aparecen en la pestaña Links. Cada enlace muestra:
- El título de la página y la URL
- El recuento de caracteres (tamaño de los datos de entrenamiento)
- El estado del entrenamiento
- La fecha de última actualización
En cada enlace puedes:
- Retrain (Reentrenar) - Volver a escanear y actualizar el contenido de esta página específica
- View (Ver) - Ver el contenido exacto que se extrajo de la página
- Delete (Eliminar) - Quitar esta página de la base de conocimiento de tu chatbot
Utiliza la casilla Select all (Seleccionar todo) y los botones de acción masiva para reentrenar o eliminar varios enlaces a la vez.
Ver contenido escaneado
Haz clic en el botón View junto a cualquier enlace entrenado para ver exactamente qué contenido se extrajo de esa página.
El modal para ver la fuente muestra el título de la página, la URL, el recuento de caracteres, la fecha de última actualización y el texto completo con el que se entrenó tu chatbot. Esto te ayuda a verificar que se haya capturado el contenido correcto y a entender la base de conocimiento de tu chatbot.
Artículos relacionados
- Entrenamiento en segundo plano - Aprende cómo funciona el entrenamiento en segundo plano
- Reentrenar tu chatbot - Cómo actualizar tu chatbot con contenido nuevo
- Cómo reducir los caracteres de entrenamiento al escanear un sitio web - Consejos para optimizar el tamaño de tus datos de entrenamiento
- Entrenar tu chatbot: conceptos básicos y límites - Comprender los límites de los datos de entrenamiento