Cómo convertir una web en contenido limpio para IA y RAG

Recorre documentación, ayuda o blogs y genera una fila por página con URL, título, texto y Markdown sin menús ni avisos repetidos.

Enlace de afiliado. Procesa contenido propio, autorizado o permitido y no republica textos protegidos sin licencia.

Flujo para RAGDel sitio al conocimiento con fuente
01Sitio

Documentación

URL y alcance controlado

02Limpieza

Markdown útil

Sin navegación ni modales

03RAG

Respuesta con fuente

Texto, URL y metadatos

El crawler prepara documentos; la calidad final también depende de fragmentación, embeddings y recuperación.

Actor seleccionado

Website Content Crawler

apify/website-content-crawler

Convierte páginas en texto, Markdown o HTML, descarga documentos compatibles y funciona con HTTP o navegador para sitios dinámicos.

A
Desarrollado y mantenido porApify

Integración documentada con LangChain, LlamaIndex y bases vectoriales.

Ver ficha oficial
4,6 / 5212 reseñas
141 milusuarios totales
8,1 milusuarios mensuales
2,6 milfavoritos

Consulta: 19 de julio de 2026.

Piloto seguro

Indexa 25 páginas de documentación

Acota el directorio y excluye cuenta, búsqueda y parámetros antes de ampliar.

Inputapify/website-content-crawler
Inicio startUrls
https://ejemplo.com/docs/
Directorio autorizado
Máximo maxCrawlPages
25
Evita un rastreo abierto
Crawler crawlerType
cheerio
HTTP para sitio estático
Salida
Markdown
Conserva estructura útil
  1. 01

    Define qué debe saber la IA

    Incluye documentación útil; excluye etiquetas, filtros, login y páginas duplicadas.

  2. 02

    Empieza con HTTP

    Es más rápido y económico; cambia a navegador si falta contenido renderizado.

  3. 03

    Revisa 25 filas

    Comprueba título, URL canónica, idioma y que el Markdown no incluya navegación repetida.

  4. 04

    Conserva la procedencia

    Cada fragmento enviado al índice debe mantener la URL para citar la respuesta.

Resultado

Una página, un documento trazable

CampoValorUso
url/docs/configuracionCita y actualización
metadata.titleConfigurar una cuentaFiltro y presentación
markdown# Configurar…Fragmentación para RAG
crawl.depth2Auditar alcance

Costo por uso

Estima el modo HTTP

La documentación estima aproximadamente $0,20 por 1.000 páginas con HTTP; navegador puede costar $0,50–$5.

Páginas HTTP

1.000 páginas.

Estimación HTTP$0,20

El navegador, proxies y complejidad elevan el consumo.

Preguntas

Calidad antes que volumen

¿HTTP o navegador?

HTTP para contenido estático; navegador si JavaScript es necesario. Valídalo con una muestra, no por intuición.

¿Esto crea el chatbot?

No. Prepara documentos limpios. Aún necesitas fragmentación, embeddings, recuperación y una interfaz de respuesta.

¿Puedo copiar cualquier web?

No. El acceso público no elimina derechos de autor ni términos; usa contenido propio o con autorización.

Primer índice

Valida 25 páginas antes de indexar todo

Una muestra revela ruido, duplicados y costo real.

Probar Website Content Crawler