Cómo convertir una web en contenido limpio para IA y RAG
Recorre documentación, ayuda o blogs y genera una fila por página con URL, título, texto y Markdown sin menús ni avisos repetidos.
Enlace de afiliado. Procesa contenido propio, autorizado o permitido y no republica textos protegidos sin licencia.
Documentación
URL y alcance controlado
Markdown útil
Sin navegación ni modales
Respuesta con fuente
Texto, URL y metadatos
Actor seleccionado
Website Content Crawler
apify/website-content-crawler
Convierte páginas en texto, Markdown o HTML, descarga documentos compatibles y funciona con HTTP o navegador para sitios dinámicos.
Integración documentada con LangChain, LlamaIndex y bases vectoriales.
Consulta: 19 de julio de 2026.
Piloto seguro
Indexa 25 páginas de documentación
Acota el directorio y excluye cuenta, búsqueda y parámetros antes de ampliar.
apify/website-content-crawler- Inicio
startUrls - https://ejemplo.com/docs/ Directorio autorizado
- Máximo
maxCrawlPages - 25 Evita un rastreo abierto
- Crawler
crawlerType - cheerio HTTP para sitio estático
- Salida
- Markdown Conserva estructura útil
{
"startUrls": [{"url":"https://ejemplo.com/docs/"}],
"maxCrawlPages": 25,
"crawlerType": "cheerio",
"saveHtml": false,
"saveMarkdown": true
}- 01
Define qué debe saber la IA
Incluye documentación útil; excluye etiquetas, filtros, login y páginas duplicadas.
- 02
Empieza con HTTP
Es más rápido y económico; cambia a navegador si falta contenido renderizado.
- 03
Revisa 25 filas
Comprueba título, URL canónica, idioma y que el Markdown no incluya navegación repetida.
- 04
Conserva la procedencia
Cada fragmento enviado al índice debe mantener la URL para citar la respuesta.
Resultado
Una página, un documento trazable
| Campo | Valor | Uso |
|---|---|---|
url | /docs/configuracion | Cita y actualización |
metadata.title | Configurar una cuenta | Filtro y presentación |
markdown | # Configurar… | Fragmentación para RAG |
crawl.depth | 2 | Auditar alcance |
Costo por uso
Estima el modo HTTP
La documentación estima aproximadamente $0,20 por 1.000 páginas con HTTP; navegador puede costar $0,50–$5.
El navegador, proxies y complejidad elevan el consumo.
Preguntas
Calidad antes que volumen
¿HTTP o navegador?
HTTP para contenido estático; navegador si JavaScript es necesario. Valídalo con una muestra, no por intuición.
¿Esto crea el chatbot?
No. Prepara documentos limpios. Aún necesitas fragmentación, embeddings, recuperación y una interfaz de respuesta.
¿Puedo copiar cualquier web?
No. El acceso público no elimina derechos de autor ni términos; usa contenido propio o con autorización.
Primer índice
Valida 25 páginas antes de indexar todo
Una muestra revela ruido, duplicados y costo real.