Extraer datos de sitios web multi-página y guardar en Google Drive
Descripción del flujo de trabajo
Flujo de trabajo automatizado que extrae contenido de múltiples URLs usando solicitudes HTTP, procesa y filtra datos con lógica condicional, luego organiza resultados en Google Drive en lotes controlados para evitar sobrecargas.
Cómo funciona
- 1.Recibir lista de URLs manualmente o desde fuente externa
- 2.Dividir enlaces en lotes procesables con limitación de velocidad
- 3.Obtener cada página web mediante HTTP y analizar contenido XML
- 4.Filtrar y extraer datos requeridos usando condiciones personalizadas
- 5.Guardar resultados procesados como archivos organizados en Google Drive
Casos de uso
- Monitorear precios de productos en múltiples páginas y registrar cambios
- Recopilar listados de empleos o inmuebles de sitios clasificados
- Extraer artículos de noticias o blogs periódicamente para archivo
Requisitos
- URLs válidas y accesibles desde la red de n8n
- Cuenta Google Drive activa con permisos de escritura
- Comprensión básica de estructura HTML/XML del sitio destino
Valor del servicio
Ideal como servicio de automatización operativa para conectar sistemas, reducir tareas manuales y acelerar la entrega de resultados a clientes o equipos internos.
Aplicaciones utilizadas
Detalles
Cómo usar
- 1.Haz clic en "Descargar plantilla"
- 2.Abre tu panel de n8n
- 3.Ve a Workflows > Import from File
- 4.Selecciona el archivo descargado y configura las credenciales
Nodos utilizados (16)
Sticky Note
Sticky Note
When clicking ‘Test workflow’
Manual Trigger
Loop Over Items
Split In Batches
Wait
Wait
Limit
Limit
Get List of Website URLs
HTTP Request
Convert to JSON
Xml
Create List of Website URLs
Split Out
Filter By Topics or Pages
Filter
Set Website URL
Set
Jina.ai Web Scraper
HTTP Request
Save Webpage Contents to Google Drive
Google Drive
Extract Title & Markdown Content
Code
Sticky Note1
Sticky Note
Sticky Note2
Sticky Note
Sticky Note3
Sticky Note