ETL de datos puntuales (Point Data ETL)¶
Contenedor: Python 3.10
Procesa datos climáticos de estaciones meteorológicas y almacena los resultados en la base de datos.
Validation data¶
Verifica la calidad de los datos entrantes de estaciones, asegurando que los registros estén completos y consistentes antes de su procesamiento.
Responsabilidades
- Verificar que los registros entrantes estén completos y sean consistentes
- Identificar valores inválidos o fuera de rango
- Llenar valores faltantes usando la climatología de la estación
Funcionalidades clave detalladas:
- Verificaciones de integridad — Valida la completitud y consistencia de cada registro.
- Imputación — Llena vacíos usando la climatología de la estación cuando está disponible.
CSV extract data (conector)¶
Lee observaciones de estaciones desde archivos CSV, actuando como punto de ingreso de datos del pipeline.
Responsabilidades
- Leer observaciones de estaciones desde archivos CSV
- Parsear y estandarizar los datos antes del procesamiento
- Soportar múltiples proveedores con formato estandarizado
Funcionalidades clave detalladas:
- Parseo de archivos — Convierte filas CSV en registros de observación.
- Preparación de datos — Estandariza observaciones para el pipeline.
Calculate Monthly data¶
Agrega observaciones diarias en valores mensuales, reduciendo el volumen de datos mientras conserva los patrones climáticos esenciales.
Responsabilidades
- Agregar observaciones diarias en valores mensuales
- Preservar patrones climáticos esenciales
- Alimentar la base de datos con datos agregados
Funcionalidades clave detalladas:
- Agregación temporal — Agrupa registros diarios por mes y medida.
- Salida mensual — Produce valores mensuales para almacenamiento.
Calculate Climatology¶
Calcula los promedios climatológicos de largo plazo por estación y mes, sirviendo como línea base de referencia.
Responsabilidades
- Calcular promedios de largo plazo por estación y mes
- Proporcionar valores de referencia para detección de anomalías
- Almacenar normales climatológicas en la base de datos
Funcionalidades clave detalladas:
- Normales mensuales — Calcula el valor medio de cada mes y medida.
- Línea base — Sirve como referencia para comparar condiciones actuales.
Calculate Indicators¶
Genera indicadores puntuales a partir de datos procesados, aplicando fórmulas configuradas.
Responsabilidades
- Aplicar fórmulas de indicadores configuradas a datos de estaciones
- Producir métricas derivadas que resumen patrones climáticos
- Almacenar resultados en la base de datos
Funcionalidades clave detalladas:
- Cálculo de indicadores — Calcula días secos consecutivos, estrés hídrico, precipitación acumulada.
- Configurable por país — Indicadores definidos por país mediante el ORM.
Main script¶
Coordina la ejecución del pipeline, gestionando la secuencia de operaciones y persistiendo resultados.
Responsabilidades
- Orquestar el orden de ejecución del pipeline
- Gestionar configuración y registro durante ejecución
- Asegurar persistencia correcta de resultados
Funcionalidades clave detalladas:
- Orquestación — Ejecuta etapas en secuencia.
- Gestión de ejecución — Configura parámetros y coordina el flujo.
Para instrucciones de instalación, consultar el README del repositorio: github.com/CIAT-DAPA/aclimate_v3_historical_location_etl