Este proyecto procesa datasets reales de TITANIC, Libreria y Clima aplicando transformaciones específicas.
- TITANIC: Dataset CSV local con información de pasajeros del Titanic.
- Libreria: Datos de libros obtenidos desde la API de Open Library (sujeto: fiction).
- Clima: Datos de clima en tiempo real obtenidos desde la API de Open-Meteo para Santiago, Chile.
-
TITANIC Survival Summary: Crea una tabla resumen con el conteo de pasajeros que sobrevivieron o no.
-
Libreria UniqueKey: Agrega una columna
UniqueKeycon llave única para cada libro en el dataset Libreria. -
Clima Average Temperature: Calcula el promedio de la temperatura en el dataset Clima y lo almacena como resumen.
-
TITANIC Filter Age: Elimina todas las filas de pasajeros menores de 10 años del dataset TITANIC.
- Eliminación de registros duplicados.
- Eliminación de filas con valores nulos críticos.
- Estandarización de nombres de columnas.
- Conversión de tipos de datos (numéricos, fechas).
pipeline.py: Orquestador principal que carga datos reales, limpia, transforma y guarda resultados.procesamiento/transformacion.py: Contiene las funciones de transformación.ingestion/: Módulo para cargar datos desde diferentes fuentes (CSV, APIs).data/processed/: Carpeta donde se guardan las versiones limpias de los datasets.
Ejecutar python pipeline.py para procesar los datos y ver el resumen en terminal. Todos los resultados se almacenan en el diccionario almacen_datos y las versiones limpias de los datasets se guardan en data/processed/.
- pandas
- requests