Objetivos✓Comprender las características del Big Data, el almacenamiento distribuido y las arquitecturas lambda, kappa y lakehouse.
✓Analizar datos masivos con RDD, DataFrames y Spark SQL en Databricks, optimizando transformaciones y acciones.
✓Aplicar Delta Lake, ingesta incremental, Apache Airflow y controles de calidad en una arquitectura medallón bronce, plata y oro.
✓Diseñar flujos en tiempo real con Apache Kafka y Spark Structured Streaming con ventanas y marcas de agua.
✓Evaluar el rendimiento, el costo y la gobernanza de una solución analítica a escala con Spark MLlib, MLflow y BigQuery.
EvaluaciónInicial30%Diseño comparado de arquitecturas lambda, kappa y lakehouse para un caso; ejercicio con archivos Parquet en la nube.
Intermedio30%Cuaderno de PySpark y Spark SQL en Databricks; canalización medallón con Delta Lake orquestada en Airflow.
Final40%Proyecto final: flujo de datos lakehouse de extremo a extremo que ingiera, transforme y analice un conjunto masivo de datos con un componente en tiempo real, con evaluación de rendimiento y costo y sustentación.
Proyecto finalFlujo de datos lakehouse de extremo a extremo que ingiere, transforma y analiza un conjunto masivo de datos, con un componente en tiempo real.