El curso Procesamiento de datos a gran escala con PySpark proporciona al estudiante las técnicas para procesar volúmenes de datos que superan la memoria de un computador con Apache Spark desde Python, usando DataFrames, Spark SQL, Parquet y Delta Lake, de modo que pueda construir canalizaciones por capas bronce, plata y oro.
Analistas e ingenieros de datos con Python, pandas y SQL de nivel intermedio.
Canalización en PySpark que procesa un conjunto de datos abiertos de gran volumen en capas bronce, plata y oro, con consultas analíticas finales.