Politécnico ICAFTPolitécnico ICAFT
BuscarContactoInscríbete →
Inicio/Educación continua/Curso libre
Curso libreInteligencia artificial y datos

Procesamiento de datos a gran escala con PySpark

El curso Procesamiento de datos a gran escala con PySpark proporciona al estudiante las técnicas para procesar volúmenes de datos que superan la memoria de un computador con Apache Spark desde Python, usando DataFrames, Spark SQL, Parquet y Delta Lake, de modo que pueda construir canalizaciones por capas bronce, plata y oro.

A quién va dirigido

Analistas e ingenieros de datos con Python, pandas y SQL de nivel intermedio.

Objetivos
✓Comprender la ejecución distribuida de Spark con controlador, ejecutores, particiones, transformaciones perezosas y acciones.
✓Analizar el plan de ejecución y el shuffle para identificar cuellos de botella en trabajos de Spark.
✓Aplicar la API de DataFrames y Spark SQL para leer, filtrar, unir y agregar datos con funciones de ventana.
✓Diseñar una canalización medallón con Delta Lake, particionamiento y caché en Databricks Free Edition.
✓Evaluar tiempos de ejecución y el costo de funciones definidas por el usuario frente a pandas y Polars.
Plan de estudios por sesión
1
Arquitectura de SparkControlador, ejecutores, particiones, transformaciones perezosas y acciones · Databricks Free Edition, Spark local y comparación con pandas y Polars
2
DataFrames y Spark SQLLectura de CSV, JSON y Parquet; filtros, uniones y funciones de ventana · Spark SQL, vistas temporales y costo de funciones definidas por el usuario
3
Rendimiento y almacenamientoPlan de ejecución, shuffle, particionamiento y caché · Delta Lake con transacciones y viaje en el tiempo; arquitectura medallón
4
Presentación de la canalización de extremo a extremoDatos abiertos de gran volumen en capas bronce, plata y oro · Informe de tiempos de ejecución
Evaluación
Inicial30%Ejercicio en Databricks Free Edition o Spark local que compara transformaciones y acciones con pandas y Polars.
Intermedio30%Taller de lectura de CSV, JSON y Parquet, uniones, funciones de ventana y consultas con Spark SQL.
Final40%Canalización en PySpark sobre datos abiertos de gran volumen en capas bronce, plata y oro, con informe de tiempos y sustentación.
Proyecto final

Canalización en PySpark que procesa un conjunto de datos abiertos de gran volumen en capas bronce, plata y oro, con consultas analíticas finales.

WhatsApp