Politécnico ICAFTPolitécnico ICAFT
BuscarContactoInscríbete →
Inicio/Educación continua/Diplomado
DiplomadoInteligencia artificial y datos

Big Data y analítica avanzada

El diplomado Big Data y analítica avanzada proporciona al estudiante arquitecturas y herramientas para procesar grandes volúmenes de datos en lote y en tiempo real con Spark, Kafka, Delta Lake, Airflow y plataformas lakehouse en la nube, junto con analítica y aprendizaje automático a escala. Le permite diseñar soluciones de datos que crecen con la organización.

A quién va dirigido

Profesionales de tecnología y datos con SQL y Python básico.

Objetivos
✓Comprender las características del Big Data, el almacenamiento distribuido y las arquitecturas lambda, kappa y lakehouse.
✓Analizar datos masivos con RDD, DataFrames y Spark SQL en Databricks, optimizando transformaciones y acciones.
✓Aplicar Delta Lake, ingesta incremental, Apache Airflow y controles de calidad en una arquitectura medallón bronce, plata y oro.
✓Diseñar flujos en tiempo real con Apache Kafka y Spark Structured Streaming con ventanas y marcas de agua.
✓Evaluar el rendimiento, el costo y la gobernanza de una solución analítica a escala con Spark MLlib, MLflow y BigQuery.
Plan de estudios por sesión
1
Características y almacenamiento del Big DataVolumen, velocidad y variedad · Almacenamiento distribuido y formatos Parquet
2
Arquitecturas de datos y proveedores de nubeArquitecturas lambda, kappa y lakehouse · Nube: AWS, Azure y Google Cloud
3
Procesamiento distribuido con SparkRDD y DataFrames · Transformaciones y acciones
4
Spark SQL y práctica en DatabricksSpark SQL y optimización · Práctica en Databricks
5
Arquitectura medallón con Delta LakeDelta Lake y arquitectura medallón · Ingesta incremental
6
Orquestación y calidad de datosOrquestación con Apache Airflow · Calidad de datos
7
Mensajería y procesamiento en flujoApache Kafka: productores, consumidores y tópicos · Spark Structured Streaming
8
Ventanas temporales y casos en tiempo realVentanas y marcas de agua · Casos de uso: fraude e IoT
9
Aprendizaje automático a escalaSpark MLlib · Seguimiento de modelos con MLflow
10
Analítica y tableros sobre el lakehouseConsultas analíticas con BigQuery · Tableros sobre el lakehouse
11
Arquitectura e implementación del flujo del proyectoArquitectura propuesta · Implementación del flujo
12
Presentación del proyecto final: flujo lakehouse con componente en tiempo realEvaluación de rendimiento y costo · Sustentación
Evaluación
Inicial30%Diseño comparado de arquitecturas lambda, kappa y lakehouse para un caso; ejercicio con archivos Parquet en la nube.
Intermedio30%Cuaderno de PySpark y Spark SQL en Databricks; canalización medallón con Delta Lake orquestada en Airflow.
Final40%Proyecto final: flujo de datos lakehouse de extremo a extremo que ingiera, transforme y analice un conjunto masivo de datos con un componente en tiempo real, con evaluación de rendimiento y costo y sustentación.
Proyecto final

Flujo de datos lakehouse de extremo a extremo que ingiere, transforma y analiza un conjunto masivo de datos, con un componente en tiempo real.

WhatsApp