Politécnico ICAFTPolitécnico ICAFT
BuscarContactoInscríbete →
Inicio/Educación continua/Seminario
SeminarioInteligencia artificial y datos

Big Data

El seminario Big Data proporciona al estudiante las arquitecturas y herramientas para almacenar y procesar grandes volúmenes de datos, desde Hadoop y los data lakes hasta Apache Spark, Delta Lake, Kafka y bases NoSQL en la nube. Le permite procesar conjuntos masivos con PySpark, participar en proyectos de datos a gran escala y dialogar con equipos de ingeniería de datos con criterio técnico.

A quién va dirigido

Profesionales de tecnología y analistas con SQL básico y nociones de Python.

Objetivos
✓Comprender las características del Big Data y el papel de Hadoop, HDFS, data lake, data warehouse y lakehouse.
✓Analizar las opciones de servicios en AWS, Azure y Google Cloud y sus implicaciones de costos y seguridad.
✓Aplicar PySpark y Spark SQL con particiones y optimización en Databricks Free Edition o Google Colab.
✓Diseñar el almacenamiento de datos con Parquet, Delta Lake, bases NoSQL y flujos de eventos con Apache Kafka.
✓Evaluar una arquitectura de datos para un caso organizacional considerando calidad, gobierno y analítica con Spark MLlib.
Plan de estudios por sesión
1
Big Data y su ecosistemaCaracterísticas del Big Data: volumen, velocidad y variedad · Hadoop, HDFS y MapReduce
2
Arquitecturas y nubeData lake, data warehouse y lakehouse · Servicios de nube: AWS, Azure y Google Cloud
3
Procesamiento con SparkDataFrames en PySpark · Spark SQL
4
Optimización y práctica en la nubeParticiones y optimización · Práctica en Databricks Free Edition o Google Colab
5
Formatos y bases NoSQLFormatos Parquet y Delta Lake · Bases NoSQL: MongoDB y Cassandra
6
Eventos, calidad y gobiernoApache Kafka para eventos · Calidad y gobierno de datos
7
Analítica a gran escalaAprendizaje automático con Spark MLlib · Visualización sobre grandes volúmenes
8
Presentación del proyecto finalCostos y seguridad en la nube · Diseño de la arquitectura del caso
Evaluación
Inicial30%Cuadro comparativo de data lake, data warehouse y lakehouse; quiz sobre el ecosistema Hadoop y servicios de nube.
Intermedio30%Cuaderno en Databricks o Colab con transformaciones en PySpark y consultas en Spark SQL sobre un conjunto de datos grande.
Final40%Proyecto final: procesamiento con PySpark de un conjunto masivo abierto y propuesta de arquitectura de datos con sustentación.
Proyecto final

Procesamiento con PySpark de un conjunto de datos masivo abierto y propuesta de arquitectura de datos para una organización.

WhatsApp