Politécnico ICAFTPolitécnico ICAFT
BuscarContactoInscríbete →
Inicio/Educación continua/Curso libre
Curso libreInteligencia artificial y datos

Gestión de datos y big data

El curso Gestión de datos y big data proporciona al estudiante los conceptos y herramientas para gestionar grandes volúmenes de datos: gobierno y calidad según DAMA-DMBOK y la Ley 1581 de 2012, arquitecturas de bodega, lago y lakehouse con Parquet y Delta Lake, y procesamiento distribuido con Spark y PySpark, para participar en proyectos de datos a escala empresarial.

A quién va dirigido

Profesionales de tecnología y estudiantes de ingeniería con SQL básico.

Objetivos
✓Comprender las áreas de conocimiento del DAMA-DMBOK, los roles de propietario y custodio de datos y el uso de metadatos y catálogos.
✓Analizar las arquitecturas de bodega, lago y lakehouse, los formatos Parquet y Delta Lake y la arquitectura medallón.
✓Aplicar Apache Spark y PySpark con DataFrames distribuidos para procesar datos por lotes y en flujo.
✓Diseñar una arquitectura de datos para un caso empresarial según requisitos de volumen, velocidad y variedad.
✓Evaluar la arquitectura propuesta considerando costos, seguridad, calidad de datos y la Ley 1581 de 2012.
Plan de estudios por sesión
1
Gobierno de datos: áreas del DAMA-DMBOK y roles de propietario y custodioMetadatos y catálogo · Calidad de datos y Ley 1581 de 2012
2
Arquitecturas de bodega de datos, lago y lakehouseFormatos Parquet, Delta Lake y almacenamiento en la nube · Arquitectura medallón
3
Procesamiento distribuido: principios de Hadoop y MapReduceApache Spark, PySpark y DataFrames distribuidos · Procesamiento por lotes y en flujo
4
Presentación del diseño de arquitectura de datosRequisitos de volumen, velocidad, variedad y selección de tecnologías · Costos, seguridad y diagrama de arquitectura
Evaluación
Inicial30%Ficha de gobierno de datos de una organización con roles, metadatos y reglas de calidad conformes a la Ley 1581 de 2012.
Intermedio30%Comparativo de bodega, lago y lakehouse y ejercicio de procesamiento de un conjunto de datos en PySpark.
Final40%Proyecto final: diseño de arquitectura de datos para una empresa con procesamiento de un conjunto de datos grande en PySpark.
Proyecto final

Diseño de arquitectura de datos para una empresa con procesamiento de un conjunto de datos grande en PySpark.

WhatsApp