Politécnico ICAFTPolitécnico ICAFT
BuscarContactoInscríbete →
Inicio/Educación continua/Curso libre
Curso libreInteligencia artificial y datos

Librerías de datos en Python

El curso Librerías de datos en Python proporciona al estudiante criterios para elegir y usar las principales librerías del ecosistema de datos: NumPy, pandas, Polars, DuckDB, matplotlib, Plotly, Streamlit y scikit-learn. Le sirve para trabajar con archivos grandes en formato Parquet y construir flujos eficientes que van del procesamiento a la visualización y el modelado.

A quién va dirigido

Personas con Python básico y nociones de pandas que quieren ampliar su caja de herramientas.

Objetivos
✓Comprender la vectorización, la difusión y el rendimiento de los arreglos de NumPy frente a los ciclos de Python.
✓Analizar diferencias de rendimiento y sintaxis entre pandas y Polars sobre un mismo problema.
✓Aplicar DuckDB, Parquet y Apache Arrow para consultar con SQL archivos grandes en un equipo local.
✓Diseñar un flujo de preprocesamiento y modelado con pipelines y ColumnTransformer de scikit-learn.
✓Evaluar qué librería conviene en cada etapa de un flujo de datos según volumen, velocidad y facilidad de mantenimiento.
Plan de estudios por sesión
1
Cómputo numérico con NumPyArreglos, vectorización, difusión y operaciones de álgebra · Generación de números aleatorios y rendimiento frente a ciclos de Python
2
DataFrames modernospandas con índices y tipos eficientes; Polars con expresiones y evaluación diferida · Formato Parquet, Apache Arrow y DuckDB para SQL analítico en local
3
Visualización y tableros ligerosmatplotlib, seaborn y Plotly para gráficos interactivos · Tableros con Streamlit y exportación de gráficos para informes
4
Presentación del proyecto final: flujo de datos de extremo a extremoTransformadores, pipelines y ColumnTransformer para datos mixtos en scikit-learn · Entrenamiento, validación cruzada y persistencia de modelos
Evaluación
Inicial30%Taller comparativo de cálculos vectorizados en NumPy frente a ciclos de Python con medición de tiempos.
Intermedio30%Ejercicio que resuelve un mismo problema en pandas, Polars y DuckDB sobre archivos Parquet y compara resultados.
Final40%Proyecto final: flujo que procesa un archivo grande con Polars o DuckDB, lo visualiza en Streamlit y entrena un modelo, con sustentación.
Proyecto final

Flujo de datos que procesa un archivo grande con Polars o DuckDB, lo visualiza en Streamlit y entrena un modelo con scikit-learn.

WhatsApp