Politécnico ICAFTPolitécnico ICAFT
BuscarContactoInscríbete →
Inicio/Educación continua/Curso libre
Curso libreInteligencia artificial y datos

Ingeniería de características para aprendizaje automático

El curso Ingeniería de características para aprendizaje automático proporciona al estudiante las técnicas para transformar datos crudos en variables que mejoren el desempeño de los modelos, con imputación, codificación, variables derivadas y selección integradas en pipelines reproducibles de scikit-learn que eviten la fuga de información.

A quién va dirigido

Estudiantes y analistas que ya entrenan modelos básicos en Python con pandas y scikit-learn.

Objetivos
✓Comprender el efecto de la imputación, el escalamiento y la codificación en el desempeño de un modelo.
✓Analizar variables de alta cardinalidad, fechas, texto y agregaciones para derivar variables con sentido de negocio.
✓Aplicar Pipeline y ColumnTransformer de scikit-learn con validación cruzada sin fuga de información.
✓Diseñar un conjunto de variables con TF-IDF, embeddings, rezagos, interacciones y razones de negocio.
✓Evaluar la selección de variables con importancia por permutación y eliminación recursiva frente a un modelo base.
Plan de estudios por sesión
1
Variables numéricas y categóricasImputación simple e iterativa, escalamiento, logaritmos y discretización · Codificación one-hot, ordinal y por objetivo; alta cardinalidad
2
Variables derivadasComponentes de fecha, rezagos y agregaciones por grupo · Texto con TF-IDF y embeddings; interacciones y razones de negocio
3
Pipelines y selección de variablesPipeline, ColumnTransformer y validación cruzada sin fuga · Importancia por permutación y selección recursiva de variables
4
Presentación del reto finalCompetencia interna sobre un conjunto de datos público · Comparación con un modelo base y documentación del pipeline
Evaluación
Inicial30%Ejercicio de imputación simple e iterativa, escalamiento y codificación one-hot, ordinal y por objetivo en un conjunto real.
Intermedio30%Taller de variables de fecha, rezagos, agregaciones por grupo y texto con TF-IDF y embeddings.
Final40%Pipeline de scikit-learn que mejora de forma medible un modelo base en un conjunto público, documentado y sustentado.
Proyecto final

Pipeline de scikit-learn con ingeniería de características que mejora de forma medible un modelo base en un conjunto de datos público.

WhatsApp