Politécnico ICAFTPolitécnico ICAFT
BuscarContactoInscríbete →
Inicio/Educación continua/Curso libre
Curso libreInteligencia artificial y datos

Evaluación de modelos de IA

El curso Evaluación de modelos de IA proporciona al estudiante los métodos para medir si un modelo funciona bien: métricas para modelos predictivos, evaluación de modelos de lenguaje con conjuntos propios, rúbricas y jueces automáticos, y monitoreo en producción. Le sirve para decidir con evidencia qué modelo usar y cuándo cambiarlo, equilibrando costo, latencia y calidad.

A quién va dirigido

Desarrolladores, científicos de datos y líderes técnicos con conocimientos de aprendizaje automático.

Objetivos
✓Comprender las métricas de clasificación y regresión, la validación cruzada y el riesgo de fuga de datos.
✓Analizar los límites de los benchmarks públicos y los sesgos de los modelos usados como jueces.
✓Aplicar pruebas automatizadas de instrucciones, RAGAS, DeepEval y seguimiento de experimentos con Weights & Biases o MLflow.
✓Diseñar un conjunto de evaluación con casos representativos y casos borde y un plan de monitoreo de deriva en producción.
✓Evaluar comparativamente dos modelos para un caso de uso y documentar la recomendación con una tarjeta de modelo.
Plan de estudios por sesión
1
Evaluación de modelos predictivosMétricas de clasificación y regresión; validación cruzada y conjuntos de prueba intocables · Fuga de datos y evaluación por subgrupos
2
Evaluación de modelos de lenguajeBenchmarks públicos, sus límites y conjuntos de evaluación propios · Rúbricas, evaluación humana y modelos como jueces con sus sesgos
3
Herramientas de evaluaciónPruebas automatizadas de instrucciones y frameworks RAGAS y DeepEval · Experimentos con Weights & Biases o MLflow y comparación de costo, latencia y calidad
4
Presentación del proyecto final: evaluación comparativa de dos modelosDeriva de datos y de concepto, retroalimentación de usuarios, alertas y umbrales · Documentación con tarjetas de modelo y recomendación sustentada
Evaluación
Inicial30%Selección justificada de métricas para casos de clasificación, regresión y generación de texto con detección de fuga de datos.
Intermedio30%Construcción de un conjunto de evaluación propio y aplicación de rúbricas, evaluación humana y un modelo como juez.
Final40%Proyecto final: evaluación comparativa de dos modelos con conjunto de prueba, métricas, plan de monitoreo y recomendación sustentada.
Proyecto final

Plan y ejecución de la evaluación comparativa de dos modelos para un caso de uso, con conjunto de prueba, métricas y recomendación.

WhatsApp