Evaluación de Modelos
La evaluación de modelos mide cómo de bien un modelo generaliza a datos nuevos, no cómo reproduce los del entrenamiento. Explicamos la partición en entrenamiento, validación y prueba, la validación cruzada, las métricas por tarea y conceptos clave como el compromiso sesgo-varianza y la fuga de datos.
La evaluación de modelos es el proceso de medir cómo de bien un modelo entrenado generaliza a datos nuevos no vistos, y no cómo de bien reproduce los datos con los que se entrenó. Su finalidad es estimar el rendimiento futuro para juzgar la calidad del modelo, compararlo con otros y decidir si es apto. Evaluar un modelo sobre los mismos datos con los que se entrenó es un error metodológico: puede parecer perfecto y fallar con datos reales.
Partición de datos y validación cruzada
Por eso los datos se separan en tres conjuntos: entrenamiento, para ajustar el modelo; validación, para afinar los hiperparámetros y vigilar la generalización; y prueba, reservado para una estimación final imparcial. Cuando hay pocos datos, la validación cruzada ayuda: divide el conjunto de entrenamiento en varias partes, entrena y valida rotando cuál se deja fuera, y promedia el resultado, dando una estimación más robusta.
Las métricas
Las métricas dependen de la tarea. En clasificación se usan la exactitud —engañosa con clases desbalanceadas—, la precisión, el recall, su media armónica (la F1), la matriz de confusión y el área bajo la curva ROC. En regresión, el error cuadrático medio, el error absoluto medio y el coeficiente de determinación R².
Conceptos que conviene tener presentes
Evaluar bien exige entender el compromiso entre sesgo y varianza y distinguir el subajuste (modelo demasiado simple) del sobreajuste (modelo que memoriza el entrenamiento). También conviene separar la función de pérdida, que se optimiza, de la métrica, que se reporta, y evitar la fuga de datos: usar al evaluar información que no estaría disponible en el momento de predecir, lo que da estimaciones engañosamente optimistas.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.