Overfitting
El overfitting, o sobreajuste, es uno de los problemas centrales del aprendizaje automático: ocurre cuando un modelo se ajusta tan bien a los datos de entrenamiento —incluido su ruido— que generaliza mal a datos nuevos. Explicamos cómo se detecta, su contraste con el subajuste y el compromiso sesgo-varianza, y las técnicas para mitigarlo.
El overfitting, o sobreajuste, ocurre cuando un modelo de aprendizaje automático se ajusta demasiado bien a los datos de entrenamiento —hasta el punto de memorizar su ruido y sus peculiaridades— y, como consecuencia, generaliza mal a datos nuevos no vistos. El modelo aprende el «examen» de memoria en lugar de la materia, y por eso fracasa cuando llegan preguntas distintas. Es el enemigo natural del objetivo de todo modelo: generalizar bien.
Cómo se detecta
El síntoma característico es una brecha: el error sobre los datos de entrenamiento es muy bajo, pero el error sobre un conjunto de validación o prueba es alto. Si al entrenar la pérdida sigue bajando en el entrenamiento pero empieza a subir en la validación, es señal de que el modelo ha empezado a sobreajustar.
Su opuesto y el compromiso de fondo
En el extremo contrario está el subajuste (underfitting): un modelo demasiado simple que no capta el patrón ni siquiera en los datos de entrenamiento. Ambos son las dos caras del compromiso entre sesgo y varianza: el subajuste corresponde a un sesgo alto (el modelo es rígido), y el sobreajuste, a una varianza alta (el modelo es tan flexible que se amolda al ruido). El punto óptimo está en equilibrio.
Cómo evitarlo
Existe un buen arsenal de remedios. Conseguir más datos o generarlos mediante aumento de datos; usar la validación cruzada para vigilar la generalización; aplicar regularización (penalizaciones L1 o L2) para frenar la complejidad; simplificar el modelo; detener el entrenamiento a tiempo (early stopping); recurrir al dropout en redes neuronales; o podar los árboles de decisión. Todas persiguen lo mismo: que el modelo aprenda el patrón, no el ruido.
Un matiz moderno
La imagen clásica del sobreajuste como una simple curva en U tiene hoy un matiz interesante: el fenómeno del «doble descenso», observado en modelos muy grandes. En ciertos regímenes, seguir aumentando el tamaño del modelo más allá del punto en que parecía sobreajustar vuelve a mejorar el rendimiento, un comportamiento contraintuitivo que sigue siendo materia de investigación activa.
Piezas que usan este término
- ¿Qué es Grok? (2023-12-01)
- Introducción al aprendizaje automático: conceptos básicos y terminología (2023-05-09)
- El camino hacia la inteligencia artificial general: Desafíos y oportunidades (2023-05-09)
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.