Regularización
La regularización reúne las técnicas que reducen el sobreajuste de un modelo y mejoran su capacidad de generalizar. Explicamos las penalizaciones clásicas L1 y L2 y su combinación Elastic-Net, otras técnicas propias de las redes neuronales como el dropout, y el compromiso entre sesgo y varianza que se ajusta con ellas.
La regularización es el conjunto de técnicas que reducen el sobreajuste de un modelo y mejoran su capacidad de generalizar a datos nuevos, normalmente penalizando su complejidad. Su idea de fondo es preferir modelos más simples que capten los patrones generales de los datos, en lugar de memorizar el ruido del entrenamiento; es una forma de aplicar la navaja de Occam.
Las penalizaciones clásicas: L1 y L2
Las dos técnicas más conocidas añaden a la función de pérdida un término que penaliza el tamaño de los pesos. La regularización L2 (ridge o weight decay) penaliza la suma de sus cuadrados y los reduce de forma suave, sin llegar a anularlos. La regularización L1 (lasso) penaliza la suma de sus valores absolutos y tiende a llevar algunos pesos exactamente a cero, produciendo modelos dispersos, lo que equivale a una selección de características. La combinación de ambas se llama Elastic-Net. Fuente primaria.
Otras técnicas
En las redes neuronales hay técnicas específicas con el mismo fin. El dropout desactiva neuronas al azar durante el entrenamiento para que no se coadapten en exceso; el early stopping detiene el entrenamiento cuando el error de validación deja de bajar; el aumento de datos genera ejemplos nuevos transformando los existentes; y la normalización por lotes suele tener también un efecto regularizador. Fuente primaria.
El equilibrio que hay que ajustar
La intensidad de la regularización se controla con un hiperparámetro que gradúa el equilibrio entre ajustar bien los datos y mantener el modelo simple. Es una expresión directa del compromiso entre sesgo y varianza: más regularización reduce la varianza —y por tanto el sobreajuste— a costa de introducir algo de sesgo, y menos regularización hace lo contrario. Fuente primaria.
Piezas que usan este término
- Andrej Karpathy deja OpenAI para centrarse en proyectos personales (2024-02-13)
- Aprendizaje multitarea: compartir solo cuando las tareas se ayudan (2023-05-09)
- Cómo aprende una red profunda: del forward pass al gradiente (2023-05-09)
- Aprendizaje automático desde cero: siete decisiones detrás de un modelo (2023-05-09)
- Visión artificial: cinco tareas que no deben medirse igual (2023-05-09)
- Aprendizaje continuo: cómo medir memoria y adaptación en IA (2023-05-09)
- Redes neuronales e IAG: qué demuestra cada avance y qué no (2023-05-09)
- Redes neuronales y aprendizaje profundo (2023-04-07)
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.