Bagging
El bagging es una técnica de aprendizaje por conjuntos que entrena varios modelos sobre distintas muestras aleatorias del conjunto de datos y combina sus predicciones. Su efecto principal es reducir la varianza y el sobreajuste. Explicamos su mecánica de bootstrap y agregación, por qué funciona, su relación con Random Forest y su contraste con el boosting.
El bagging es una técnica de aprendizaje por conjuntos (ensemble) que entrena varias versiones de un modelo sobre distintas muestras aleatorias del conjunto de entrenamiento y combina sus predicciones: por voto mayoritario si es clasificación, por promedio si es regresión. Su nombre es el acrónimo de Bootstrap AGGregatING. Lo propuso Leo Breiman en 1996, en el artículo «Bagging Predictors».
Bootstrap y agregación
El método tiene dos piezas. El bootstrap consiste en generar varios conjuntos de entrenamiento distintos muestreando con reemplazo del original: cada muestra puede repetir algunos ejemplos y omitir otros. Sobre cada uno de esos conjuntos se entrena un modelo base independiente. Después, la agregación combina las salidas de todos ellos en una única predicción.
Por qué funciona
La clave es la inestabilidad del modelo base. El bagging reduce la varianza —y con ella el sobreajuste— y resulta especialmente eficaz con modelos que cambian mucho ante pequeñas variaciones de los datos, como los árboles de decisión profundos. En cambio, apenas reduce el sesgo: promediar muchos modelos parecidos estabiliza la predicción, pero no corrige un modelo base sistemáticamente equivocado.
Relación con Random Forest
El ejemplo más célebre de bagging es el Random Forest (Breiman, 2001), que aplica el bagging a árboles de decisión y añade una dosis extra de azar: en cada división del árbol, solo considera un subconjunto aleatorio de las características. Un subproducto útil del bootstrap es el error out-of-bag: como cada modelo deja fuera en promedio un tercio de los datos (los no seleccionados), esos ejemplos sirven para estimar el error sin necesidad de un conjunto de validación aparte.
Bagging frente a boosting
Conviene no confundir el bagging con el otro gran método de conjuntos, el boosting. El bagging entrena sus modelos en paralelo e independientes, y ataca la varianza. El boosting los entrena en secuencia, cada uno corrigiendo los errores del anterior, y ataca sobre todo el sesgo. Son estrategias complementarias, no intercambiables.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.