Aprendizaje de Ensamble
El aprendizaje de ensamble combina las predicciones de varios modelos para obtener un resultado mejor y más robusto que el de cualquiera por separado: la «sabiduría de la multitud» aplicada al aprendizaje automático. Explicamos por qué funciona, sus tres métodos principales —bagging, boosting y stacking— y sus ventajas y límites.
El aprendizaje de ensamble (ensemble learning) es la técnica de combinar las predicciones de varios modelos —los «aprendices base»— para obtener un resultado mejor y más robusto que el de cualquiera de ellos por separado. Es la «sabiduría de la multitud» aplicada al aprendizaje automático: muchas opiniones imperfectas, bien combinadas, aciertan más que una sola.
Por qué funciona
La clave es la diversidad. Si los modelos base cometen errores distintos, al combinarlos esos errores tienden a cancelarse y el error global baja. En términos del clásico compromiso entre sesgo y varianza, combinar modelos diversos reduce la varianza sin disparar el sesgo. Por eso un ensamble de modelos que se equivocan «cada uno a su manera» supera a un único modelo, por bueno que sea.
Los tres métodos
Hay tres estrategias principales. El bagging (Leo Breiman, 1996) entrena los modelos en paralelo sobre muestras aleatorias de los datos y promedia sus salidas; reduce la varianza, y su ejemplo más famoso es el Random Forest. El boosting los entrena en secuencia, cada uno corrigiendo los errores del anterior; reduce el sesgo, y a él pertenecen AdaBoost (Freund y Schapire, 1997) y XGBoost. El stacking o apilamiento (Wolpert, 1992) usa un metamodelo que aprende a combinar las predicciones de los modelos base, y puede mezclar modelos de tipos muy distintos.
Cómo se combinan
La combinación más simple es la votación: en clasificación, la clase más votada entre los modelos; en regresión, el promedio de sus predicciones. El boosting suele usar una versión ponderada, dando más peso a los modelos más certeros.
Ventajas y límites
Sus ventajas son claras: mayor precisión, robustez y capacidad de generalización. Pero también hay costes. La interpretabilidad se resiente —es difícil explicar una predicción que es el promedio de muchos modelos—, aumenta el coste computacional de entrenar y mantener el conjunto, y la implementación, sobre todo del stacking, se vuelve más compleja.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.