Random Forest
Random Forest (bosque aleatorio) es uno de los algoritmos más usados del aprendizaje automático: combina muchos árboles de decisión, cada uno entrenado con un toque de azar, y agrega sus predicciones. Explicamos sus dos fuentes de aleatoriedad, su origen, sus notables ventajas —robustez, importancia de características— y sus límites.
Random Forest (bosque aleatorio) es un algoritmo de aprendizaje por conjuntos que construye muchos árboles de decisión y combina sus predicciones —por voto mayoritario en clasificación, por promedio en regresión— para lograr un modelo más preciso y robusto que un solo árbol. Lo presentó Leo Breiman en 2001, y sigue siendo una de las herramientas de referencia para datos tabulares.
Dos dosis de azar
Su fuerza nace de introducir aleatoriedad por partida doble. Primero, cada árbol se entrena sobre una muestra bootstrap distinta de los datos —un subconjunto tomado al azar con reemplazo—; esto es el bagging. Segundo, en cada división de un árbol, solo se considera un subconjunto aleatorio de las características, no todas. Esta doble aleatoriedad hace que los árboles sean distintos entre sí —«decorrelacionados»—, y esa diversidad es lo que da potencia al bosque: muchos árboles imperfectos y variados, juntos, aciertan más.
Sus ventajas
Random Forest reúne un conjunto de virtudes notable. Reduce el sobreajuste frente a un árbol único, al bajar la varianza; es robusto al ruido y a los valores atípicos; maneja bien datos de muchas dimensiones; y apenas necesita ajuste de hiperparámetros para dar buenos resultados. Además, ofrece dos regalos prácticos: una medida de importancia de las características y el error out-of-bag, una estimación interna del rendimiento que aprovecha, para cada árbol, los datos que quedaron fuera de su muestra.
Sus límites
No es perfecto. Es menos interpretable que un árbol único —un bosque de cientos de árboles es una caja relativamente negra—, resulta más costoso en cómputo y memoria, y sus medidas de importancia pueden sesgarse a favor de las características con muchos valores o categorías distintas. Aun así, su combinación de precisión, robustez y facilidad de uso lo mantiene entre los algoritmos favoritos.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.