IA 360
Glosario Inteligencia Artificial

Random Forest

Random Forest (bosque aleatorio) es uno de los algoritmos más usados del aprendizaje automático: combina muchos árboles de decisión, cada uno entrenado con un toque de azar, y agrega sus predicciones. Explicamos sus dos fuentes de aleatoriedad, su origen, sus notables ventajas —robustez, importancia de características— y sus límites.

Admin IA360 Generado con IA
Random Forest

Random Forest (bosque aleatorio) es un algoritmo de aprendizaje por conjuntos que construye muchos árboles de decisión y combina sus predicciones —por voto mayoritario en clasificación, por promedio en regresión— para lograr un modelo más preciso y robusto que un solo árbol. Lo presentó Leo Breiman en 2001, y sigue siendo una de las herramientas de referencia para datos tabulares.

Dos dosis de azar

Su fuerza nace de introducir aleatoriedad por partida doble. Primero, cada árbol se entrena sobre una muestra bootstrap distinta de los datos —un subconjunto tomado al azar con reemplazo—; esto es el bagging. Segundo, en cada división de un árbol, solo se considera un subconjunto aleatorio de las características, no todas. Esta doble aleatoriedad hace que los árboles sean distintos entre sí —«decorrelacionados»—, y esa diversidad es lo que da potencia al bosque: muchos árboles imperfectos y variados, juntos, aciertan más.

Sus ventajas

Random Forest reúne un conjunto de virtudes notable. Reduce el sobreajuste frente a un árbol único, al bajar la varianza; es robusto al ruido y a los valores atípicos; maneja bien datos de muchas dimensiones; y apenas necesita ajuste de hiperparámetros para dar buenos resultados. Además, ofrece dos regalos prácticos: una medida de importancia de las características y el error out-of-bag, una estimación interna del rendimiento que aprovecha, para cada árbol, los datos que quedaron fuera de su muestra.

Sus límites

No es perfecto. Es menos interpretable que un árbol único —un bosque de cientos de árboles es una caja relativamente negra—, resulta más costoso en cómputo y memoria, y sus medidas de importancia pueden sesgarse a favor de las características con muchos valores o categorías distintas. Aun así, su combinación de precisión, robustez y facilidad de uso lo mantiene entre los algoritmos favoritos.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar