LightGBM
LightGBM es la biblioteca de gradient boosting de Microsoft que entrena árboles de decisión con histogramas y crecimiento por hojas para lograr modelos precisos, rápidos y ligeros. Repasamos sus técnicas GOSS y EFB, su riesgo de sobreajuste y cómo se compara con XGBoost y CatBoost.
LightGBM (Light Gradient Boosting Machine) es una biblioteca de código abierto de potenciación del gradiente (gradient boosting) sobre árboles de decisión, desarrollada por Microsoft. La presentaron Guolin Ke y sus colegas en «LightGBM: A Highly Efficient Gradient Boosting Decision Tree», publicado en la conferencia NeurIPS 2017. Su promesa es concreta: entrenar modelos de boosting tan precisos como los clásicos, pero mucho más rápidos y con mucho menor consumo de memoria.
Como toda técnica de boosting, LightGBM construye árboles de decisión de forma secuencial, y cada árbol corrige los errores del anterior; ese concepto general lo tratamos en Boosting y en Ensamble de Modelos. Lo distintivo de LightGBM es cómo logra esa eficiencia.
Las optimizaciones: histogramas, leaf-wise, GOSS y EFB
La primera pieza es el uso de histogramas: en lugar de examinar cada valor continuo de una variable, LightGBM los agrupa en «cubos» discretos (bins). Así, buscar el mejor punto de corte pasa a depender del número de cubos y no del número de datos, lo que acelera el cálculo y reduce la memoria necesaria.
La segunda es el crecimiento del árbol por hojas (leaf-wise): en cada paso divide la hoja que promete mayor reducción del error, en vez de expandir el árbol nivel a nivel (level-wise). El resultado son árboles asimétricos que suelen alcanzar menor pérdida con menos divisiones.
A esto se suman dos técnicas propias del paper. GOSS (Gradient-based One-Side Sampling) es un muestreo que conserva los ejemplos con mayor gradiente —los más informativos— y descarta buena parte de los de gradiente pequeño, estimando la ganancia con muchos menos datos. EFB (Exclusive Feature Bundling) agrupa variables dispersas y mutuamente excluyentes —que rara vez son distintas de cero a la vez— en una sola, reduciendo la dimensionalidad sin apenas perder información.
Fortalezas y el riesgo de sobreajuste
La combinación de estas ideas convierte a LightGBM en una de las opciones más veloces y ligeras para datos grandes y de alta dimensión: según Ke et al., acelera el entrenamiento del GBDT convencional hasta más de veinte veces manteniendo una precisión casi idéntica. Por eso domina en tareas tabulares de clasificación, regresión y ranking.
Su punto delicado es la contracara de su virtud: el crecimiento por hojas puede sobreajustar cuando hay pocos datos, porque el árbol persigue reducciones de error muy específicas. La documentación oficial recomienda contenerlo con parámetros como num_leaves (número máximo de hojas, su principal control de complejidad) y max_depth (profundidad máxima), además de la regularización habitual.
Frente a XGBoost y CatBoost
LightGBM comparte terreno con otras dos bibliotecas de gradient boosting. XGBoost es la referencia madura y robusta; tradicionalmente crece los árboles por niveles, lo que la hace muy estable pero, en datos masivos, a menudo más lenta y exigente en memoria que LightGBM. CatBoost, de Yandex, destaca por su tratamiento nativo de variables categóricas y sus árboles simétricos, que reducen el sobreajuste a costa de algo de velocidad. No hay un ganador universal: LightGBM brilla cuando priman el volumen de datos y la rapidez de entrenamiento, mientras que sus alternativas pueden convenir en conjuntos pequeños o con muchas categorías. Conviene probar y validar antes de decidir.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.