IA 360
Glosario Inteligencia Artificial

LightGBM

LightGBM es la biblioteca de gradient boosting de Microsoft que entrena árboles de decisión con histogramas y crecimiento por hojas para lograr modelos precisos, rápidos y ligeros. Repasamos sus técnicas GOSS y EFB, su riesgo de sobreajuste y cómo se compara con XGBoost y CatBoost.

Admin IA360 3 min de lectura Generado con IA
LightGBM

LightGBM (Light Gradient Boosting Machine) es una biblioteca de código abierto de potenciación del gradiente (gradient boosting) sobre árboles de decisión, desarrollada por Microsoft. La presentaron Guolin Ke y sus colegas en «LightGBM: A Highly Efficient Gradient Boosting Decision Tree», publicado en la conferencia NeurIPS 2017. Su promesa es concreta: entrenar modelos de boosting tan precisos como los clásicos, pero mucho más rápidos y con mucho menor consumo de memoria.

Como toda técnica de boosting, LightGBM construye árboles de decisión de forma secuencial, y cada árbol corrige los errores del anterior; ese concepto general lo tratamos en Boosting y en Ensamble de Modelos. Lo distintivo de LightGBM es cómo logra esa eficiencia.

Las optimizaciones: histogramas, leaf-wise, GOSS y EFB

La primera pieza es el uso de histogramas: en lugar de examinar cada valor continuo de una variable, LightGBM los agrupa en «cubos» discretos (bins). Así, buscar el mejor punto de corte pasa a depender del número de cubos y no del número de datos, lo que acelera el cálculo y reduce la memoria necesaria.

La segunda es el crecimiento del árbol por hojas (leaf-wise): en cada paso divide la hoja que promete mayor reducción del error, en vez de expandir el árbol nivel a nivel (level-wise). El resultado son árboles asimétricos que suelen alcanzar menor pérdida con menos divisiones.

A esto se suman dos técnicas propias del paper. GOSS (Gradient-based One-Side Sampling) es un muestreo que conserva los ejemplos con mayor gradiente —los más informativos— y descarta buena parte de los de gradiente pequeño, estimando la ganancia con muchos menos datos. EFB (Exclusive Feature Bundling) agrupa variables dispersas y mutuamente excluyentes —que rara vez son distintas de cero a la vez— en una sola, reduciendo la dimensionalidad sin apenas perder información.

Fortalezas y el riesgo de sobreajuste

La combinación de estas ideas convierte a LightGBM en una de las opciones más veloces y ligeras para datos grandes y de alta dimensión: según Ke et al., acelera el entrenamiento del GBDT convencional hasta más de veinte veces manteniendo una precisión casi idéntica. Por eso domina en tareas tabulares de clasificación, regresión y ranking.

Su punto delicado es la contracara de su virtud: el crecimiento por hojas puede sobreajustar cuando hay pocos datos, porque el árbol persigue reducciones de error muy específicas. La documentación oficial recomienda contenerlo con parámetros como num_leaves (número máximo de hojas, su principal control de complejidad) y max_depth (profundidad máxima), además de la regularización habitual.

Frente a XGBoost y CatBoost

LightGBM comparte terreno con otras dos bibliotecas de gradient boosting. XGBoost es la referencia madura y robusta; tradicionalmente crece los árboles por niveles, lo que la hace muy estable pero, en datos masivos, a menudo más lenta y exigente en memoria que LightGBM. CatBoost, de Yandex, destaca por su tratamiento nativo de variables categóricas y sus árboles simétricos, que reducen el sobreajuste a costa de algo de velocidad. No hay un ganador universal: LightGBM brilla cuando priman el volumen de datos y la rapidez de entrenamiento, mientras que sus alternativas pueden convenir en conjuntos pequeños o con muchas categorías. Conviene probar y validar antes de decidir.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar