CatBoost
CatBoost es una biblioteca de potenciación por gradiente de Yandex que maneja de forma nativa las variables categóricas. Explicamos sus aportaciones —el ordered boosting y los árboles simétricos—, qué es la fuga del objetivo que corrige y cuándo conviene elegirlo frente a XGBoost y LightGBM.
CatBoost es una biblioteca de código abierto de potenciación por gradiente sobre árboles de decisión, desarrollada por la empresa Yandex. Su nombre viene de «Categorical Boosting», y su seña de identidad es manejar de forma nativa las variables categóricas y combatir un tipo sutil de fuga de datos que afectaba a las implementaciones previas. La referencia original es el artículo de Prokhorenkova y sus colegas, «CatBoost: unbiased boosting with categorical features» (2018).
Qué aporta
CatBoost introduce tres ideas. La primera es el manejo nativo de variables categóricas: no hace falta codificarlas a mano, porque las convierte en números mediante estadísticas basadas en el objetivo. La segunda es el ordered boosting, una variante que, para codificar una categoría o calcular el gradiente de un ejemplo, usa solo los ejemplos «anteriores» en una permutación aleatoria, nunca la etiqueta del propio ejemplo. La tercera son los árboles simétricos (oblivious), en los que todos los nodos de un mismo nivel aplican la misma condición, lo que actúa como regularización y acelera la inferencia. Fuente primaria.
El problema que resuelve: la fuga del objetivo
La fuga del objetivo (target leakage) ocurre cuando, al construir las variables o la señal de entrenamiento de un ejemplo, se usa indirectamente su propio valor objetivo. El caso típico es codificar una categoría por la media del objetivo incluyendo la propia fila: el modelo parece muy bueno en entrenamiento y generaliza peor. El enfoque «ordenado» de CatBoost lo evita porque ni la codificación ni el gradiente de un ejemplo miran nunca su propia etiqueta.
Cuándo elegirlo
CatBoost está diseñado para conjuntos con variables categóricas y ofrece valores predeterminados que reducen parte del trabajo inicial. Compararlo con LightGBM o XGBoost exige medir los tres sobre los mismos datos, presupuesto y criterio. Conviene un matiz honesto: ninguna de las tres gana siempre; cuál es mejor depende del conjunto de datos, del número de variables categóricas y del presupuesto de ajuste. Fuente primaria.
Piezas que usan este término
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.