Entropía Cruzada
La entropía cruzada mide, en bits, cuánto se aparta una predicción de la realidad; se descompone en entropía más divergencia de Kullback-Leibler y es la función de pérdida estándar de la clasificación en aprendizaje automático.
La entropía cruzada es una medida nacida en la teoría de la información que compara dos distribuciones de probabilidad definidas sobre los mismos sucesos. Cuantifica cuántos bits de más se necesitan, en promedio, para codificar muestras que provienen de una distribución real p usando un código optimizado para otra distribución q. Cuanto más se parece q a p, menor es ese exceso; cuando ambas coinciden, la entropía cruzada alcanza su valor mínimo posible.
Su definición, en texto plano, es H(p, q) = − suma sobre x de p(x)·log q(x), donde la suma recorre todos los sucesos posibles x. La base del logaritmo fija la unidad: base 2 da bits; el logaritmo natural da nats.
Qué mide y su relación con la entropía y la divergencia de Kullback-Leibler
La entropía cruzada se descompone de forma exacta: H(p, q) = H(p) + D(p‖q), es decir, la entropía de Shannon de la distribución real más la divergencia de Kullback-Leibler entre p y q. La entropía H(p) es el coste mínimo e inevitable de describir p; la divergencia D(p‖q), introducida por Solomon Kullback y Richard Leibler, es la penalización por usar el código equivocado, siempre no negativa y nula solo cuando q = p. De aquí surge una consecuencia central: si p está fija, minimizar la entropía cruzada equivale exactamente a minimizar la divergencia de Kullback-Leibler, porque H(p) es una constante que no depende de q. Esta identidad explica por qué sirve como medida de discrepancia entre una distribución y su aproximación.
La entropía cruzada como función de pérdida en clasificación
En modelos de clasificación que producen una distribución categórica o de Bernoulli, la entropía cruzada es una pérdida habitual. Aquí p es la etiqueta verdadera, a menudo codificada como vector one-hot —toda la probabilidad en la clase correcta—, y q es la distribución predicha mediante softmax o sigmoide. Con una etiqueta one-hot, la fórmula se reduce a −log q(clase correcta): es el logaritmo negativo de la probabilidad asignada a la respuesta buena, de modo que un error cometido con mucha confianza produce una pérdida grande. El caso binario se conoce como pérdida logarítmica o log loss; el multiclase, como entropía cruzada categórica. La elección depende del modelo probabilístico: no es una pérdida universal para toda clasificación.
La comparación con el error cuadrático medio (MSE) necesita el modelo al lado. En un clasificador con salida sigmoide, el gradiente del MSE incluye la pendiente de la sigmoide; cuando la salida se satura cerca de 0 o 1, esa pendiente puede hacerse diminuta y frenar la corrección incluso ante un error seguro. La log-verosimilitud negativa —entropía cruzada en este caso— evita ese factor de saturación para muchos modelos de salida y puede ofrecer un gradiente más útil. No significa que converja mejor que MSE en cualquier tarea: la ventaja depende de emparejar la pérdida con una salida probabilística adecuada.
Por qué se usa: máxima verosimilitud y mejores gradientes
En clasificación probabilística con una verosimilitud categórica, minimizar la entropía cruzada equivale a minimizar la log-verosimilitud negativa. Esa equivalencia depende del modelo probabilístico elegido; no convierte cualquier pérdida ni cualquier tarea en máxima verosimilitud.
En una red neuronal, esa pérdida se optimiza normalmente mediante descenso del gradiente o variantes estocásticas: se calcula cómo cambia la pérdida respecto de cada parámetro y se actualizan los pesos en la dirección que la reduce. El capítulo de optimización de Deep Learning distingue el descenso por lotes, el estocástico y el de minilotes, además de extensiones como el momento. La función de pérdida define el gradiente; el optimizador decide cómo convertirlo en una secuencia de actualizaciones.
Piezas que usan este término
- Cómo aprende una red profunda: del forward pass al gradiente (2023-05-09)
- Modelos de lenguaje estadísticos: fundamentos y aplicaciones (2023-05-09)
- Redes neuronales y aprendizaje profundo (2023-04-07)
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.