Entropía Cruzada
La entropía cruzada mide, en bits, cuánto se aparta una predicción de la realidad; se descompone en entropía más divergencia de Kullback-Leibler y es la función de pérdida estándar de la clasificación en aprendizaje automático.
La entropía cruzada es una medida nacida en la teoría de la información que compara dos distribuciones de probabilidad definidas sobre los mismos sucesos. Cuantifica cuántos bits de más se necesitan, en promedio, para codificar muestras que provienen de una distribución real p usando un código optimizado para otra distribución q. Cuanto más se parece q a p, menor es ese exceso; cuando ambas coinciden, la entropía cruzada alcanza su valor mínimo posible.
Su definición, en texto plano, es H(p, q) = − suma sobre x de p(x)·log q(x), donde la suma recorre todos los sucesos posibles x. La base del logaritmo fija la unidad: base 2 da bits; el logaritmo natural da nats.
Qué mide y su relación con la entropía y la divergencia de Kullback-Leibler
La entropía cruzada se descompone de forma exacta: H(p, q) = H(p) + D(p‖q), es decir, la entropía de Shannon de la distribución real más la divergencia de Kullback-Leibler entre p y q. La entropía H(p) es el coste mínimo e inevitable de describir p; la divergencia D(p‖q), introducida por Solomon Kullback y Richard Leibler, es la penalización por usar el código equivocado, siempre no negativa y nula solo cuando q = p. De aquí surge una consecuencia central: si p está fija, minimizar la entropía cruzada equivale exactamente a minimizar la divergencia de Kullback-Leibler, porque H(p) es una constante que no depende de q. Esta lectura, expuesta con detalle por Thomas Cover y Joy Thomas en Elements of Information Theory, explica por qué la entropía cruzada sirve como medida de discrepancia entre una realidad y su aproximación.
La entropía cruzada como función de pérdida en clasificación
En aprendizaje automático es la función de pérdida estándar para clasificación. Aquí p es la etiqueta verdadera, casi siempre codificada como vector one-hot (toda la probabilidad en la clase correcta), y q es la predicción del modelo, que produce una distribución mediante una función softmax en el caso multiclase o una sigmoide en el binario. Con una etiqueta one-hot, la fórmula colapsa a −log q(clase correcta): la pérdida es simplemente el logaritmo negativo de la probabilidad que el modelo asignó a la respuesta buena, y castiga con dureza los errores cometidos con alta confianza. El caso de dos clases se conoce como pérdida logarítmica o log loss; el de varias clases, como entropía cruzada categórica (categorical cross-entropy).
Por qué se usa: máxima verosimilitud y mejores gradientes
Minimizar la entropía cruzada sobre un conjunto de datos es idéntico a maximizar la verosimilitud del modelo: la pérdida coincide con la log-verosimilitud negativa, de modo que entrenar con esta función es estimación de máxima verosimilitud disfrazada. Ese fundamento estadístico, desarrollado en textos como Deep Learning de Ian Goodfellow, Yoshua Bengio y Aaron Courville y en Pattern Recognition and Machine Learning de Christopher Bishop, es una de las razones de su predominio. La otra es práctica: combinada con softmax o sigmoide, la entropía cruzada produce mejores gradientes que el error cuadrático medio. Con salidas probabilísticas, el error cuadrático genera gradientes que se desvanecen cuando el modelo se equivoca con seguridad; la entropía cruzada, en cambio, cancela el término problemático y deja un gradiente proporcional al error, lo que acelera y estabiliza el aprendizaje. Por eso, salvo excepciones, la clasificación moderna se entrena con entropía cruzada y no con distancias euclídeas.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.