Entropía Máxima
El principio de máxima entropía (Jaynes, 1957) elige la distribución más incierta compatible con lo conocido. Distinguimos tres ideas que suelen confundirse —el principio, la entropía cruzada y la regularización— y aclaramos por qué el «modelo de máxima entropía» es la regresión logística, no una GAN o un Transformer.
El principio de máxima entropía es una regla de inferencia: entre todas las distribuciones de probabilidad compatibles con lo que sabemos —por ejemplo, un valor medio conocido—, elige la que tiene mayor entropía, es decir, la más incierta o «menos comprometida» con lo que no sabemos. Lo formuló el físico Edwin T. Jaynes en 1957 para derivar la mecánica estadística desde la teoría de la información. La idea es no introducir suposiciones que los datos no justifican.
Cuando las restricciones son valores esperados, la solución de ese problema de optimización tiene forma exponencial: si solo se fija el soporte, resulta la distribución uniforme; si se fija la media, la exponencial; si se fijan media y varianza, la gaussiana.
Tres conceptos que conviene no confundir
El nombre «entropía» reúne tres ideas distintas. El principio de máxima entropía es lo anterior: maximizar la entropía de una distribución sujeta a restricciones. La entropía cruzada es otra cosa: una función de pérdida que mide la discrepancia entre dos distribuciones —la real y la del modelo— y que, al minimizarse, empuja al modelo hacia predicciones confiadas, de baja entropía; es la dirección opuesta a «maximizar entropía». Y la regularización por entropía es un término que se añade al objetivo para elevar deliberadamente la entropía de la salida y evitar el exceso de confianza, como en el suavizado de etiquetas o en el aprendizaje por refuerzo de máxima entropía.
El clasificador de máxima entropía
En aprendizaje automático, el «modelo de máxima entropía» designa algo muy concreto: el clasificador de máxima entropía es exactamente la regresión logística multinomial (la función softmax). No es una analogía. Se imponen restricciones para que las esperanzas de ciertas características bajo el modelo igualen las observadas en los datos; entre todas las distribuciones que cumplen eso, la de máxima entropía tiene forma log-lineal. Entrenar ese modelo por máxima verosimilitud —minimizando la entropía cruzada— produce, en el óptimo, esa distribución de máxima entropía.
Qué no es un «modelo de máxima entropía»
Es engañoso llamar «modelos de máxima entropía» a las redes generativas antagónicas (GAN) o a los Transformers. Las GAN se entrenan como un juego adversarial que minimiza una divergencia entre distribuciones, no bajo ningún principio de máxima entropía. Los Transformers son una arquitectura que se entrena con entropía cruzada; que usen una capa softmax no convierte a la red entera en un «modelo de máxima entropía». La conexión legítima es más acotada: la función softmax es la distribución de máxima entropía dada una restricción sobre sus valores, y existe un ámbito donde el principio aparece de forma explícita: el aprendizaje por refuerzo de máxima entropía (por ejemplo, el algoritmo Soft Actor-Critic), que suma a la recompensa la entropía de la política para fomentar la exploración.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.