Función de Pérdida
Una función de pérdida mide cuánto se equivoca un modelo, y el entrenamiento ajusta sus parámetros para minimizarla. Explicamos por qué no es lo mismo que una métrica ni que el objetivo, repasamos las pérdidas más habituales por tipo de tarea y las condiciones que debe cumplir.
Una función de pérdida mide cuánto se equivoca la predicción de un modelo respecto al valor deseado en un ejemplo. El entrenamiento se plantea como un problema de optimización: ajustar los parámetros del modelo para minimizar esa pérdida, normalmente por descenso de gradiente. A veces se distingue la pérdida, referida a un solo ejemplo o lote, de la función de coste, que es su promedio sobre todo el conjunto de entrenamiento.
Pérdida, métrica y objetivo no son lo mismo
Conviene separar tres conceptos que suelen confundirse. La función de pérdida es lo que se optimiza; guía el aprendizaje y por eso debe ser diferenciable, para poder calcular gradientes. La métrica de evaluación es lo que se mide para juzgar el modelo —exactitud, F1, AUC— y no necesita ser diferenciable. Y el objetivo es el término más general: la función que el modelo optimiza, que puede incluir la pérdida más otros términos. Que pérdida y métrica no coincidan es lo habitual y deliberado: se optimiza la entropía cruzada, que da buenos gradientes, pero se reporta la exactitud, que es lo que de verdad importa.
Pérdidas habituales
La elección depende de la tarea. Para regresión, el error cuadrático medio (MSE) penaliza con fuerza los errores grandes y es sensible a los valores atípicos, mientras que el error absoluto medio (MAE) es más robusto ante ellos; la pérdida de Huber es un híbrido de ambos. Para clasificación, la entropía cruzada binaria sirve para dos clases y la entropía cruzada categórica para varias; la pérdida de bisagra (hinge) es propia de las máquinas de vectores de soporte.
Condiciones
Dos condiciones importan. La pérdida debe alinearse con la tarea: una pérdida mal elegida optimiza algo distinto de lo que se busca. Y debe ser (casi siempre) diferenciable, que es justo la razón por la que no se puede entrenar directamente con una métrica como la exactitud. Al objetivo suele añadirse además un término de regularización que penaliza la complejidad del modelo para reducir el sobreajuste.
Piezas que usan este término
- Meta presenta V-JEPA, un modelo que aprende del vídeo sin píxeles (2024-02-16)
- Aprendizaje multitarea: compartir solo cuando las tareas se ayudan (2023-05-09)
- IA en energía: separar previsión, decisión y control (2023-05-09)
- Cómo aprende una red profunda: del forward pass al gradiente (2023-05-09)
- Aprendizaje automático desde cero: siete decisiones detrás de un modelo (2023-05-09)
- Cómo leer un avance en modelos de lenguaje sin perderse en las siglas (2023-05-09)
- Lógica simbólica y AGI: reglas explícitas no bastan (2023-05-09)
- Historia de la IA: una cronología de pruebas, promesas y límites (2023-05-09)
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.