F1-score
El F1-score combina la precisión y la exhaustividad (recall) mediante su media armónica: F1 = 2 · (precisión · recall) / (precisión + recall). Repasamos sus variantes micro, macro y weighted, su comparación con accuracy y MCC, y sus límites.
El F1-score es una métrica de evaluación de modelos de clasificación que resume la precisión y la exhaustividad (recall) en una sola cifra mediante su media armónica. Su fórmula es F1 = 2 · (precisión · recall) / (precisión + recall), y su valor va de 0 a 1: solo se acerca al máximo cuando ambas componentes son altas a la vez.
Nació en la recuperación de información y hoy es un estándar del aprendizaje automático, sobre todo cuando la exactitud global (accuracy) engaña, como ocurre con clases desbalanceadas. Aun así, conviene conocer sus variantes de promediado y sus puntos ciegos antes de fiarlo todo a un único número.
Precisión, recall y por qué la media armónica
Ambos ingredientes salen de la matriz de confusión. La precisión es TP / (TP + FP): de todo lo que el modelo etiquetó como positivo, cuánto lo era de verdad. El recall es TP / (TP + FN): de todos los positivos reales, cuántos recuperó el modelo. TP, FP y FN son los verdaderos positivos, los falsos positivos y los falsos negativos.
La media armónica castiga el desequilibrio entre las dos: si una se hunde, el F1 se hunde con ella, mientras que una media aritmética lo disimularía. Un detector con precisión 1,0 y recall 0,1 promedia 0,55 aritméticamente, pero su F1 apenas llega a 0,18. De forma equivalente, la documentación de scikit-learn lo expresa como F1 = 2 · TP / (2 · TP + FP + FN).
Micro, macro y weighted: el F1 en multiclase y multietiqueta
En problemas multiclase o multietiqueta hay que decidir cómo promediar los resultados por clase, y scikit-learn define tres estrategias habituales. El F1 micro agrega los TP, FP y FN de todas las clases en totales globales y calcula la métrica sobre ellos, de modo que cada instancia pesa lo mismo. El F1 macro calcula el F1 de cada clase y hace la media simple, dando a las clases minoritarias el mismo peso que a las mayoritarias. El F1 weighted pondera cada clase por su soporte, el número de instancias reales que tiene; corrige el macro frente al desbalance, aunque puede producir un F1 que no quede entre la precisión y el recall globales.
F1 frente a accuracy y MCC
Frente a la accuracy, el F1 aguanta mejor el desbalance: un clasificador trivial que siempre predice la clase mayoritaria logra una accuracy alta y, sin embargo, un F1 nulo sobre la minoritaria. El coeficiente de correlación de Matthews (MCC) va más lejos: usa las cuatro casillas de la matriz de confusión, incluidos los verdaderos negativos que el F1 ignora. Chicco y Jurman demostraron en BMC Genomics (2020) que el MCC es más informativo y fiable que el F1 y la accuracy en datasets desbalanceados, porque solo alcanza valores altos cuando el modelo acierta la mayoría de los positivos y también la mayoría de los negativos, mientras que el F1 puede arrojar resultados inflados y demasiado optimistas.
Límites del F1 y la familia F-beta
El F1 ignora los verdaderos negativos, cambia si se intercambia qué clase se declara positiva y depende del umbral de decisión con el que se binarizan las predicciones, a diferencia de métricas de ranking como el AUC-ROC. Cuando precisión y recall no importan por igual, la familia F-beta generaliza la fórmula: con beta mayor que 1 (como el F2) pesa más el recall, y con beta menor que 1 (como el F0.5) pesa más la precisión.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.