Extracción de Entidades
La extracción de entidades (NER) localiza y clasifica menciones como personas, lugares o fechas en un texto. La distinguimos de la extracción de relaciones y del enlazado de entidades, recorremos los métodos de las reglas a los modelos de lenguaje —con el matiz justo sobre BERT— y su dimensión de privacidad.
La extracción de entidades, o reconocimiento de entidades nombradas (NER), localiza en un texto las menciones de entidades —personas, organizaciones, lugares, fechas, cantidades— y las clasifica en categorías predefinidas. Combina dos operaciones: delimitar dónde empieza y acaba cada mención y decidir de qué tipo es.
Qué la distingue de tareas vecinas
Conviene no confundirla con dos tareas próximas. La extracción de relaciones va un paso más allá y busca los vínculos entre entidades ya detectadas. El enlazado de entidades conecta cada mención con una entrada única de una base de conocimiento, para distinguir, por ejemplo, «París» ciudad de «París» persona. La extracción de entidades detecta y clasifica; el enlazado desambigua.
De las reglas a los modelos de lenguaje
Los métodos han evolucionado por etapas: sistemas de reglas y listas de nombres; modelos estadísticos de secuencia como los CRF; redes neuronales que combinan embeddings con BiLSTM-CRF; modelos preentrenados como BERT; y, hoy, grandes modelos de lenguaje guiados por instrucciones y datos sintéticos. Conviene un matiz: la llegada de BERT supuso una mejora fuerte en los bancos de prueba estándar —del orden de 92-93 de F1 en el conjunto CoNLL-2003 en inglés—, pero fue incremental sobre las representaciones contextuales previas, no un salto «sin precedentes», y depende mucho del dominio y del idioma.
Evaluación, retos y privacidad
El rendimiento se mide con la precisión, la exhaustividad y su media armónica, la F1, sobre conjuntos de referencia como CoNLL-2003 u OntoNotes. Los retos abiertos son el multilingüismo y los dominios especializados —biomédico, legal—, donde las cifras caen. Y hay una dimensión de privacidad: el NER es la base para detectar y ocultar datos personales, de modo que un fallo por defecto deja información expuesta y uno por exceso oculta de más; además, la detección puede arrastrar sesgos según el origen de los nombres.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.