Extracción de Información
La extracción de información obtiene automáticamente datos estructurados —entidades, relaciones, eventos— a partir de texto no estructurado. Aclaramos que es un paraguas de varias subtareas y no un sinónimo de NER, recorremos la evolución de sus métodos, de las reglas a los grandes modelos de lenguaje, y sus retos.
La extracción de información es la tarea de obtener automáticamente información estructurada —entidades, relaciones, eventos— a partir de texto no estructurado o semiestructurado. Convierte texto libre en datos que una máquina puede consultar, por ejemplo para rellenar una base de datos o construir un grafo de conocimiento. Es importante entenderla como un paraguas de varias subtareas, no como sinónimo de una sola.
Sus subtareas
La extracción de información agrupa varias tareas. El reconocimiento de entidades nombradas localiza y clasifica menciones como personas, organizaciones o lugares. La extracción de relaciones identifica el vínculo entre dos entidades ya detectadas. La extracción de eventos detecta sucesos y sus participantes. Y la resolución de correferencia determina cuándo distintas expresiones —un nombre, un pronombre— se refieren a la misma entidad. El reconocimiento de entidades es, pues, una subtarea, no todo el proceso.
Usos y retos
Extraer no equivale a verificar: el dato estructurado debe conservar su vínculo con el pasaje de origen para que otra persona pueda comprobarlo.
Piezas que usan este término
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.