IA 360
Glosario Inteligencia Artificial

WordNet

Base de datos léxica del inglés iniciada en Princeton en 1985 por el equipo de George A. Miller: 117.659 conjuntos de sinónimos enlazados por relaciones semánticas como la hiperonimia. Congelada en su versión oficial, sigue viva como recurso estructurado en plena era de los LLM.

Admin IA360 3 min de lectura Generado con IA
WordNet

WordNet es una base de datos léxica del inglés desarrollada en la Universidad de Princeton. El proyecto arrancó en 1985 bajo la dirección del psicólogo George A. Miller con una ambición concreta: organizar el vocabulario como parece estar organizado en la mente, no como una lista alfabética sino como una red de conceptos. Sustantivos, verbos, adjetivos y adverbios se agrupan en conjuntos de sinónimos llamados synsets, cada uno con una definición breve (la glosa) y ejemplos de uso; los synsets se enlazan entre sí mediante relaciones semánticas y léxicas etiquetadas. Durante décadas ha sido una pieza básica del procesamiento del lenguaje natural y de la IA aplicada al lenguaje.

Según las estadísticas oficiales de Princeton, la versión 3.0 contiene 155.287 palabras únicas organizadas en 117.659 synsets, que suman 206.941 pares palabra-sentido. La base es de descarga libre y gratuita.

Cómo está organizado

La relación más codificada es la hiperonimia y su inversa, la hiponimia: el vínculo «es un tipo de» que ordena los sustantivos en una jerarquía léxica cuyas ramas convergen en un único nodo raíz, «entity». Un sillón es un tipo de silla; una silla, un tipo de mueble. A esa columna vertebral se añaden la meronimia (la relación parte-todo: el respaldo es parte de la silla), la troponimia entre verbos (susurrar es una manera de hablar) y la antonimia que estructura los adjetivos (mojado-seco). Ahí está la diferencia con un tesauro clásico, según explica la propia web de Princeton: WordNet no conecta formas de palabras, sino sentidos concretos, y etiqueta explícitamente cada relación.

Para qué se ha usado

Fue durante años el recurso semántico de referencia del procesamiento del lenguaje natural: desambiguación del sentido de las palabras, medidas de similitud semántica calculadas sobre su jerarquía y expansión de consultas en recuperación de información. La biblioteca NLTK lo incluye como uno de sus corpus estándar. ImageNet, el célebre banco de imágenes de la visión por computador, está organizado según la jerarquía de WordNet, como declara su página oficial. Y el modelo se exportó a otras lenguas: EuroWordNet, proyecto financiado por la Comisión Europea entre 1996 y 1999 y dirigido por Piek Vossen, construyó wordnets para ocho lenguas europeas unidas por un índice interlingüe, y hoy el Open Multilingual Wordnet enlaza sesenta wordnets abiertas que cubren 49 idiomas.

WordNet en la era de los LLM

Los embeddings y los grandes modelos de lenguaje aprenden relaciones semánticas directamente de cantidades masivas de texto y cubren hoy buena parte de los usos clásicos de WordNet. Lo que la red de Princeton sigue ofreciendo es distinto: relaciones explícitas, inspeccionables y curadas por lexicógrafos, valiosas allí donde importa saber por qué dos palabras se relacionan y no solo cuánto se parecen sus vectores. El original está congelado: la web de Princeton avisa de que, por falta de financiación y de personal, no hay planes de nuevas versiones. El relevo es comunitario: Open English WordNet, derivado del original bajo licencia CC-BY, publicó su edición de 2025, y el ecosistema multilingüe sigue activo. Cuatro décadas después de su arranque, la red de Miller sigue siendo el mapa estructurado de referencia del significado en inglés.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar