IA 360
Glosario Inteligencia Artificial

LDA (Latent Dirichlet Allocation)

LDA (Latent Dirichlet Allocation) es el modelo probabilístico de temas propuesto por Blei, Ng y Jordan en 2003: cada documento como mezcla de temas y cada tema como distribución de palabras. Explicamos cómo funciona, sus límites documentados y qué lugar ocupa hoy frente a los embeddings y los grandes modelos de lenguaje.

Admin IA360 Generado con IA
LDA (Latent Dirichlet Allocation)

LDA (Latent Dirichlet Allocation, «asignación latente de Dirichlet») es un modelo probabilístico generativo para descubrir los temas que atraviesan una colección de documentos. David Blei, Andrew Ng y Michael Jordan presentaron LDA en un artículo publicado en 2003 por el Journal of Machine Learning Research. Su intuición cabe en una frase: cada documento es una mezcla de temas y cada tema, una distribución de probabilidad sobre palabras. Un artículo de prensa puede ser 70 % política y 30 % economía, y el tema «economía» asigna probabilidades altas a palabras como inflación, empleo o mercado.

Conviene deshacer una ambigüedad: en estadística y aprendizaje automático, LDA también designa el análisis discriminante lineal (linear discriminant analysis), un clasificador supervisado clásico que separa clases con fronteras lineales y que no guarda relación con el modelado de temas.

Cómo funciona

LDA es un modelo bayesiano jerárquico de tres niveles que imagina un proceso generativo: para «escribir» un documento se sortea primero su mezcla de temas y, palabra a palabra, se elige un tema de esa mezcla y luego una palabra de ese tema, con distribuciones de Dirichlet como priores. El algoritmo invierte el proceso: a partir de las palabras observadas, infiere qué temas explican mejor el corpus. Blei y sus coautores presentaron inferencia aproximada mediante métodos variacionales y un algoritmo EM. En 2004, Thomas Griffiths y Mark Steyvers publicaron en PNAS un algoritmo MCMC con muestreo de Gibbs: analizaron los 28.154 resúmenes de PNAS publicados entre 1991 y 2001, compararon modelos de 50 a 1.000 temas y hallaron que, bajo sus elecciones de corpus e hiperparámetros, los datos se explicaban mejor con 300. El resultado es doble: una lista de temas descritos por sus palabras más probables y la proporción de cada tema en cada documento. Eso lo hizo idóneo para explorar grandes corpus sin leerlos, de archivos históricos a hemerotecas; una lección de Programming Historian enseña a aplicarlo en humanidades digitales con la herramienta MALLET.

Límites documentados

El número de temas hay que fijarlo de antemano y no existe un valor «correcto» evidente. El modelo trata cada texto como una bolsa de palabras: ignora el orden y la semántica, así que no sabe que «coche» y «automóvil» significan casi lo mismo. Y los temas no siempre son legibles: el estudio «Reading Tea Leaves» (Chang y otros, NIPS 2009) demostró con evaluadores humanos que los modelos con mejor verosimilitud estadística pueden producir temas menos interpretables. Además, al ser estocástica la inferencia, dos ejecuciones sobre el mismo corpus pueden arrojar temas distintos.

LDA frente a embeddings y modelos de lenguaje

El modelado de temas actual se apoya en representaciones vectoriales (embeddings) que sí capturan semántica. Un ejemplo es BERTopic, presentado por Maarten Grootendorst en 2022: encadena embeddings de transformers, reducción con UMAP, agrupamiento con HDBSCAN y TF-IDF por clases para describir cada grupo. En tres conjuntos de datos y con las métricas de coherencia y diversidad elegidas por el autor, el artículo informa de temas coherentes y resultados competitivos; también advierte que esas métricas son aproximaciones de una evaluación subjetiva. Los grandes modelos de lenguaje se usan además para etiquetar y resumir los temas resultantes, un paso que la propia herramienta integra. LDA no ha desaparecido: sigue compensando en corpus muy grandes donde el coste computacional importa, cuando no hay GPU disponible o cuando se busca un modelo estadístico explícito, con supuestos declarados y resultados reproducibles con una semilla fija.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar