IA 360
Glosario Inteligencia Artificial

pLSA

El pLSA, propuesto por Thomas Hofmann en 1999, dio un fundamento probabilístico al modelado de temas, pero su falta de un modelo generativo a nivel de documento lo hacía propenso al sobreajuste; el LDA lo corrigió en 2003 con un prior de Dirichlet.

Admin IA360 4 min de lectura Generado con IA
pLSA

El pLSA (Probabilistic Latent Semantic Analysis, o análisis semántico latente probabilístico) es un modelo estadístico de variables latentes para el modelado de temas, propuesto por Thomas Hofmann en 1999. Su objetivo es descubrir los temas ocultos que estructuran una colección de documentos y explicar, en términos de probabilidad, por qué ciertas palabras aparecen juntas en unos textos y no en otros.

Frente al análisis semántico latente clásico, que descompone una matriz mediante álgebra lineal, el pLSA introduce un fundamento probabilístico: modela la co-ocurrencia entre palabras y documentos a través de una variable de tema latente, habitualmente denotada como z.

Cómo funciona

El pLSA parte de una representación de bolsa de palabras: ignora el orden y solo cuenta la frecuencia de cada término. Bajo el modelo, cada documento es una mezcla de temas y cada tema es una distribución de probabilidad sobre el vocabulario. La probabilidad de observar una palabra en un documento se expresa como una suma sobre los temas: se elige un tema z según su peso en el documento y, a partir de ese tema, se genera la palabra. Los parámetros —qué palabras define cada tema y en qué proporción aparece cada tema en cada documento— se estiman maximizando la verosimilitud del corpus con el algoritmo de esperanza-maximización (EM), que alterna entre estimar las probabilidades de los temas y reajustar los parámetros.

Su límite frente a LDA: sobreajuste y ausencia de prior

La debilidad central del pLSA es que no es un modelo generativo completo a nivel de documento. Las proporciones de temas de cada documento son parámetros que se estiman uno a uno, de modo que su número crece linealmente con el tamaño del corpus. Ese exceso de parámetros conduce al sobreajuste y, además, deja al modelo sin una forma natural de asignar probabilidad a un documento nuevo que no estaba en el entrenamiento. Blei, Ng y Jordan resolvieron ambos problemas en 2003 con el Latent Dirichlet Allocation (LDA): añadieron un prior de Dirichlet sobre las mezclas de temas, de manera que estas dejan de ser parámetros fijos y pasan a ser variables aleatorias gobernadas por unos pocos hiperparámetros. Así el número de parámetros ya no depende del número de documentos y el modelo puede generalizar a textos no vistos.

Dónde queda hoy

El pLSA fue el eslabón conceptual que hizo posible el modelado de temas moderno, pero en la práctica ha sido desplazado. El LDA se consolidó como estándar durante casi dos décadas, y hoy conviven con él métodos neuronales basados en embeddings, como BERTopic (Maarten Grootendorst, 2022), que agrupa documentos por similitud semántica con representaciones de transformers y describe cada grupo mediante un TF-IDF por clase. Queda sin zanjar qué enfoque rinde mejor: la ventaja de los métodos neuronales sobre el LDA depende del corpus, del idioma y de la tarea, y sigue siendo objeto de debate.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar