IA 360
Glosario Inteligencia Artificial

Procesos de Dirichlet

El proceso de Dirichlet es una distribución sobre distribuciones, pieza clave de la estadística bayesiana no paramétrica. Permite agrupar datos sin decidir de antemano cuántos grupos hay: el modelo lo infiere y deja que crezca con las observaciones.

Admin IA360 3 min de lectura Generado con IA Read in English
Procesos de Dirichlet

Un proceso de Dirichlet (Dirichlet Process, DP) es uno de los objetos centrales de la estadística bayesiana no paramétrica. En lugar de asignar probabilidad a números o a vectores, un proceso de Dirichlet asigna probabilidad a distribuciones enteras: es una distribución sobre distribuciones. Cada muestra que se extrae de él no es un dato, sino una distribución de probabilidad completa y, casi con seguridad, discreta. Thomas Ferguson lo introdujo en 1973 precisamente para tratar problemas en los que no queremos comprometernos de antemano con una forma paramétrica fija.

Un proceso de Dirichlet se define con dos ingredientes: una medida base G0, que actúa como valor esperado o «boceto» de las distribuciones que generará, y un parámetro de concentración alfa, que mide cuánto se parecen las muestras a G0. Con alfa grande, las distribuciones muestreadas se aproximan a G0; con alfa pequeño, se concentran en unos pocos átomos.

Para qué sirve: agrupar sin fijar el número de grupos

Su uso estrella en aprendizaje automático son los modelos de mezcla con procesos de Dirichlet (Dirichlet Process Mixture Models). Un modelo de mezcla clásico, como k-medias o una mezcla de gaussianas, exige decidir de antemano cuántos grupos hay. Rara vez lo sabemos. El proceso de Dirichlet elimina esa restricción: el número de grupos no se fija, se infiere de los datos y puede crecer a medida que llegan observaciones nuevas. Por eso se lo llama «modelo de mezcla infinito». El parámetro de concentración alfa gobierna esa tendencia: cuanto mayor es, más grupos tienden a aparecer.

Las construcciones: restaurante chino y partir el palo

Dos construcciones equivalentes hacen tangible el proceso. En el proceso del restaurante chino (Chinese Restaurant Process), los clientes entran uno a uno; cada cliente se sienta en una mesa ya ocupada con probabilidad proporcional a cuánta gente hay en ella, o estrena mesa nueva con probabilidad proporcional a alfa. Las mesas son los grupos, y su número crece solo si los datos lo piden. La segunda construcción, partir el palo (stick-breaking), la formalizó Sethuraman en 1994: se toma un palo de longitud uno y se rompe una y otra vez, asignando a cada trozo el peso de un grupo; los infinitos pedazos suman uno y definen las proporciones de la mezcla.

Frente a la distribución de Dirichlet, e inferencia

Conviene no confundirlo con la distribución de Dirichlet, que es un caso finito: reparte masa entre un número fijo de categorías y aparece, por ejemplo, en LDA (Latent Dirichlet Allocation). El proceso de Dirichlet es su versión de dimensión infinita, pensada para cuando el número de componentes es desconocido. Queda por resolver lo más costoso: la inferencia. Ajustar estos modelos no tiene solución cerrada y exige métodos aproximados, como el muestreo por cadenas de Markov (MCMC) o la inferencia variacional, con un coste computacional que sigue siendo su principal limitación práctica.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar