Muestreo de Metropolis-Hastings
Algoritmo MCMC que muestrea distribuciones difíciles proponiendo candidatos y aceptándolos con una probabilidad calculada. Es base de la inferencia bayesiana y es distinto de HMC y NUTS, que usan gradientes.
El muestreo de Metropolis-Hastings es un algoritmo de Monte Carlo por cadenas de Markov (MCMC) que permite obtener muestras de una distribución de probabilidad cuando el muestreo directo resulta inviable, ya sea porque solo conocemos la densidad objetivo salvo una constante de normalización o porque su forma es demasiado compleja para tratarla de forma analítica. Fue introducido por Nicholas Metropolis y sus colaboradores en 1953 para problemas de física estadística y generalizado por W. K. Hastings en 1970, que lo llevó a la estadística general.
La idea es construir una cadena de Markov cuya distribución estacionaria coincide con la distribución objetivo p. A partir de un estado actual se propone un candidato y se decide, según una regla de aceptación, si la cadena se mueve a él o permanece donde está. Repetido muchas veces, el recorrido de la cadena produce muestras representativas de p.
Cómo funciona: la probabilidad de aceptación
El método necesita dos piezas: una distribución propuesta q, que sugiere un candidato x' a partir del estado actual x, y una probabilidad de aceptación. Se acepta el candidato con probabilidad min(1, [p(x') q(x|x')] / [p(x) q(x'|x)]). Aquí p es la densidad objetivo, q(x'|x) es la probabilidad de proponer x' estando en x y q(x|x') la del movimiento inverso. El cociente p(x')/p(x) premia los estados más probables —y no necesita la constante de normalización, porque se cancela— mientras que el cociente de propuestas corrige cualquier asimetría en q; esa corrección es la aportación de Hastings. Si q es simétrica, el término se simplifica a min(1, p(x')/p(x)), la forma original de Metropolis. Cuando el candidato se rechaza, la cadena repite el estado actual.
Dónde se usa
Metropolis-Hastings es un pilar de la inferencia bayesiana y de la física computacional: sirve para estimar distribuciones posteriores, calcular integrales y explorar espacios de alta dimensión. El muestreo de Gibbs puede verse como un caso particular, en el que cada variable se actualiza desde su distribución condicional completa y la propuesta se acepta siempre.
Metropolis-Hastings frente a HMC y NUTS
Conviene no confundir MH con sus parientes. El Hamiltonian Monte Carlo (HMC), que arranca del trabajo de Duane y colaboradores de 1987 y fue popularizado en estadística por Radford Neal, y el No-U-Turn Sampler (NUTS), propuesto por Hoffman y Gelman en 2014, no son simples mejoras de MH: son algoritmos MCMC distintos que usan el gradiente de la densidad para proponer movimientos más largos e informados, reduciendo el paseo aleatorio. Son el motor por defecto de bibliotecas como Stan y PyMC. Comparten con MH el esquema de propuesta y aceptación, pero difieren en cómo generan los candidatos.
Límites
MH no es superior a los demás métodos por definición; su rendimiento depende de la propuesta. Muestras consecutivas suelen estar autocorrelacionadas, lo que reduce la información efectiva; el tamaño de paso de q hay que ajustarlo con cuidado (demasiado grande, muchos rechazos; demasiado pequeño, avance lento); y confirmar que la cadena ha convergido exige diagnósticos, sin garantías automáticas. Elegir bien la propuesta sigue siendo un problema abierto.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.