IA 360
Glosario Inteligencia Artificial

Modelos de Markov Ocultos

Un modelo de Markov oculto (HMM) describe secuencias en las que unos estados ocultos generan observaciones visibles. Explicamos qué lo define (estados, transiciones, emisiones, distribución inicial), los tres problemas clásicos que resuelve (evaluación, Viterbi y Baum-Welch) y su lugar frente a las redes neuronales.

Admin IA360 5 min de lectura Generado con IA Read in English
Modelos de Markov Ocultos

Un modelo de Markov oculto (HMM) es un modelo probabilístico de secuencias en el que un proceso con estados ocultos —que no se observan directamente— va generando una secuencia de observaciones visibles. En cada paso, el estado cambia según probabilidades de transición y produce una observación según una distribución asociada a ese estado; el trabajo consiste en razonar sobre lo oculto a partir de lo observable.

Qué lo define

Un HMM queda descrito por cuatro elementos: el conjunto de estados ocultos; las probabilidades de transición entre estados; las distribuciones de emisión, que relacionan cada estado con observaciones posibles; y la distribución inicial. El supuesto de Markov de primer orden dice que, dado el estado actual, el siguiente no necesita toda la historia de estados para definir su probabilidad.

Un ejemplo primario muestra cómo se traduce esa abstracción. En un reconocedor de habla de AT&T Bell Laboratories, Levinson, Ljolje y Miller representaron unidades fonéticas no observables como estados, las medidas acústicas como observaciones y la estructura temporal mediante transiciones y duraciones. El estado oculto no es una etiqueta revelada por los datos: es una hipótesis del modelo cuya utilidad depende de que las emisiones y transiciones describan adecuadamente la secuencia.

Los tres problemas clásicos

El uso de un HMM suele separar tres preguntas. La evaluación suma la probabilidad de una secuencia observada sobre las rutas ocultas compatibles, normalmente mediante la recursión hacia delante. La decodificación busca una ruta de estados de máxima probabilidad; el sistema de habla citado utilizó una versión modificada del algoritmo de Viterbi y conservó decisiones para reconstruir la mejor secuencia. Evaluar y decodificar no son lo mismo: una operación suma rutas; la otra elige una.

El aprendizaje ajusta transiciones y emisiones a observaciones. El nombre Baum–Welch remite a una familia de reestimaciones hacia delante y hacia atrás: Baum, Petrie, Soules y Weiss publicaron en 1970 una técnica iterativa de maximización para funciones probabilísticas de cadenas de Markov. La iteración mejora la función objetivo desde su punto de partida, pero eso no convierte automáticamente el resultado en la única explicación posible de los datos: estados diferentes pueden modelar patrones parecidos.

Usos y estado actual

Los HMM tienen aplicaciones verificables en secuencias. En 1989, Huang, Hon y Lee documentaron un reconocedor de habla continua y gran vocabulario basado en HMM semicontinuos. En 2016, Stratos, Collins y Hsu entrenaron HMM de anclas para etiquetado gramatical no supervisado y señalaron que sus estados podían quedar lexicalizados por palabras, una forma concreta de interpretabilidad.

Las redes neuronales abrieron otro camino, no una fecha universal de caducidad. Graves y Jaitly presentaron en 2014 un sistema recurrente de extremo a extremo que transcribía audio sin representación fonética intermedia. Esa alternativa reduce componentes diseñados a mano, mientras un HMM conserva una separación explícita entre estado, transición y emisión. Elegir entre ellos depende de los datos, la tarea y de si esa estructura discreta aporta una explicación útil.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar