Procesos Gaussianos
Un proceso gaussiano es una distribución sobre funciones, definida por una media y un kernel, que sustenta dos tareas: la regresión con incertidumbre calibrada y la clasificación aproximada. Su límite es el coste O(n³), que motiva las aproximaciones dispersas.
Un proceso gaussiano (Gaussian Process, GP) es una distribución sobre funciones: en lugar de fijar una forma paramétrica y estimar sólo sus coeficientes, coloca una probabilidad sobre funciones posibles. Su propiedad definitoria es que, para cualquier conjunto finito de entradas, los valores correspondientes siguen una distribución normal multivariante conjunta. Queda determinado por una función de media y una función de covarianza o kernel, tal como desarrolla el tratamiento de Rasmussen y Williams.
La media expresa el valor esperado antes y después de observar datos; el kernel expresa cómo covarían los valores de la función entre entradas. En vez de devolver sólo una curva, el modelo produce una distribución predictiva condicionada a sus supuestos. El libro Gaussian Processes for Machine Learning, publicado en 2006, sistematiza regresión, clasificación, kernels, selección de modelos y aproximaciones para conjuntos grandes.
El papel del kernel
El kernel codifica qué funciones resultan plausibles: puede representar suavidad, periodicidad, tendencias, escalas distintas o combinaciones de estas propiedades. La documentación de scikit-learn distingue kernels estacionarios, que dependen de la distancia y no de la posición absoluta, de kernels no estacionarios. Elegir uno no es un detalle cosmético: es declarar qué significa que dos entradas sean semejantes y cómo debería trasladarse esa semejanza a sus salidas.
Los hiperparámetros, como la longitud de escala y la amplitud, concretan esos supuestos. Pueden ajustarse mediante la verosimilitud marginal, aunque optimizarla puede encontrar óptimos locales y no convierte un kernel inadecuado en adecuado. La implementación documentada permite reiniciar el optimizador precisamente porque la superficie puede tener varios óptimos.
El kernel también determina qué extrapolación puede defenderse. Wilson y Adams construyeron kernels de mezcla espectral capaces de descubrir patrones y extrapolarlos en ejemplos sintéticos, concentraciones atmosféricas de CO₂ y datos de pasajeros aéreos. El resultado no dice que cualquier GP extrapole bien: muestra que esa capacidad procede de la estructura que el kernel puede expresar.
Dos usos: regresión y clasificación
Regresión y clasificación son dos usos supervisados comunes. En regresión con procesos gaussianos, una verosimilitud gaussiana y unos hiperparámetros fijos permiten inferencia predictiva exacta mediante operaciones matriciales. Williams y Rasmussen estudiaron este prior sobre funciones y el análisis bayesiano predictivo resultante. La predicción ofrece una media y una varianza posteriores.
Esa varianza es incertidumbre dentro del modelo: está condicionada al kernel, la verosimilitud y los hiperparámetros. No garantiza por sí sola calibración frente al mundo. La documentación de la implementación devuelve media y desviación estándar, pero también expone elecciones como el nivel de ruido y la optimización de la verosimilitud marginal que afectan a ambas.
En clasificación con procesos gaussianos, un GP prioriza una función latente y una función de enlace la convierte en probabilidad de clase. Como las etiquetas discretas requieren una verosimilitud no gaussiana, la posterior deja de ser gaussiana y suele aproximarse. GaussianProcessClassifier usa una aproximación de Laplace; el libro de Rasmussen y Williams presenta además el marco general de clasificación y otros métodos aproximados.
Límites: coste O(n³) y aproximaciones dispersas
La inferencia exacta densa necesita factorizar o resolver sistemas con la matriz de covarianza. Para n observaciones, el orden de coste habitual es O(n³) en tiempo y O(n²) en memoria. La documentación señala explícitamente el escalado cúbico de su clasificador. La frontera práctica no es «unos pocos miles» de forma universal: depende del hardware, la estructura aprovechable y la precisión requerida.
Las aproximaciones dispersas reemplazan el papel de todos los datos en la inferencia por un conjunto menor de variables o puntos inductores. Titsias propuso una formulación variacional que aprende conjuntamente las entradas inductoras y los hiperparámetros maximizando una cota inferior de la verosimilitud marginal y minimizando una divergencia respecto a la posterior exacta. La ganancia computacional tiene una condición visible: ya no se usa la posterior exacta del modelo denso, sino una aproximación cuya calidad debe comprobarse.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.