IA 360
Glosario Inteligencia Artificial

Análisis de Componentes Principales (PCA)

El análisis de componentes principales (PCA) es la técnica más común de reducción de dimensionalidad lineal: transforma variables correlacionadas en un nuevo conjunto de variables no correlacionadas, ordenadas por la varianza que explican. Explicamos cómo funciona, por qué conviene centrar y estandarizar los datos, para qué se usa y su límite: solo captura relaciones lineales.

Admin IA360 5 min de lectura Generado con IA Read in English
Análisis de Componentes Principales (PCA)

El análisis de componentes principales (PCA, por sus siglas en inglés) es una técnica estadística de reducción de dimensionalidad: transforma un conjunto de variables posiblemente correlacionadas en otro más pequeño de variables no correlacionadas, llamadas componentes principales, ordenadas de mayor a menor según la varianza de los datos que explican. Es no supervisada —no usa etiquetas—.

Un poco de historia

Sus raíces son antiguas. Karl Pearson lo planteó en 1901 en términos geométricos, como la búsqueda de las rectas y planos que mejor se ajustan a una nube de puntos. Harold Hotelling lo desarrolló de forma independiente en 1933 y es a él a quien se atribuye el nombre de «componentes principales». Documentación: historia académica de los ejes principales; documentación técnica de PCA.

Cómo funciona

La idea es encontrar las direcciones de máxima varianza de los datos. El primer componente principal es la dirección a lo largo de la cual los datos varían más; el segundo es la de mayor varianza restante, con la condición de ser perpendicular (ortogonal) al primero; y así sucesivamente. Matemáticamente, esos componentes son los autovectores de la matriz de covarianza de los datos, y la varianza que explica cada uno viene dada por su autovalor. La implementación de scikit-learn elige entre SVD completa, SVD aleatorizada, ARPACK y descomposición de la covarianza según la forma de los datos y el número de componentes; esta última duplica el número de condición y es menos estable para entradas con gran rango de valores singulares.

El preprocesado importa

Antes de aplicar PCA hay que centrar los datos, restando a cada variable su media; sin ese paso, el resultado queda dominado por la posición del conjunto y no por su estructura. Y como el PCA es sensible a la escala de las variables, cuando estas tienen unidades o rangos muy distintos conviene estandarizarlas (dividir por su desviación típica). Si no, una variable medida en miles dominaría a otra medida en unidades solo por su magnitud, no por su importancia.

Usos y límite

El PCA se emplea para reducir la dimensionalidad antes de entrenar un modelo, para visualizar datos de muchas variables en dos o tres dimensiones, para comprimir y para reducir ruido. PCA es una transformación lineal. Para visualización no lineal, t-SNE fue diseñado para situar datos de alta dimensión en mapas de dos o tres dimensiones, mientras UMAP se presenta como una técnica de reducción basada en aprendizaje de variedades. Sus objetivos son distintos de preservar varianza lineal; no cabe afirmar una superioridad general en coste o interpretabilidad sin fijar datos, parámetros y tarea.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar