t-SNE
t-SNE es una técnica de reducción de dimensionalidad no lineal muy usada para visualizar datos de alta dimensión en dos o tres dimensiones. Explicamos su propósito, cómo funciona a grandes rasgos, el papel del hiperparámetro de perplejidad y, muy importante, las advertencias sobre cómo leer —y cómo no leer— sus mapas.
t-SNE (t-distributed Stochastic Neighbor Embedding) es una técnica de reducción de dimensionalidad no lineal cuyo uso principal es visualizar datos de alta dimensión, situando cada punto en un mapa de dos o tres dimensiones. Su virtud es preservar sobre todo la estructura local: los puntos que están cerca en el espacio original quedan cerca en el mapa. La propusieron Laurens van der Maaten y Geoffrey Hinton en 2008, como mejora de una técnica anterior, el SNE.
Cómo funciona
La idea, a grandes rasgos, es traducir las similitudes entre pares de puntos en probabilidades: dos puntos cercanos tienen alta probabilidad de ser «vecinos». t-SNE modela esas probabilidades en el espacio original y busca una disposición en dos dimensiones cuyas probabilidades se le parezcan lo más posible. El uso de una distribución t de Student de cola pesada en el mapa mitiga el «problema de amontonamiento», evitando que todos los puntos se apelotonen en el centro.
La perplejidad
Su hiperparámetro clave es la perplejidad (perplexity), que regula el equilibrio entre atender a la estructura local o a la global; en la práctica se mueve en un rango de valores modesto (típicamente entre 5 y 50). Conviene probar varios y comparar.
Cómo leer (y no leer) sus mapas
Aquí está lo importante, porque es fácil sobreinterpretar. t-SNE es estocástico: dos ejecuciones dan mapas distintos. Y, sobre todo, los tamaños de los grupos y las distancias entre ellos no son fiables: el algoritmo infla los clústeres densos y encoge los dispersos, y la separación entre dos grupos en el mapa puede no significar nada. Con perplejidad baja, incluso el ruido puede parecer estructura.
Sus límites y alternativas
t-SNE es lento en conjuntos muy grandes y está pensado para visualizar, no como paso de extracción de características para otros modelos. A diferencia de t-SNE, PCA es una transformación lineal: proyecta los datos sobre ejes ordenados por la varianza que explican, una referencia útil para resumir estructura global sin modelar vecindades no lineales. UMAP, presentado en 2018, fue descrito por sus autores como competitivo con t-SNE en calidad de visualización, con mejor tiempo de ejecución y, en su propia formulación, una preservación posiblemente mayor de la estructura global.
Piezas que usan este término
- Preprocesar sin filtrar el futuro: la regla fit/transform (2023-05-09)
- Aprendizaje no supervisado: métodos y técnicas (2023-05-09)
- Interpretabilidad en aprendizaje automático: cómo entender y explicar los modelos (2023-05-09)
- Aprendizaje sin etiquetas: cómo elegir y validar una representación (2023-05-09)
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.