Agrupamiento
El agrupamiento (clustering) divide datos sin etiquetas en grupos según su similitud. Un recorrido por sus familias —k-medias, jerárquico, DBSCAN y mezclas de gaussianas—, cómo elegir el número de grupos y por qué no existe una única respuesta correcta.
El agrupamiento —clustering en inglés— es una tarea de aprendizaje no supervisado: parte de un conjunto de datos sin etiquetas y lo divide en grupos, llamados clústeres, de modo que los elementos de un mismo grupo se parezcan más entre sí que a los de cualquier otro. A diferencia de la clasificación, nadie le dice al algoritmo cuál es la respuesta correcta; el único criterio es una noción de similitud —normalmente una distancia entre puntos— que el propio analista elige de antemano.
Esa elección lo cambia todo. El agrupamiento no descubre una estructura «que ya está ahí» de forma neutral: hace visible la estructura que la medida de similitud y el método permiten ver. De ahí que sea una herramienta de exploración —segmentar clientes, ordenar genes, detectar anomalías— más que un oráculo con una única salida verdadera. Fuente primaria.
Familias de métodos: particional, jerárquico, densidad y modelos
El método más conocido es k-medias (k-means), un enfoque particional cuyo procedimiento estándar es el algoritmo de Lloyd, propuesto en los Bell Labs en 1957; MacQueen acuñó el término «k-means» en 1967. Reparte los datos en k grupos minimizando la varianza interna. Es rápido y sencillo, pero obliga a fijar k de antemano y tiende a asumir grupos de tamaño similar y forma esférica, por lo que falla ante estructuras alargadas o irregulares.
El agrupamiento jerárquico no exige fijar k: en su versión aglomerativa parte de cada elemento como un grupo y los va fusionando por proximidad hasta formar un árbol, el dendrograma, que se «corta» a la altura deseada. El enfoque basado en densidad, cuyo exponente es DBSCAN, define los grupos como regiones densas separadas por zonas vacías: encuentra clústeres de forma arbitraria, no necesita fijar k y, además, marca como ruido los puntos aislados. Por último, los métodos basados en modelos, como las mezclas de gaussianas (GMM), suponen que los datos provienen de una combinación de distribuciones y ajustan sus parámetros con el algoritmo esperanza-maximización (EM), asignando a cada punto una probabilidad de pertenencia en lugar de una etiqueta rígida. Fuente primaria.
Cómo elegir el número de grupos y cómo evaluar
Salvo en los métodos de densidad, elegir cuántos grupos buscar es una decisión abierta. Dos heurísticas habituales son el método del codo —se representa una medida de error frente a k y se busca el punto donde deja de mejorar apreciablemente— y el coeficiente de silueta, que para cada punto compara su cohesión con su propio grupo frente a su separación del más cercano, con valores entre −1 y +1. Evaluar el resultado es aún más delicado: como no hay etiquetas de referencia, se recurre a índices internos (la propia silueta, entre otros) que miden lo compactos y separados que quedan los grupos, sin poder confirmar que sean los «correctos». Fuente primaria.
Por qué no hay una única respuesta correcta
Este es el punto que conviene declarar sin rodeos: el agrupamiento no tiene una solución verdadera única. El resultado depende de la medida de similitud, del método y de sus parámetros, y distintos algoritmos producen agrupaciones distintas sobre los mismos datos —k-medias y DBSCAN pueden discrepar por completo—. No existe un criterio universal que diga cuál es «la buena»: la validez de un agrupamiento se juzga por su utilidad para la pregunta que se quería responder, no por un acierto objetivo. Entender esa ambigüedad es lo que separa un uso riguroso de la técnica de una lectura ingenua de sus resultados. Fuente primaria.
Piezas que usan este término
- AWS pone Trainium3 en producción y obliga a medir algo más que la velocidad del chip (2025-12-02)
- Métricas de aprendizaje automático: elegir el error que importa (2023-05-09)
- Aprendizaje no supervisado: métodos y técnicas (2023-05-09)
- Biología y AGI: qué se copió de verdad del cerebro y qué es sólo metáfora (2023-05-09)
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.