IA 360
Glosario Inteligencia Artificial

Algoritmos de Clusterización Jerárquica

El clustering jerárquico es una familia de métodos de agrupamiento no supervisado que organiza los datos en un árbol de clústeres anidados, el dendrograma. Explicamos sus dos enfoques —aglomerativo y divisivo—, cómo se lee el dendrograma para elegir el número de grupos, los criterios de enlace (simple, completo, promedio y Ward) y sus ventajas y límites.

Admin IA360 4 min de lectura Generado con IA Read in English
Algoritmos de Clusterización Jerárquica

El clustering jerárquico es una familia de algoritmos de agrupamiento no supervisado que construyen clústeres anidados, fusionándolos o dividiéndolos de forma sucesiva, y representan el resultado como un árbol llamado dendrograma. A diferencia de otros métodos, no produce una única partición, sino toda una jerarquía: en la raíz, un clúster que reúne todos los datos; en las hojas, cada dato por separado.

Aglomerativo y divisivo

Hay dos formas de construir esa jerarquía. El enfoque aglomerativo (de abajo arriba) parte de cada observación como su propio clúster y va fusionando en cada paso los dos más parecidos; es el más común. El enfoque divisivo (de arriba abajo) hace lo contrario: empieza con todo en un único clúster y lo va dividiendo. En ambos casos, el proceso genera una secuencia de agrupamientos anidados.

El dendrograma

El dendrograma es el diagrama en forma de árbol que muestra en qué orden y a qué distancia se fueron uniendo los clústeres: la altura de cada rama indica la distancia a la que se produjo la fusión. Su gran utilidad es que permite elegir el número de grupos a posteriori: basta con «cortar» el árbol a una altura determinada para obtener tantos clústeres como ramas queden por debajo del corte.

Los criterios de enlace

La clave del método es cómo se mide la distancia entre dos clústeres, el criterio de enlace. El enlace simple usa la distancia entre sus puntos más cercanos y tiende a formar cadenas alargadas. El enlace completo usa la distancia entre los más lejanos y produce grupos compactos. El enlace promedio es un término medio. Y el método de Ward (Joe Ward, 1963) fusiona los clústeres que menos aumentan la varianza interna, con un objetivo emparentado con el de k-medias; da grupos esféricos y de tamaño regular.

Ventajas y límites

Sus virtudes son claras: no exige fijar de antemano el número de clústeres y el dendrograma ofrece una lectura visual de la estructura de los datos. Los límites dependen de la variante. La documentación de scikit-learn advierte que el aglomerativo es costoso sin restricciones de conectividad porque considera todas las fusiones posibles, y que el enlace simple no es robusto frente al ruido. Además, en una ejecución aglomerativa cada paso fusiona dos grupos y no vuelve a separarlos: una decisión temprana condiciona el resto de la jerarquía. No todas las variantes comparten el mismo coste ni la misma sensibilidad a valores atípicos.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar