Minería de Datos
La minería de datos es el proceso de descubrir patrones útiles y no evidentes en grandes volúmenes de datos, en la intersección de la estadística, el aprendizaje automático y las bases de datos. Explicamos su relación con el proceso KDD, sus tareas principales, la metodología CRISP-DM, su diferencia con términos vecinos y sus consideraciones de privacidad.
La minería de datos es el proceso de descubrir patrones, relaciones y conocimiento útil y no evidente en grandes volúmenes de datos, combinando métodos de la estadística, el aprendizaje automático y los sistemas de bases de datos. El nombre es algo engañoso: no se «extraen datos», sino conocimiento a partir de ellos.
Una pieza del proceso KDD
La minería de datos suele situarse como el paso de análisis dentro de un proceso más amplio, el descubrimiento de conocimiento en bases de datos (KDD, por sus siglas en inglés). Usama Fayyad, Gregory Piatetsky-Shapiro y Padhraic Smyth lo definieron en 1996 como «el proceso no trivial de identificar patrones válidos, novedosos, potencialmente útiles y comprensibles en los datos». En ese esquema, la minería es el momento en que se aplican los algoritmos; antes hay selección y limpieza, y después, interpretación.
Sus tareas
La minería de datos agrupa varias tareas. La clasificación asigna cada caso a una categoría; la regresión predice un valor numérico; el agrupamiento (clustering) descubre grupos naturales sin etiquetas previas; las reglas de asociación encuentran qué cosas van juntas —el ejemplo clásico es el «análisis de la cesta de la compra»—; y la detección de anomalías localiza los casos que se desvían de lo normal, útil para detectar fraude o fallos.
Cómo se organiza un proyecto: CRISP-DM
La metodología de referencia para estructurar un proyecto es CRISP-DM (Cross-Industry Standard Process for Data Mining), publicada hacia 1999-2000. Divide el trabajo en seis fases —comprensión del negocio, comprensión de los datos, preparación, modelado, evaluación y despliegue— y es cíclica: no se recorre en línea recta, sino volviendo sobre los pasos anteriores.
Vecinos y límites
Conviene no confundir términos que se solapan. La minería de datos se centra en descubrir patrones; el aprendizaje automático, en predecir; la ciencia de datos es un campo más amplio que engloba a ambos; y big data alude al tamaño de los datos, no a una técnica. Por último, como trabaja con datos a menudo personales, la minería de datos plantea exigencias serias de privacidad y ética, con marcos legales como el RGPD europeo que regulan su uso.
Piezas que usan este término
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.