Reconocimiento de Imágenes
El reconocimiento de imágenes es la tarea de la visión por computador que identifica y clasifica el contenido de una imagen. Explicamos sus matices —clasificar, detectar, segmentar—, el punto de inflexión que supuso AlexNet en 2012, cómo funcionan a grandes rasgos las redes convolucionales, sus aplicaciones y sus límites, como los sesgos y los ejemplos adversarios.
El reconocimiento de imágenes es la tarea de la visión por computador que consiste en identificar y clasificar el contenido de una imagen: los objetos, las personas o las escenas que aparecen en ella. Conviene distinguir tres niveles de detalle: la clasificación pone una etiqueta a la imagen entera, la detección de objetos localiza cada objeto con un recuadro, y la segmentación clasifica píxel a píxel para dibujar su forma exacta.
El punto de inflexión
Durante décadas, el reconocimiento se apoyó en características diseñadas a mano por ingenieros (descriptores como SIFT o HOG), que funcionaban en condiciones controladas pero fallaban ante la variación real de luz, escala y oclusión. Todo cambió en 2012, cuando una red neuronal llamada AlexNet —de Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton— ganó el desafío de reconocimiento visual ImageNet con una diferencia medible sobre sus rivales. Aquel resultado se convirtió en un hito del aprendizaje profundo en visión por computador.
Cómo funciona una red convolucional
El motor de ese avance son las redes neuronales convolucionales (CNN). A grandes rasgos, aplican filtros que recorren la imagen detectando patrones locales, y los organizan en una jerarquía: las primeras capas reconocen bordes, las siguientes texturas, luego partes y finalmente objetos completos. Capas de pooling resumen la información por el camino, y una parte final se encarga de la clasificación. Fuente primaria.
Para qué sirve
Sus aplicaciones son enormes: el diagnóstico médico por imagen, la conducción autónoma, el reconocimiento facial, el control de calidad industrial o la búsqueda visual de productos. Documentación: artículo de AlexNet.
Sus límites
Pero no es infalible. Los sistemas dependen de sus datos de entrenamiento, y cuando estos no son representativos aparecen sesgos: un estudio de 2018 mostró que varios sistemas comerciales acertaban mucho menos con rostros de piel oscura, sobre todo de mujeres. Además, son vulnerables a los ejemplos adversarios: pequeñas alteraciones de los píxeles, imperceptibles para una persona, que pueden llevar a la red a equivocarse por completo. Documentación: estudio Gender Shades; artículo original sobre ejemplos adversarios.
Serie
Cómo ve una máquina, peldaño a peldaño — peldaño 1 de 3
- 1. Reconocimiento de Imágenes
- 2. Redes Neuronales Convolucionales
- 3. YOLO (You Only Look Once)
Piezas que usan este término
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.