IA 360
Glosario Inteligencia Artificial

U-Net

U-Net es la arquitectura convolucional en forma de U que Ronneberger, Fischer y Brox crearon en 2015 para segmentar imágenes con pocos datos. Hoy es, además, la columna vertebral de los modelos de difusión que generan imágenes.

Admin IA360 3 min de lectura Generado con IA
U-Net

U-Net es una arquitectura de red neuronal convolucional concebida para la segmentación de imágenes: en lugar de asignar una única etiqueta a la imagen entera, clasifica cada píxel para delimitar con precisión dónde empieza y termina cada objeto. Olaf Ronneberger, Philipp Fischer y Thomas Brox, de la Universidad de Friburgo, la presentaron en 2015 en el trabajo «U-Net: Convolutional Networks for Biomedical Image Segmentation». Su nombre describe su silueta: dibujada sobre el papel, la red forma una U.

Es una realización concreta de la segmentación semántica, tarea que esta enciclopedia trata en su propia entrada; aquí interesa la arquitectura que la hizo practicable a partir de un puñado de ejemplos.

La forma en U: codificador, decodificador y conexiones de salto

La U tiene dos brazos. El camino de contracción —el codificador— aplica convoluciones y reducciones sucesivas de resolución: la imagen se vuelve más pequeña y más abstracta mientras la red gana contexto y entiende qué hay en la escena. El camino de expansión —el decodificador— hace el recorrido inverso, aumentando la resolución paso a paso hasta recuperar el tamaño original, para responder no solo al qué, sino al dónde exacto.

El problema es que al comprimir se pierde el detalle fino de los bordes. La aportación decisiva de U-Net son las conexiones de salto (skip connections): cada nivel del decodificador recibe, directamente, los mapas de características del nivel equivalente del codificador. Así la red combina el contexto global aprendido en profundidad con la información espacial precisa de las primeras capas, y dibuja contornos nítidos en lugar de manchas difusas.

Por qué brilla con pocos datos: origen biomédico

U-Net nació en el laboratorio, no en el centro de datos. En la imagen biomédica etiquetar es caro: hace falta que un especialista marque a mano célula por célula, y rara vez hay miles de ejemplos. Ronneberger, Fischer y Brox diseñaron la red para aprender de colecciones pequeñas, apoyándose en un uso intensivo del aumento de datos —deformaciones elásticas, giros y desplazamientos que multiplican artificialmente las muestras disponibles.

Funcionó. Con la misma arquitectura ganaron por amplio margen el ISBI cell tracking challenge de 2015 y superaron al mejor método previo en la segmentación de estructuras neuronales en microscopía electrónica. Y era rápida: segmentar una imagen de 512×512 píxeles le llevaba menos de un segundo en una GPU de la época. Esa combinación de precisión, frugalidad de datos y velocidad explica que se convirtiera en el estándar de facto de la segmentación médica.

De la segmentación a los modelos de difusión

Una década después, U-Net vive una segunda vida lejos de la medicina: es la columna vertebral de los modelos de difusión que generan imágenes. Estos sistemas parten de ruido puro y lo van limpiando en muchos pasos hasta revelar una imagen; en cada paso, una U-Net recibe la imagen ruidosa y predice qué ruido hay que restar. Su estructura codificador-decodificador con conexiones de salto encaja de forma natural en esta tarea, porque necesita entender la escena entera y a la vez preservar el detalle.

De herramienta para contar células a motor de la generación visual, la misma silueta en U sostiene dos de los usos más influyentes de la visión por computador contemporánea. Documentación: artículo original de U-Net; artículo original de difusión.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar