IA 360
Glosario Inteligencia Artificial

Segmentación Semántica

La segmentación semántica asigna una etiqueta de clase a cada píxel de una imagen y produce un mapa denso de la escena. De las redes totalmente convolucionales (FCN) a DeepLab y Segment Anything, esta guía la distingue de la clasificación, la detección y la segmentación de instancias.

Admin IA360 4 min de lectura Generado con IA Read in English
Segmentación Semántica

La segmentación semántica es la tarea de visión por computador que asigna una etiqueta de clase a cada píxel de una imagen. En lugar de decir qué hay en la foto, dibuja un mapa denso donde cada punto queda rotulado como cielo, carretera, edificio, persona o vegetación. El resultado es una comprensión de la escena a resolución de píxel: no una respuesta global, sino millones de decisiones locales que, juntas, delimitan el contorno exacto de cada región.

Esa densidad es lo que la separa de otras tareas de reconocimiento. La segmentación semántica no cuenta objetos ni los individualiza: agrupa por significado. Todos los píxeles que pertenecen a la clase «coche» comparten la misma etiqueta, haya uno o veinte coches en la escena. Distinguirlos ya es otra tarea.

Frente a clasificación, detección e instancias

Conviene situarla en la familia de tareas de visión. La clasificación de imagen emite una sola etiqueta para toda la foto («hay un gato»). La detección de objetos va más allá y localiza cada objeto con una caja delimitadora, pero la caja es un rectángulo tosco que incluye píxeles de fondo. La segmentación semántica es más fina: etiqueta el interior exacto de cada forma, sin cajas.

Su límite conocido es que no separa individuos de una misma clase: dos personas abrazadas forman una única mancha «persona». Ahí entra la segmentación de instancias, que sí distingue el objeto 1 del objeto 2 aunque compartan clase. Y la segmentación panóptica combina ambas: asigna clase a cada píxel (lo semántico) y, a la vez, identidad a cada objeto contable (lo de instancias), unificando fondo y primer plano en un solo mapa.

Arquitecturas: de FCN y U-Net a DeepLab y SAM

El salto decisivo llegó en 2015 con las redes totalmente convolucionales (FCN) de Jonathan Long, Evan Shelhamer y Trevor Darrell. Su idea fue sustituir las capas finales de una red de clasificación por convoluciones, de modo que la red aceptara imágenes de cualquier tamaño y produjera un mapa de etiquetas del mismo tamaño, entrenado extremo a extremo, píxel a píxel. Ese esquema popularizó el enfoque moderno.

Usos

El mapa denso resulta útil siempre que importa el «dónde» exacto. En imagen biomédica, U-Net se evaluó segmentando estructuras neuronales en microscopía electrónica y células en microscopía de luz. Para escenas urbanas, Cityscapes ofrece anotaciones por píxel e instancia de calles de 50 ciudades, pensadas para entrenar y comparar comprensión semántica urbana. En teledetección, DeepGlobe reunió tareas de segmentación, detección y clasificación sobre imágenes de satélite. Son aplicaciones documentadas; no demuestran por sí solas precisión clínica, seguridad de conducción o impacto agrícola. En todos los casos, la etiqueta por píxel convierte una imagen en una descripción operativa de la escena.

Piezas que usan este término

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar