IA 360
Glosario Inteligencia Artificial

SSD (Single Shot Detector)

SSD (Single Shot MultiBox Detector) es una arquitectura de detección de objetos presentada por Wei Liu y colaboradores en ECCV 2016 que localiza y clasifica objetos en una sola pasada de red neuronal, sin etapa previa de propuestas de regiones.

Admin IA360 3 min de lectura Generado con IA
SSD (Single Shot Detector)

En un glosario de inteligencia artificial, SSD no designa un disco de almacenamiento, sino el Single Shot MultiBox Detector: una arquitectura de red neuronal para detección de objetos presentada por Wei Liu y sus colaboradores en el paper «SSD: Single Shot MultiBox Detector», publicado en la conferencia ECCV 2016 y disponible en arXiv desde diciembre de 2015. Su aportación fue demostrar que una sola red, en una única pasada sobre la imagen, podía localizar y clasificar objetos con una precisión comparable a la de los sistemas más exactos de su época, pero a velocidad de tiempo real.

La coincidencia con las siglas de Solid State Drive (la unidad de almacenamiento de estado sólido) es solo eso, una coincidencia: aquella es una tecnología de hardware; esta, un hito de la visión por computador.

Cómo funciona: una pasada y cajas por defecto

Los detectores dominantes hasta entonces trabajaban en dos etapas: una parte de la red proponía primero regiones de la imagen que podían contener algo, y otra clasificaba después cada propuesta. SSD elimina esa primera etapa. Según describe el paper original de Liu y colaboradores, la red discretiza el espacio de posibles recuadros en un conjunto de cajas por defecto con distintas proporciones y tamaños, ancladas a cada posición de varios mapas de características. Para cada caja, la red predice a la vez la probabilidad de cada categoría y un ajuste fino de sus coordenadas.

El segundo ingrediente es la multiescala: SSD combina predicciones de mapas de características de distintas resoluciones, de modo que las capas tempranas, de mayor resolución, capturan los objetos pequeños y las profundas, los grandes. Todo ocurre en una sola pasada; de ahí lo de «single shot».

Frente a Faster R-CNN y YOLO

En los experimentos del paper, el modelo SSD300 alcanzó un 74,3% de mAP (precisión media) en el banco de pruebas PASCAL VOC2007 procesando 59 imágenes por segundo en una GPU Titan X. Faster R-CNN, el detector de dos etapas de referencia, lograba una precisión similar (en torno al 73%) pero a solo 7 imágenes por segundo; y la primera versión de YOLO, el otro detector de una sola pasada, era rápida (45 imágenes por segundo) pero se quedaba en el 63,4%. En 2016, SSD ofrecía lo mejor de ambos mundos, y sus autores atribuyeron la ventaja sobre YOLO al uso de cajas por defecto en múltiples escalas.

Dónde queda SSD en 2026

En la frontera de la investigación, SSD está superado. Las comparativas actuales de detección, como las que mantienen Roboflow y Ultralytics, las encabezan detectores basados en transformers derivados de DETR —como RT-DETR o RF-DETR, que prescinden de anclas y de la supresión de no máximos— y las versiones recientes de la familia YOLO, como YOLO26, publicada por Ultralytics en enero de 2026.

Aun así, SSD no es una pieza de museo. Combinado con backbones ligeros como MobileNet, sigue desplegándose en dispositivos de borde —Raspberry Pi, Jetson— mediante frameworks como TensorFlow Lite, y los estudios de benchmarking en edge computing siguen incluyéndolo entre los modelos evaluados. Su idea central, predecir sobre cajas de referencia a varias escalas en una sola pasada, marcó el camino de buena parte de los detectores posteriores.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar