YOLO (You Only Look Once)
YOLO detecta objetos en una sola pasada, prediciendo cajas y clases a la vez; nació en 2015 para funcionar en tiempo real. Distinguimos clasificación, detección y segmentación, recorremos la familia de versiones hasta YOLO26 (2026) y comparamos con Faster R-CNN y DETR.
YOLO («You Only Look Once») es un detector de objetos de una sola etapa: una única red neuronal que, en una sola pasada sobre la imagen, predice a la vez las cajas delimitadoras y las clases de todos los objetos. Lo presentaron Joseph Redmon y sus colaboradores en 2015, planteando la detección como un problema de regresión directo —de píxeles a coordenadas y clase— en lugar del enfoque previo de proponer regiones y clasificarlas después. Su rasgo distintivo desde el origen es la velocidad, que lo hizo apto para vídeo en tiempo real.
Detectar no es clasificar
Conviene separar conceptos. La clasificación responde a «qué hay» y etiqueta la imagen entera; la detección responde a «qué y dónde», localiza y clasifica cada objeto a la vez; la caja delimitadora es el rectángulo que rodea cada objeto detectado; y la segmentación va más allá, etiquetando píxel a píxel. YOLO hace detección: divide la imagen en una rejilla y cada celda predice cajas candidatas con su confianza y su clase. Las versiones modernas son además multitarea, capaces de segmentación, estimación de pose o detección orientada.
Una familia viva, no un solo modelo
Hoy «YOLO» no designa un modelo, sino una familia de detectores en evolución, por lo que cualquier dato de velocidad o precisión exige indicar la versión. Redmon publicó las versiones 1 a 3 (entre 2015 y 2018) y después dejó la investigación en visión por computador; a partir de ahí la familia se fragmentó entre equipos distintos. Pasaron por ella YOLOv4 y v7 (Bochkovskiy, Wang y Liao), las versiones de la empresa Ultralytics (v5, v8 y YOLO11), YOLOX (Megvii), YOLOv6 (Meituan), YOLOv9 (Academia Sinica) y YOLOv10 (Universidad de Tsinghua), que introdujo la detección sin la fase de supresión de no máximos. Entre las referencias más recientes están YOLOv13 (2025) y YOLO26, de Ultralytics, lanzada a principios de 2026 y optimizada para dispositivos de bajo consumo.
Velocidad frente a precisión
YOLO nació para priorizar el tiempo real: al resolver localización y clasificación en una sola pasada, evita el cuello de botella de generar y evaluar miles de regiones candidatas. Su precio histórico fue una menor precisión con objetos pequeños o escenas densas. Los detectores de dos etapas, como Faster R-CNN, primero proponen regiones y luego las clasifican: más precisos en su día, pero más lentos. Los basados en Transformers, como DETR, plantean la detección sin anclas ni supresión de no máximos. Con los años, la diferencia de precisión se ha estrechado y las ideas se han contagiado entre familias: los YOLO recientes también prescinden de la supresión de no máximos.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.