IA 360
Glosario Inteligencia Artificial

Visión por Computadora

Cómo la IA enseña a las máquinas a interpretar imágenes y vídeo: de las características diseñadas a mano al salto de AlexNet en 2012, los Vision Transformers y los modelos multimodales, con sus usos y sus límites aún abiertos.

Admin IA360 Generado con IA Read in English
Visión por Computadora

La visión por computadora (o visión artificial) es el campo de la inteligencia artificial que busca dotar a las máquinas de la capacidad de interpretar y extraer información del mundo visual: imágenes y vídeo. No consiste en capturar píxeles —eso lo hace cualquier cámara—, sino en comprender qué contienen: qué objetos aparecen, dónde están, cómo se mueven y qué significan en su contexto.

Su meta es convertir una matriz de valores de color en descripciones útiles y accionables. Donde el ojo humano reconoce sin esfuerzo un rostro, una señal de tráfico o una célula anómala, la máquina debe aprender a hacerlo a partir de datos, y ese aprendizaje es hoy el motor de buena parte de la IA aplicada.

Las tareas que resuelve

El campo se organiza en torno a un repertorio de tareas canónicas. La clasificación de imágenes asigna una etiqueta a una imagen completa; la detección de objetos localiza y rotula múltiples elementos con recuadros; la segmentación —semántica o de instancias— etiqueta la imagen píxel a píxel. A ellas se suman el reconocimiento de caras y de texto (OCR), la estimación de pose, que infiere la posición de un cuerpo, y el seguimiento de objetos a lo largo de un vídeo. Varias tienen entrada propia en este glosario —véanse detección de objetos y segmentación—, y casi todas descansan hoy sobre redes neuronales convolucionales (CNN), tratadas aparte. Fuente primaria. Fuente primaria. Fuente primaria. Fuente primaria.

El arco: de SIFT y HOG a los modelos multimodales

Durante décadas, ver por ordenador consistió en diseñar a mano las características relevantes: descriptores como el SIFT de David Lowe o el HOG (histograma de gradientes orientados) capturaban bordes y texturas para alimentar clasificadores clásicos. En 2012, AlexNet —la red convolucional profunda de Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton— ganó ILSVRC con un 15,3 % de error top-5, frente al 26,2 % del segundo clasificado. Ese resultado cuantifica el salto; «desató una era» es una interpretación histórica, no una medición del paper. Después vinieron arquitecturas más hondas y estables, como ResNet y sus conexiones residuales. En octubre de 2020, Alexey Dosovitskiy y sus colaboradores presentaron Vision Transformer (ViT): un Transformer puro aplicado directamente a secuencias de parches de imagen, trasladando a visión una arquitectura que ya era estándar en procesamiento del lenguaje. Entre los modelos fundacionales y multimodales, CLIP aprendió representaciones visuales prediciendo qué texto correspondía a cada imagen y permitió transferencia cero-shot. SAM fue entrenado para responder a indicaciones y transferirse sin ajuste específico a nuevas distribuciones y tareas de segmentación; «cero-shot» describe esa transferencia, no ausencia de entrenamiento: su conjunto SA-1B contiene más de mil millones de máscaras sobre once millones de imágenes. Fuente primaria.

Usos y límites

La visión por computadora ya sostiene la conducción autónoma, el diagnóstico médico por imagen, el control de calidad industrial y la biometría. Pero no es un problema resuelto. Los modelos siguen siendo frágiles ante los ejemplos adversarios —perturbaciones mínimas, imperceptibles para nosotros, que los engañan por completo—, arrastran sesgos de los datos con que se entrenan y pierden robustez cuando la escena se aleja de lo visto en el entrenamiento: otra iluminación, otro ángulo, otra población. Estos avances no prueban una fiabilidad visual general: los autores de CLIP informaron de que su transferencia cero-shot solía ser solo competitiva con una base ResNet-50 ya alejada del mejor resultado global y documentaron sensibilidad a cómo se redactan las clases; SAM, por su parte, comunica resultados sobre tareas de segmentación concretas. La evidencia sigue siendo específica de tarea, datos y métrica, no equivalente a una comparación universal con el ojo humano.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar