IA 360
Glosario Inteligencia Artificial

Zero-Shot Learning

El aprendizaje de cero disparos (Zero-Shot Learning) permite a un modelo resolver una tarea o reconocer una clase sin haber visto ni un solo ejemplo durante el entrenamiento. Del puente por atributos semánticos de la visión clásica al prompting cero-shot de GPT-3 y CLIP, con sus grados y sus límites.

Admin IA360 4 min de lectura Generado con IA
Zero-Shot Learning

El aprendizaje de cero disparos (Zero-Shot Learning, ZSL) es la capacidad de un modelo para resolver una tarea o reconocer una clase de la que no vio ni un solo ejemplo durante el entrenamiento. Frente al aprendizaje supervisado clásico, que necesita muchos ejemplos etiquetados de cada categoría, el ZSL pide al sistema que generalice hacia lo que nunca observó apoyándose en algún tipo de conocimiento auxiliar.

La pregunta que resuelve es concreta: ¿cómo puede una máquina identificar algo que no estaba en sus datos? La respuesta está en tender un puente entre lo visto y lo no visto mediante información semántica.

El enfoque clásico: atributos semánticos

En visión por computador, el ZSL se construyó sobre información auxiliar descrita por humanos. En lugar de aprender cada clase por separado, el modelo aprende atributos reutilizables —tiene rayas, es marrón, vive en el agua, come pescado— y describe cada categoría como una combinación de ellos. Así puede reconocer una cebra sin haberla visto nunca si sabe que es, en esencia, «como un caballo a rayas».

Mark Palatucci, Dean Pomerleau, Geoffrey Hinton y Tom Mitchell formalizaron este puente mediante códigos de salida semánticos, que relacionan las clases vistas con las no vistas.

El cero-shot de los grandes modelos: GPT-3 y CLIP

El término reapareció con fuerza en la era de los grandes modelos, con un sentido más amplio. En 2020, el equipo de Tom Brown en OpenAI presentó GPT-3 en «Language Models are Few-Shot Learners»: bastaba describir una tarea en lenguaje natural, sin ejemplos, para que el modelo la ejecutara. Es el prompting cero-shot.

En 2021, Alec Radford y su equipo llevaron la idea a lo multimodal con CLIP («Learning Transferable Visual Models From Natural Language Supervision»). CLIP clasifica una imagen comparándola con descripciones de texto arbitrarias, de modo que puede etiquetar categorías nuevas sin reentrenarse, solo cambiando las frases candidatas. Documentación: artículo original de GPT-3; artículo original de CLIP.

Frente a one-shot y few-shot, y sus límites

Conviene distinguir grados. En one-shot se da un único ejemplo de la clase o tarea; en few-shot, unos pocos; en cero-shot, ninguno. Cuantos más ejemplos, mejor suele ser el rendimiento: el cero-shot casi siempre rinde por debajo del ajuste con ejemplos.

Queda un debate honesto y abierto: cuánto del acierto cero-shot es generalización genuina hacia lo no visto y cuánto refleja que categorías o tareas «nuevas» aparecieron, de forma parcial, en los enormes corpus de preentrenamiento. Medir esa frontera con rigor sigue siendo un problema activo de investigación. Documentación: artículo fundacional de cero-shot; evaluación de GPT-3.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar