IA 360
Glosario Inteligencia Artificial

Mecanismos de Atención

Qué son los mecanismos de atención, cómo Bahdanau, Cho y Bengio (2014) los introdujeron en la traducción automática, y por qué el esquema consulta-clave-valor y la atención multi-cabeza del Transformer los convirtieron en el núcleo de los grandes modelos de lenguaje.

Admin IA360 5 min de lectura Generado con IA Read in English
Mecanismos de Atención

Un mecanismo de atención permite a una red neuronal ponderar dinámicamente qué partes de la entrada son más relevantes para producir cada parte de la salida, en lugar de comprimir toda la secuencia en un único vector de tamaño fijo. En vez de tratar por igual todos los elementos, el modelo aprende a asignar un peso a cada uno y a concentrar su cálculo donde la información importa.

El origen: la traducción automática de Bahdanau (2014)

Dzmitry Bahdanau, Kyunghyun Cho y Yoshua Bengio introdujeron la atención en 2014, en «Neural Machine Translation by Jointly Learning to Align and Translate». Los traductores neuronales de la época seguían el esquema codificador-decodificador: una red comprimía la frase de origen entera en un vector de longitud fija y otra lo expandía en la frase traducida. Ese cuello de botella degradaba la calidad en frases largas, porque un solo vector no basta para retener toda la información. La solución fue dejar que el decodificador consultara todos los estados del codificador y calculara, en cada paso, una combinación ponderada de ellos: al generar cada palabra, el modelo «alinea» y atiende selectivamente a las palabras de origen pertinentes. Esta variante se conoce como atención aditiva o atención de Bahdanau, y las redes recurrentes que la albergaban solían ser LSTM (ver LSTM).

El esquema consulta-clave-valor y la autoatención

La formulación que se impuso describe la atención con tres papeles: una consulta (query), un conjunto de claves (keys) y un conjunto de valores (values). El modelo mide la similitud entre la consulta y cada clave para obtener los pesos de atención, normalizados de modo que sumen uno, y con ellos promedia los valores. El resultado es una lectura del contenido sesgada hacia lo relevante para esa consulta. Cuando consultas, claves y valores proceden de la misma secuencia, hablamos de autoatención (self-attention): cada elemento se relaciona con todos los demás de la secuencia, lo que permite capturar dependencias entre palabras distantes sin recorrer la frase paso a paso. Ese cálculo directo entre todos los pares es también la raíz de su principal límite, del que hablamos más abajo. Documentación: artículo original del mecanismo de atención; artículo original del Transformer.

El Transformer y la atención multi-cabeza

En 2017, Ashish Vaswani y sus colegas de Google llevaron la idea al extremo en «Attention Is All You Need»: su arquitectura, el Transformer, prescinde por completo de la recurrencia y basa todo el procesamiento en atención (ver Transformer). Dos aportaciones la definen. La atención de producto escalar escalado calcula los pesos con productos escalares entre consultas y claves, divididos por la raíz de su dimensión para estabilizar el entrenamiento. Y la atención multi-cabeza ejecuta varias atenciones en paralelo, cada una con sus propias proyecciones de consulta, clave y valor, de modo que cada «cabeza» aprende a fijarse en un tipo de relación distinto. Al eliminar la recurrencia, todos los elementos se procesan a la vez, lo que hizo el entrenamiento mucho más paralelizable. Hoy la atención es el núcleo de los grandes modelos de lenguaje.

Quedan cuestiones abiertas. El coste de la autoatención crece de forma cuadrática con la longitud de la secuencia —comparar cada elemento con todos los demás—, lo que encarece el procesamiento de textos largos y ha motivado numerosas variantes eficientes. Y la interpretabilidad de los pesos sigue en debate: que una cabeza atienda mucho a una palabra no equivale, sin más, a una explicación de por qué el modelo decide lo que decide. Documentación: artículo original del Transformer.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar