IA 360
Glosario Inteligencia Artificial

Atención

El mecanismo que permite a una red neuronal ponderar dinámicamente las partes relevantes de su entrada en lugar de comprimirla en un vector fijo. De la traducción automática de Bahdanau (2014) al Transformer, es hoy el cimiento de los grandes modelos de lenguaje.

Admin IA360 4 min de lectura Generado con IA Read in English
Atención

La atención es un mecanismo de las redes neuronales que les permite ponderar dinámicamente distintas partes de la entrada según su relevancia para cada elemento que producen. En lugar de comprimir toda una secuencia —una frase, un párrafo, una imagen— en un único vector de tamaño fijo, la red aprende a «mirar» en cada paso las porciones del dato que de verdad importan y a asignarles más peso.

Esa capacidad de enfoque selectivo, inspirada de forma laxa en cómo la mente humana concentra la percepción en unas cosas e ignora otras, es hoy la pieza central de los grandes modelos de lenguaje. Los Transformers la convirtieron en una pieza central de numerosos traductores y sistemas que redactan, resumen o conversan. Fuente primaria.

Qué resuelve: ponderar la entrada

Los primeros modelos de secuencia a secuencia arrastraban un cuello de botella. Un codificador leía toda la frase de origen y la resumía en un vector fijo; un decodificador debía reconstruir a partir de él la frase de destino. Cuanto más larga la entrada, más información se perdía al forzarla dentro de ese vector. La atención rompe el cuello de botella: mantiene disponibles todas las representaciones de la entrada y deja que el modelo decida, para cada palabra que genera, cuánto peso dar a cada parte del origen. Fuente primaria.

De la traducción a la autoatención

El mecanismo nació en la traducción automática neuronal. En 2014, Dzmitry Bahdanau, Kyunghyun Cho y Yoshua Bengio propusieron dejar que el decodificador «buscara» de forma suave las palabras del origen relevantes para predecir cada palabra de destino, en vez de depender de un único vector. El salto conceptual llegó con la autoatención (self-attention): en lugar de que una secuencia atienda a otra distinta, cada elemento de una misma secuencia atiende a todos los demás. Así una palabra puede relacionarse con otra situada muchas posiciones atrás y resolver, por ejemplo, a qué se refiere un pronombre. Fuente primaria.

Consulta, clave, valor y el Transformer

La autoatención se construye con tres vectores por elemento: una consulta (query), una clave (key) y un valor (value). La consulta de cada elemento se compara con las claves de todos los demás para medir su afinidad; esas afinidades, una vez normalizadas, se convierten en pesos que combinan los valores y producen una representación enriquecida con el contexto relevante. Para captar varios tipos de relación a la vez, el proceso se repite en paralelo en varias «cabezas» (atención de múltiples cabezas o multi-head). En 2017, Ashish Vaswani y sus colegas de Google llevaron la idea al extremo en «Attention Is All You Need»: levantaron toda una arquitectura, el Transformer, sobre la atención y prescindieron por completo de la recurrencia. Al permitir procesar la secuencia en paralelo, esa decisión abrió la puerta a entrenar modelos mucho mayores.

Por qué importa y su coste cuadrático

La autoatención completa compara cada elemento con todos los demás, por lo que su coste crece de forma cuadrática con la longitud de la secuencia. Éste es un límite práctico en contextos largos. Fuente primaria.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar