Modelos de lenguaje basados en Transformer: conceptos y avances
Cómo leer una arquitectura Transformer: Q/K/V, softmax, máscaras, posición, residuales, encoder y decoder, caché KV y coste del contexto.
El 30 de julio de 2026, «usa Transformer» describe una familia de componentes, no un modelo completo ni una garantía de calidad. Dos sistemas pueden compartir el nombre y diferir en máscara, señal posicional, número de cabezas, estructura encoder-decoder, objetivo, ventana de contexto y coste de inferencia. La capacidad útil es leer el diagrama como un contrato: qué posiciones se conectan, qué información comparten y qué precio paga el sistema por hacerlo.
La arquitectura publicada en Attention Is All You Need combinó atención, capas feed-forward, residuales, normalización y posición en un sistema de traducción. Los modelos de lenguaje posteriores seleccionan y modifican esas piezas. Reconstruirlas evita tratar «atención» como una explicación mágica.
La entrada del bloque tiene forma, no significado humano
Después de tokenizar, una secuencia de longitud n se representa como una matriz: una fila por posición y d valores por fila. Esa anchura, llamada dimensión del modelo, debe mantenerse a través de las conexiones residuales. El bloque no recibe palabras: recibe vectores contextualizados hasta ese punto.
Cada cabeza aprende tres proyecciones lineales de esa matriz. Q contiene consultas; K, claves; V, valores. Si una cabeza usa dimensión dh, cada posición produce una consulta, clave y valor de ese tamaño. Los nombres describen roles algebraicos, no bases de datos separadas.
El producto escalar convierte compatibilidad en mezcla
La atención escalada puede resumirse como softmax(QKᵀ/√dh)V. El producto QKᵀ crea una matriz de n × n: una puntuación entre cada consulta y cada clave permitida. Dividir por la raíz de la dimensión evita que productos grandes saturen softmax al crecer la anchura. La máscara convierte conexiones prohibidas en valores que reciben peso nulo. Softmax normaliza cada fila; multiplicar por V mezcla contenido.
Esto aclara tres malentendidos. La atención no «mira todas las palabras» si la máscara o un patrón disperso lo impide. Un peso alto no demuestra por sí solo una causa de la predicción final, porque después quedan capas, residuales y otras cabezas. Y la salida no copia necesariamente un token: combina vectores de valor aprendidos.
Varias cabezas amplían las proyecciones, no los hechos
La atención multi-cabeza ejecuta el cálculo en subespacios distintos, concatena las salidas y las proyecta de nuevo a la dimensión del modelo. Esto permite representar relaciones diferentes sin obligarlas a compartir una única matriz de compatibilidad. Pero el número de cabezas no mide cuántos tipos de razonamiento posee el modelo. Una cabeza puede ser redundante, especializarse solo en ciertos datos o cambiar su patrón entre capas.
Para auditar una afirmación sobre una cabeza hacen falta intervenciones, no solo una visualización: ablarla, modificar entradas y medir el efecto sobre salidas. Un mapa de colores es evidencia descriptiva de pesos, no una explicación completa de conducta.
La posición es una decisión arquitectónica
La autoatención sin señal adicional es indiferente al orden. El Transformer original añadió vectores sinusoidales a las representaciones y consideró posiciones aprendidas. Otras variantes incorporan relaciones relativas. RoPE, por ejemplo, rota consultas y claves según posición para introducir dependencia relativa en el producto de atención.
La elección afecta extrapolación y coste. Un modelo entrenado con cierta longitud o distribución posicional no hereda automáticamente precisión a ventanas mayores. Que una interfaz acepte más tokens solo prueba capacidad de entrada; la recuperación de información y el uso de posiciones lejanas necesitan pruebas específicas.
El bloque completo alterna comunicación y transformación
La atención permite que posiciones intercambien información. La red feed-forward transforma cada posición por separado mediante dos proyecciones y una no lineal. Las conexiones residuales suman la entrada del subbloque a su salida, creando rutas directas a través de la profundidad. La normalización controla la escala; puede situarse antes o después de los subbloques según la variante.
Estas piezas importan al entrenar. El gradiente debe atravesar muchas capas, y pequeños cambios de orden, inicialización o normalización alteran la estabilidad. Por eso comparar modelos solo por número de parámetros oculta decisiones que afectan la capacidad utilizable.
Encoder, decoder y encoder-decoder no son sinónimos
Un encoder permite normalmente atención bidireccional dentro de la entrada y produce una representación por posición. BERT es el ejemplo clásico: oculta tokens durante el preentrenamiento y usa el contexto de ambos lados para recuperarlos.
Un decoder causal aplica una máscara triangular: la posición que predice un token solo puede usar el prefijo. El primer GPT empleó preentrenamiento generativo de izquierda a derecha y ajuste a tareas. En generación, cada nuevo token se incorpora al prefijo y obliga a calcular el siguiente.
Un encoder-decoder separa la entrada de la salida. El encoder procesa la fuente; el decoder usa autoatención causal sobre lo generado y atención cruzada sobre las representaciones de la fuente. El Transformer original era de este tipo. T5 estudió esta estructura dentro de un marco texto-a-texto. Elegir una familia depende de si se necesita representar una entrada, continuar un prefijo o generar una salida condicionada a otra secuencia.
Entrenamiento paralelo, generación secuencial
Durante el entrenamiento causal, una secuencia completa permite calcular pérdidas de muchas posiciones a la vez porque la máscara bloquea el futuro. Durante la generación no se conoce el próximo token y los pasos son secuenciales. Sin optimización, cada paso repetiría cálculos sobre el prefijo.
La caché KV conserva claves y valores de posiciones anteriores para reutilizarlos. Reduce cómputo repetido, pero la memoria de caché crece con longitud, capas, tamaño de cabeza y número de cabezas K/V. La atención de consultas agrupadas (GQA) comparte menos cabezas de claves y valores entre varias cabezas de consulta, buscando un intercambio entre calidad y coste de inferencia. El avance no es «más inteligencia»: es otra asignación de memoria y ancho de banda.
El contexto largo tiene más de un coste
La matriz de atención densa contiene pares entre posiciones; su tamaño crece cuadráticamente con n. Eso afecta operaciones y memoria intermedia. FlashAttention no cambia el resultado matemático de la atención exacta: reorganiza el cálculo en bloques para reducir lecturas y escrituras entre niveles de memoria de la GPU. Distinguir algoritmo de arquitectura evita afirmar que cualquier reducción de tiempo cambia la capacidad del modelo.
Otros métodos cambian el patrón. Longformer combina ventanas locales con posiciones de atención global para reducir el crecimiento respecto a la atención densa. El precio es que no todos los pares se conectan directamente. Antes de aceptar «contexto más largo», conviene preguntar si la técnica es exacta, dispersa, recurrente o compresiva y qué tareas se evaluaron.
Los casos deben demostrar mecanismo, no decorar
Un Transformer puede operar sobre texto, imagen, audio u otras secuencias si se define una tokenización o representación apropiada. Eso no convierte una CNN, un modelo de proteínas y un asistente en el mismo producto. La unidad, el objetivo y la evaluación cambian. Una sección de «casos» sin entidad, cifra, fuente y control solo imita la forma de evidencia.
La forma honesta de usar un caso es enlazar el trabajo primario y nombrar el componente transferido. BERT demuestra un encoder enmascarado en tareas concretas; GPT, un decoder causal preentrenado; T5, una formulación encoder-decoder texto-a-texto; FlashAttention, una implementación exacta consciente de E/S. Ninguno prueba por sí solo superioridad universal de Transformer sobre toda alternativa.
La ficha para leer una arquitectura
- Representación: longitud n, dimensión d y tokenización.
- Atención: número y tamaño de cabezas Q, K y V.
- Conectividad: máscara causal, bidireccional, local o cruzada.
- Posición: absoluta, relativa, rotatoria u otra, y longitud de entrenamiento.
- Bloque: orden de atención, feed-forward, residuales y normalización.
- Familia: encoder, decoder o encoder-decoder.
- Coste: entrenamiento, caché KV, memoria intermedia, latencia y longitud.
- Evidencia: tarea, referencia, ablación y datos no vistos.
La capacidad transferible es convertir un diagrama Transformer en esa ficha. La atención define rutas de mezcla; la máscara define información permitida; la posición conserva orden; el bloque transforma; la familia fija la dirección del cálculo. Los «avances» dignos de ese nombre deben indicar qué cuello de botella cambian y qué coste desplazan.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.