IA 360
Modelos de lenguaje

Contexto no es memoria: dónde guarda información un modelo de lenguaje

Un mapa para separar parámetros, contexto, estado recurrente, recuperación y datos persistentes, sin llamar memoria a todo.

Admin IA360 4 min de lectura Generado con IA Read in English
Contexto no es memoria: dónde guarda información un modelo de lenguaje

A 30 de julio de 2026, muchos productos prometen que un modelo de lenguaje «recuerda». Esa palabra puede describir al menos cinco mecanismos incompatibles: parámetros aprendidos, tokens todavía presentes, un estado recurrente, documentos recuperados o datos guardados por la aplicación. La atención no es un sexto almacén: es una operación para combinar información disponible. Saber dibujar estas capas permite diagnosticar por qué un sistema olvida, cuándo una conversación se convierte en dato persistente y qué afirmación de memoria es solo marketing.

Primero: atención selecciona, no archiva

En el Transformer original, cada posición construye una consulta, claves y valores. Las coincidencias entre la consulta y las claves ponderan una mezcla de valores. Esa operación transforma las representaciones que ya están en la secuencia; no crea por sí sola un archivo que sobreviva a otra petición.

La máscara define qué posiciones son visibles. Un encoder puede combinar contexto a ambos lados; un generador autorregresivo impide mirar tokens futuros. Varias cabezas aplican proyecciones distintas, pero «prestar atención» no equivale a decidir conscientemente qué recordar. Es cálculo condicionado por entradas y pesos.

La prueba más sencilla consiste en iniciar una sesión sin historial. Si el dato desaparece, estaba en el contexto o en estado temporal de la aplicación, no en los parámetros. Si reaparece porque el servicio reinyecta un resumen, existe un sistema de almacenamiento y recuperación alrededor del modelo. Llamarlo todo memoria esconde justamente el mecanismo que hay que evaluar.

Capa 1: los parámetros conservan regularidades

Durante el entrenamiento, el gradiente modifica pesos para reducir el error de predicción. Esos pesos condensan patrones estadísticos de muchos ejemplos. A veces permiten reproducir un hecho, un estilo o incluso una secuencia; pero no contienen filas consultables con fuente y fecha. Localizar, corregir o borrar un dato concreto no es equivalente a editar una base de datos.

Esta «memoria paramétrica» persiste entre peticiones mientras se use la misma versión del modelo. También queda congelada respecto al corte de entrenamiento, salvo ajuste posterior. Que una respuesta salga de los pesos no demuestra que sea cierta ni permite conocer automáticamente su procedencia. Por eso conviene separar conocimiento aparente de recuperación verificable.

Capa 2: la ventana de contexto es una mesa de trabajo

Los tokens incluidos en una petición y su historial forman el material disponible para el cálculo actual. El sistema puede relacionar una instrucción inicial con una pregunta posterior porque ambas siguen en esa ventana. Cuando se supera el límite, la aplicación debe truncar, resumir o seleccionar; cada decisión puede perder detalles.

Capacidad nominal no significa uso perfecto. El estudio Lost in the Middle colocó información relevante en distintas posiciones de contextos largos y observó variaciones pronunciadas en la capacidad de recuperarla. La evaluación de una ventana debe mover la evidencia, añadir distractores y probar preguntas que requieren conectar fragmentos, no limitarse a mostrar que el texto cabe.

El contexto tampoco es necesariamente privado o efímero. El proveedor o la aplicación pueden registrar prompts por motivos operativos o de producto. Eso pertenece a políticas y arquitectura del servicio, no a la atención del modelo. Para una auditoría hay que preguntar qué se envía, quién lo almacena, durante cuánto tiempo y con qué controles.

Capa 3: el estado recurrente cruza pasos o segmentos

Una red recurrente actualiza un estado a medida que recorre la secuencia. La arquitectura LSTM añadió compuertas y una celda para controlar qué información entra, permanece y sale. Ese estado es una compresión aprendida del pasado, no una copia literal; puede degradar detalles y normalmente se reinicia al empezar otra secuencia.

Transformer-XL abordó la dependencia más allá de segmentos reutilizando estados ocultos de un segmento anterior y empleando una codificación posicional relativa. Esa es recurrencia a nivel de segmento. No debe confundirse con atención dispersa, donde un patrón limita qué pares de posiciones se conectan. Longformer sí es un ejemplo de patrones locales y globales de atención dispersa para secuencias largas.

También existe una caché de claves y valores durante la generación. Evita recalcular estados de tokens anteriores en cada paso y acelera la inferencia. Aunque se llame caché, no añade hechos nuevos ni extiende por sí sola el límite entrenado: conserva resultados intermedios de la misma secuencia.

Capa 4: recuperación desde un almacén externo

Un sistema puede buscar fragmentos en documentos, una base vectorial o un índice y colocarlos en el prompt. El trabajo de Retrieval-Augmented Generation combinó una memoria paramétrica con una memoria no paramétrica indexada y evaluó su uso en tareas intensivas en conocimiento. RETRO estudió otra integración de recuperación a gran escala durante generación.

La ventaja es operativa: el corpus puede actualizarse, cada fragmento puede conservar metadatos y el lector puede recibir una cita. Pero recuperar no verifica. El buscador puede elegir el documento equivocado, un fragmento puede perder contexto y el generador puede afirmar más de lo que dice la fuente. La cadena debe registrar consulta, versión del índice, resultados, pasajes usados y afirmaciones finales.

Una búsqueda por similitud tampoco es recuerdo humano. Convierte la consulta y los documentos en representaciones, recupera vecinos según una métrica y, a veces, reordena candidatos. La calidad depende de partición, embeddings, filtros, idioma y cobertura. Si la información no está en el corpus o no se recupera, el modelo no puede «recordarla» mediante esa vía.

Capa 5: el producto conserva estado duradero

Preferencias, tareas, nombres o decisiones pueden guardarse en una base de datos tradicional. En la siguiente conversación, la aplicación selecciona algunas y las vuelve a introducir. Esta capa tiene propiedades que un modelo solo no ofrece: campos, identidad, fecha, permisos, historial de cambios y borrado explícito.

Los primeros Memory Networks ya separaban componentes para escribir, leer y responder sobre una memoria. Los sistemas de producto actuales pueden implementar el principio con tecnologías muy diferentes. La pregunta decisiva no es si hay un módulo llamado «memory», sino quién escribe qué, bajo qué clave, cómo se recupera y cómo el usuario puede corregirlo o eliminarlo.

Persistencia y actualización son ejes distintos

Un dato puede durar mucho y ser difícil de actualizar, como una asociación en los pesos. Puede durar poco y ser exacto, como una cifra en el prompt actual. Puede persistir y ser editable, como un registro de base de datos. Puede estar actualizado pero recuperarse mal desde un índice. Evaluar «memoria» con una única nota mezcla propiedades que deben medirse por separado.

Conviene anotar al menos seis: alcance, qué sesiones comparten el dato; duración, cuándo expira; capacidad, cuánto cabe; fidelidad, qué se pierde; procedencia, si se sabe de dónde salió; control, quién puede leer, corregir y borrar. Añadir latencia y coste completa la comparación técnica.

Una prueba de memoria debe incluir interferencia

No basta preguntar de inmediato por una frase recién dada. Hay que introducir información parecida, corregir un dato, cambiar de tema, llenar la ventana, cerrar la sesión y volver. Después se comprueba si el sistema recupera la versión correcta, si cita el origen, si mezcla identidades y si respeta una orden de olvido.

Para recuperación externa, se mide recall de documentos relevantes antes de calificar la redacción. Para estado duradero, se prueban permisos y borrado. Para contexto largo, se varía posición y distractores. Para parámetros, se evita prometer actualización puntual o procedencia que el mecanismo no proporciona.

El mapa para cualquier promesa de «memoria»

Ante una función nueva, dibuja cinco cajas: pesos, contexto, estado o caché, recuperación y base de datos. Marca dónde nace el dato, cuánto dura, cómo llega al modelo y quién puede modificarlo. Luego identifica el papel de la atención: seleccionar relaciones dentro del material visible, no custodiarlo para mañana.

Ese mapa resuelve la confusión central. Un modelo puede atender a una frase sin conservarla; conservar patrones sin poder citarlos; recuperar un documento sin verificarlo; y parecer que recuerda porque la aplicación reintroduce una nota. «Memoria» solo se vuelve una propiedad defendible cuando se nombra el almacén, la ruta y la prueba.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Artículos relacionados

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña
Modelos de lenguaje

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña

«Cuánta GPU hace falta» es la pregunta equivocada. Cómputo, datos y conocimiento no se suman: son tres puertas en serie, y la que casi nadie pasa no es la del hardware. Con el precio real de hoy, el corpus real de un modelo abierto y el cuaderno de bitácora real de un entrenamiento de 175.000 millones de parámetros, esta pieza hace la cuenta completa — y te dice en qué escalón estás tú.

7 min
Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no
Modelos de lenguaje

Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no

En 2023, un equipo de investigadores le pidió a ChatGPT que repitiera la palabra 'poema' sin parar, y el modelo acabó recitando 'El cuervo' de Poe palabra por palabra. Eso no prueba que los modelos guarden una copia de internet, pero tampoco que nunca memoricen nada: las dos afirmaciones son ciertas según el caso. Las cuatro preguntas que separan una demanda seria de un titular vacío.

7 min

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar