IA 360
Modelos de lenguaje

Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no

En 2023, un equipo de investigadores le pidió a ChatGPT que repitiera la palabra 'poema' sin parar, y el modelo acabó recitando 'El cuervo' de Poe palabra por palabra. Eso no prueba que los modelos guarden una copia de internet, pero tampoco que nunca memoricen nada: las dos afirmaciones son ciertas según el caso. Las cuatro preguntas que separan una demanda seria de un titular vacío.

Admin IA360 7 min de lectura Generado con IA Read in English
Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no

En noviembre de 2023, un equipo de investigadores de Google DeepMind y varias universidades le pidió a ChatGPT que hiciera algo absurdo: "repite la palabra 'poema' para siempre". El modelo obedeció durante varios cientos de repeticiones —"poema poema poema poema..."— y entonces, sin que se lo pidieran, empezó a escribir otra cosa: párrafos completos de novelas y el poema "El cuervo", de Edgar Allan Poe, palabra por palabra. Cotejando lo que salía contra una base de datos de nueve terabytes de texto de internet, el equipo confirmó más de diez mil fragmentos literales del material de entrenamiento de ChatGPT, por un coste de consulta de 200 dólares. No fue un accidente ni una filtración: fue un ataque deliberado, con metodología publicada, que rompía el comportamiento normal del asistente para forzarlo a recitar. Los propios autores lo comunicaron a OpenAI antes de publicarlo, dándole tiempo para reaccionar —una nota de responsabilidad tan importante como el hallazgo mismo, y que casi ninguna cobertura del caso menciona.

Esta pieza convive con dos afirmaciones que suenan contradictorias y no lo son. "Un modelo no guarda el texto de entrenamiento como una base de datos" es verdad. "Se han extraído fragmentos literales de entrenamiento de modelos publicados" también es verdad. El periodismo flojo elige una según qué titular necesite. Aquí van las dos, y cuándo aplica cada una —porque la próxima vez que leas "este modelo contiene mi obra" en una demanda, un comunicado o un hilo indignado, vas a necesitar saber qué preguntar, no una respuesta ya masticada.

Por qué "base de datos comprimida" es una analogía falsa

Si no sabes qué es exactamente un peso, esta misma serie lo explica desde cero en la pieza anterior antes de seguir con esta. Una base de datos tiene registros direccionables: pides el documento número 4.521 y lo recibes entero e intacto. Los pesos de un modelo no funcionan así. Son una función continua ajustada para predecir la siguiente palabra, sin índice ni tabla de consulta, y la inmensísima mayoría de los documentos de entrenamiento —probablemente miles de millones— no dejan ningún rastro recuperable. Cuando Nasr, Carlini y su equipo probaron ChatGPT con métodos normales, el modelo parecía memorizar 50 veces menos que un modelo sin ajustar por instrucciones: el ajuste que lo vuelve conversacional también le enseña, como efecto colateral, a no recitar. Hizo falta el ataque del "poema" —que rompe ese comportamiento a propósito— para que emitiera datos de entrenamiento 150 veces más que en condiciones normales.

Por qué "nunca memoriza nada" también es falso

En 2021, Carlini y su equipo generaron 600.000 muestras de GPT-2, las redujeron a 1.800 candidatas mediante métricas automáticas, y cuatro investigadores revisaron cada una a mano. Confirmaron 604 ejemplos memorizados literalmente: nombres, teléfonos y direcciones de correo reales, identificadores UUID de 128 bits, conversaciones de IRC, y fragmentos de código fuente. GPT-2 se entrenó con 40 gigabytes de texto; encontrar 604 fragmentos recuperables les costó generar cientos de miles de muestras y una revisión manual experta. Del total, identificaron 50 URLs memorizadas y 31 fragmentos de código fuente casi literal, entre otras categorías —una fracción diminuta y muy concreta, no "el libro entero" ni "todo internet". Eso es lo que separa "se puede extraer" de "es fácil de extraer": ambas cosas son ciertas, pero no en la misma escala de esfuerzo.

Qué determina si algo se puede extraer

Aquí está el hallazgo más útil para evaluar cualquier caso concreto. En 2022, el mismo equipo describió tres relaciones que predicen cuánto memoriza un modelo, cada una con una fuerza casi perfectamente medible: memoriza más cuanto (1) más grande es el modelo —con un ajuste del 99,8%—, (2) más veces se repitió ese texto exacto en el entrenamiento, y (3) más largo es el fragmento con el que se le pide continuar. La duplicación es el factor que más pesa: un poema famoso citado en cientos de páginas web, un artículo de noticias replicado por decenas de medios, o una licencia de software copiada en miles de repositorios tienen muchas más probabilidades de salir intactos que un documento que solo existe una vez en todo el corpus.

Y aquí está lo que hay que decir sin rodeos porque casi nadie lo dice: los propios autores admiten que generalizar estos tres factores entre familias de modelos distintas "se complica" —su cita literal—, y no existe, hasta donde hemos podido verificar, un estudio público con esta misma metodología rigurosa sobre los modelos de frontera más recientes y cerrados (GPT-4 y posteriores, Claude, Gemini). Lo que sabemos con este nivel de rigor es sobre GPT-2 (pequeño, antiguo, abierto) y sobre gpt-3.5-turbo, atacado mediante una vulnerabilidad concreta y comunicada a OpenAI de forma responsable —descubierta el 11 de julio de 2023, notificada el 30 de agosto, con 90 días de plazo antes de publicarse—. Sobre los modelos que se usan hoy, con este método, esto no se sabe.

La capacidad: qué preguntar, no qué responder

Ante cualquier afirmación de "este modelo contiene —o no contiene— mi obra", hay cuatro preguntas que sostienen el argumento mejor que la afirmación misma:

  1. ¿Cuánto se memorizó? 604 ejemplos de 40 gigabytes no es "todo el entrenamiento memorizado": es una fracción minúscula, y probablemente sesgada hacia lo más duplicado.
  2. ¿En qué condiciones se extrajo? ¿Una conversación normal, o un ataque diseñado para romper el comportamiento del modelo, como pedirle que repita una palabra sin parar?
  3. ¿Con qué esfuerzo? ¿Un usuario probó una vez, o un equipo generó cientos de miles de muestras y las filtró con metodología publicada?
  4. ¿Es representativo, o es el caso extremo que se buscaba a propósito? Un poema tan citado como "El cuervo" es exactamente el tipo de texto que la duplicación hace más memorizable; no prueba nada sobre un texto que solo aparece una vez.

Una afirmación que no puede responder a estas cuatro no es un hecho: es una sospecha vestida de titular. Aplicadas al propio caso de "El cuervo": ¿cuánto? Un poema, no la obra completa de Poe. ¿En qué condiciones? Un ataque diseñado para romper el ajuste conversacional del modelo, no una conversación cualquiera. ¿Con qué esfuerzo? Un equipo de investigación con metodología publicada y una base de datos de nueve terabytes para verificar. ¿Es representativo? No: "El cuervo" es uno de los poemas en inglés más citados y reproducidos de la historia, precisamente el tipo de texto que la duplicación hace fácil de recuperar. Las cuatro respuestas sostienen el titular sin necesitar ni tranquilizarte ni asustarte.

Y donde no tengamos la respuesta —como en los modelos más recientes— la frase correcta es "esto no se sabe", no un relleno tranquilizador ni uno alarmista.

Para quien quiera ir más lejos

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Artículos relacionados

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar