IA 360
GPT-4

¿Qué es GPT-4?

El informe técnico de GPT-4, publicado por OpenAI el 15 de marzo de 2023, declara en su sección de alcance que «no contiene más detalles sobre la arquitectura (incluido el tamaño del modelo), el hardware, el cómputo de entrenamiento, la construcción del conjunto de datos, el método de entrenamiento ni similares». Qué dice entonces el fabricante, de dónde salen las cifras que circulan, y cómo leer cualquier producto cuyo creador declara expresamente lo que no cuenta.

Admin IA360 3 min de lectura Generado con IA Read in English
¿Qué es GPT-4?

El 15 de marzo de 2023, OpenAI publicó el «GPT-4 Technical Report». Es un documento de cientos de páginas, con casi trescientos firmantes, y contiene una frase que conviene leer entera antes que ninguna otra cosa sobre este modelo:

«Dado tanto el panorama competitivo como las implicaciones de seguridad de los modelos a gran escala como GPT-4, este informe no contiene más detalles sobre la arquitectura (incluido el tamaño del modelo), el hardware, el cómputo de entrenamiento, la construcción del conjunto de datos, el método de entrenamiento ni similares.»

Un informe técnico que declara, en su propia sección de alcance, que no da los detalles técnicos. No es una contradicción ni un descuido: es una decisión explicada. Pero cambia por completo lo que se puede afirmar sobre este modelo, y es la razón por la que casi todo lo que circula sobre «cómo funciona GPT-4 por dentro» no procede de ninguna parte.

Lo que el fabricante sí dice

La lista es corta y merece la pena conocerla exactamente, porque es todo lo que hay de origen.

Es «un modelo multimodal a gran escala que puede aceptar entradas de imagen y texto y producir salidas de texto». Es «un modelo de estilo Transformer preentrenado para predecir el siguiente token de un documento». Se entrenó «usando tanto datos disponibles públicamente (como datos de internet) como datos licenciados de proveedores externos». Y después «se ajustó usando aprendizaje por refuerzo a partir de retroalimentación humana (RLHF)».

Sobre resultados, el resumen es igual de concreto: el modelo «exhibe rendimiento de nivel humano en varios exámenes profesionales y académicos, incluido aprobar un examen de acceso a la abogacía simulado con una puntuación en torno al 10% superior de los examinados». Y añade un dato menos citado y bastante más interesante: desarrollaron métodos que se comportan de forma predecible a distintas escalas, lo que les permitió «predecir con precisión algunos aspectos del rendimiento de GPT-4 a partir de modelos entrenados con no más de 1/1.000 del cómputo de GPT-4».

Eso es todo. Ni parámetros, ni datos de entrenamiento, ni hardware, ni coste.

Lo que nadie sabe, aunque lo lea a diario

Aquí está lo aprovechable. Cada vez que encuentre una cifra sobre el tamaño de GPT-4 —los billones de parámetros, la arquitectura interna concreta, el número de expertos, el coste exacto del entrenamiento—, esa cifra no puede venir del fabricante, porque el fabricante escribió que no lo cuenta.

Puede venir de tres sitios, y conviene distinguirlos: de una estimación técnica razonada por terceros, que es legítima si se presenta como estimación; de una filtración no confirmada; o de nadie, que es el caso más frecuente — alguien lo dijo, otro lo repitió y en la tercera repetición ya viajaba sin comillas.

La capacidad que se lleva usted es ésta: cuando un fabricante declara expresamente que no revela un dato, cualquier afirmación segura sobre ese dato es, en el mejor de los casos, una estimación de otro. Y lo que hay que buscar no es si el número suena plausible, sino quién lo midió y cómo. Si la respuesta es «se dice», no hay respuesta.

Sirve mucho más allá de este modelo. Vale para el rendimiento de un procesador que no publica sus pruebas, para la fórmula de un producto, para el algoritmo de una plataforma. El silencio del fabricante no crea conocimiento en la prensa, aunque a veces lo parezca.

El dato del informe que casi nadie cuenta

Entre todo lo que sí revela el documento hay un resultado que pasó casi inadvertido y que probablemente sea el más importante de los que publicaron. Está en el resumen: pudieron «predecir con precisión algunos aspectos del rendimiento de GPT-4 a partir de modelos entrenados con no más de 1/1.000 del cómputo de GPT-4».

Traducido: entrenaron versiones mil veces más pequeñas y baratas, midieron cómo les iba, y de ahí calcularon por adelantado cómo se comportaría el modelo grande antes de gastarse el dinero en construirlo.

Eso suena a detalle de laboratorio y es un cambio de naturaleza. Durante años, entrenar un modelo grande fue una apuesta: se invertía una fortuna y se veía qué salía. Poder predecir el resultado desde un experimento mil veces más barato convierte esa apuesta en un proyecto presupuestable, con una previsión que se puede defender ante quien pone el dinero. Es la diferencia entre la alquimia y la ingeniería, y explica buena parte de por qué desde entonces hay tantos modelos grandes: dejó de ser una lotería.

Con una honestidad que conviene subrayar, porque está en la propia frase: dicen «algunos aspectos», no todos. Hay capacidades que siguen apareciendo de forma discontinua y que un modelo pequeño no anticipa. Ese «algunos» es la palabra que separa el enunciado real del titular que habría hecho cualquiera.

Y ahí va una segunda capacidad, gemela de la primera: en los documentos técnicos, los cuantificadores son el contenido. «Algunos aspectos», «en la mayoría de las pruebas que hicimos», «en torno al 10% superior». Quien lee saltándose esas acotaciones lee otro documento distinto del que se publicó.

Por qué el informe se llama técnico si no da la técnica

Porque documenta otra cosa, y esa parte sí es sustanciosa: qué sabe hacer el modelo, dónde falla, y qué riesgos se midieron antes de publicarlo. Capacidades, limitaciones y propiedades de seguridad —así se presenta el propio documento— en lugar de ingeniería.

Conviene entender el argumento que dan, aunque no se comparta, porque va a repetirse en cada modelo grande que salga. Dicen dos razones: el «panorama competitivo» —quien publica la receta se la regala a quien va detrás— y las «implicaciones de seguridad» de que cualquiera pueda reconstruir un sistema de esa potencia. El propio texto añade un compromiso: se declaran «comprometidos con la auditoría independiente» de sus tecnologías y anuncian que planean facilitar más detalles técnicos a terceros que puedan asesorarles.

Se puede pensar que la primera razón pesa más que la segunda, y hay quien lo sostiene con argumentos. Pero eso es un debate legítimo sobre política de publicación, y es distinto de fingir que los datos están disponibles.

Qué hacer con esto en la práctica

Si usted evalúa este modelo para un uso real, la consecuencia es concreta: no puede auditar el sistema, solo su comportamiento. No hay pesos que inspeccionar ni datos de entrenamiento que revisar, así que la única evidencia disponible es empírica — probarlo con sus propios casos, los suyos, no los del folleto.

Y ahí el propio informe da una pista útil sobre cómo leer sus resultados. Que apruebe un examen de abogacía en el 10% superior es un dato real y verificable en el documento; lo que no dice, y no puede decir, es cómo se comportará con los escritos de su despacho. Un examen mide lo que un examen mide. La distancia entre «rinde como un humano en esta prueba» y «me sirve para esto» hay que recorrerla uno mismo, y no la recorre nadie por usted.

Por dónde seguir, sin intermediarios

El informe completo es público y gratuito. Merece la pena ir directamente a dos partes: la sección de alcance, de media página, donde está la frase citada arriba; y la de limitaciones, donde los propios autores enumeran lo que el modelo sigue haciendo mal. Es la sección que ningún resumen recoge y la más útil de todas.

La capacidad que se lleva de aquí es leer primero qué declara no contar un fabricante — porque ese hueco es exactamente el espacio donde crecen las cifras que no tienen origen.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar