OpenAI presenta GPT-4, un modelo que ya entiende imágenes
GPT-4 mejora el razonamiento de ChatGPT, obtiene resultados destacados en exámenes y puede analizar imágenes además de texto. OpenAI lo ofrece desde hoy a los suscriptores de ChatGPT Plus y prepara el acceso por API.
El 14 de marzo de 2023, OpenAI presentó GPT-4, un modelo capaz de recibir texto e imágenes y producir texto. El anuncio y el informe técnico publicaron evaluaciones, condiciones de acceso y limitaciones. “Multimodal” describe tipos de entrada y salida; no demuestra que el sistema entienda cualquier imagen ni que una puntuación académica prediga una tarea profesional.
El lanzamiento importa por dos motivos. Primero, convierte la conversación con una IA en una herramienta más útil para tareas que exigen interpretar documentos, gráficos o fotografías. Segundo, eleva de nuevo el listón de los modelos de lenguaje apenas cuatro meses después de que ChatGPT popularizara esta tecnología.
De un chatbot a un sistema que puede mirar
GPT-4 es un modelo multimodal: puede procesar más de un tipo de información. En su presentación, OpenAI ha mostrado cómo el sistema interpreta una imagen y responde preguntas sobre ella. Por ejemplo, puede explicar el contenido de una fotografía, extraer información de un gráfico o sugerir qué ingredientes faltan a partir de una imagen.
No genera imágenes: su salida sigue siendo texto. La novedad está en que puede combinar lo que ve con una instrucción escrita para elaborar una respuesta.
Esta capacidad no estará abierta de inmediato para todos los usuarios. OpenAI la está probando inicialmente con Be My Eyes, una aplicación que conecta a personas ciegas o con baja visión con voluntarios que les describen su entorno. La integración apunta a uno de los usos más claros de la visión artificial conversacional: describir una escena, leer etiquetas o ayudar a entender el contenido de una imagen sin depender de que otra persona esté disponible.
Mejores notas, con matices importantes
OpenAI ha evaluado GPT-4 con exámenes estandarizados y profesionales. En una simulación del examen de acceso a la abogacía estadounidense, el modelo se situó aproximadamente en el 10% superior de los participantes, frente al 10% inferior de GPT-3.5. También alcanzó percentiles elevados en las pruebas SAT y GRE estadounidenses. Fuente
Estas cifras muestran una mejora real en la capacidad de seguir instrucciones, manejar textos largos y resolver problemas con una estructura conocida. Pero no equivalen a que el sistema tenga comprensión humana general ni a que pueda ejercer una profesión de forma autónoma.
Un examen mide respuestas dentro de un formato limitado, con criterios de corrección relativamente definidos. En el trabajo real hay información incompleta, consecuencias legales y necesidad de verificar fuentes. GPT-4 puede redactar una explicación convincente y, aun así, incluir un dato falso o inventar una referencia.
OpenAI reconoce esa limitación. La compañía asegura que GPT-4 es un 40% más propenso que GPT-3.5 a producir respuestas factuales en sus evaluaciones internas adversariales de veracidad, pero sigue produciendo alucinaciones: afirmaciones incorrectas presentadas con seguridad. Es una mejora relevante, no una garantía de fiabilidad. Fuente
Más contexto para conversaciones y documentos
La versión inicial de GPT-4 puede manejar hasta 8.192 tokens de contexto, una medida que incluye tanto la instrucción como el texto que recibe y genera. OpenAI también ofrece una variante con 32.768 tokens para casos que requieran documentos mucho más extensos. Fuente
En términos prácticos, ese aumento permite analizar contratos, informes, código o conversaciones largas sin dividirlos tanto en fragmentos. Para empresas, abre la puerta a asistentes que trabajen sobre su propia documentación; para usuarios, mejora tareas como resumir materiales de estudio, revisar borradores o preparar preguntas sobre un texto complejo.
La utilidad dependerá, sin embargo, de cómo se protejan los datos introducidos en estos servicios. Un modelo puede procesar documentos internos, pero eso obliga a revisar las condiciones de uso, los controles de acceso y el tratamiento de información confidencial antes de incorporarlo a un flujo de trabajo.
Disponible en ChatGPT Plus y en la nueva carrera de los asistentes
GPT-4 está disponible desde hoy para quienes pagan ChatGPT Plus, la suscripción de 20 dólares mensuales de OpenAI, aunque con límites de uso. La empresa también ha abierto una lista de espera para su API, la vía que permite a desarrolladores integrar el modelo en aplicaciones propias. Fuente
Microsoft ha confirmado además que la versión reciente de su buscador Bing ya utiliza GPT-4. La noticia aclara por qué Bing había mostrado capacidades de conversación y síntesis más avanzadas que las esperables de modelos anteriores, aunque también había dejado episodios de respuestas erráticas durante sus primeras semanas públicas.
OpenAI no ha publicado el número de parámetros de GPT-4 ni detalles de su arquitectura, sus datos de entrenamiento o el coste computacional de desarrollarlo. Los parámetros son valores internos que el modelo ajusta durante el aprendizaje, pero su cantidad por sí sola tampoco determina la calidad: importan tanto los datos, el entrenamiento como los mecanismos posteriores para alinear las respuestas con instrucciones humanas.
La presentación consolida un cambio de fase para los asistentes de IA. Hasta ahora, el gran público había descubierto chatbots capaces de escribir. GPT-4 añade una capa de análisis visual y una capacidad mayor para trabajar con instrucciones complejas. El reto inmediato será comprobar si esa mejora resiste fuera de los exámenes y las demostraciones, allí donde una respuesta plausible no basta y hay que acertar.
Multimodal describe la interfaz
Una entrada de imagen puede contener objetos, texto pequeño, tablas, diagramas o relaciones espaciales. Cada tipo requiere casos propios. Se añaden recortes, baja resolución e información contradictoria, y se exige señalar qué región sostiene la respuesta. Describir una fotografía no demuestra leer una gráfica ni interpretar una radiografía.
En la fecha del anuncio, la capacidad visual no estaba abierta de forma general. Esa condición importa: una demostración seleccionada no permite medir tasa de fallo, variación ni uso real. La ficha debe separar capacidad mostrada, acceso de prueba y disponibilidad comercial.
Un examen es una muestra con condiciones
Percentiles y puntuaciones dependen de versión del examen, instrucciones, selección de respuestas y posible contaminación. Para trasladarlos al trabajo, construye tareas reales con criterio verificable y compara contra el proceso anterior. Un buen resultado académico puede coexistir con errores en documentos locales o herramientas.
El informe técnico reconoce que GPT-4 aún alucina. La mejora relativa en una evaluación del fabricante no autoriza a tratar cada respuesta como cierta. El protocolo pide fuente, permite abstenerse y reserva revisión humana para decisiones sensibles. Fiabilidad es una propiedad de sistema, no solo de modelo.
Contexto no significa memoria perfecta
La ventana indica cuánto texto cabe, no qué proporción se recupera con fidelidad. Distribuye hechos al principio, centro y final, introduce versiones conflictivas y pide citas. El resultado debe medirse con la longitud y configuración exactas; una variante de contexto distinta es otro producto.
También se registran herramientas y datos posteriores al corte. Si una aplicación permite buscar o calcular, no debe atribuirse al modelo base lo que produjo esa herramienta. Separar pesos, instrucciones, recuperación y ejecución evita comparar paquetes completos como si fueran una sola inteligencia.
La capacidad transferible es convertir un anuncio de modelo en una matriz de modalidad, acceso, benchmark, límite y tarea propia. Esa matriz sigue funcionando cuando aparece la siguiente versión y evita que “mejor” sustituya a una pregunta concreta.
La evaluación necesita casos negativos
No basta con preguntas que el modelo puede resolver. Incluye imágenes ilegibles, peticiones imposibles, documentos incompletos y órdenes que chocan con una regla. Puntúa si reconoce el límite, pide contexto o inventa. Una mejora útil puede consistir en abstenerse mejor, aunque produzca menos respuestas.
Publica los denominadores por categoría y revisa una muestra de errores. Un promedio alto puede esconder un fallo concentrado en otro idioma, formato o grupo. La matriz solo se convierte en control cuando conserva esa distribución y no únicamente la cifra principal.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.