IA 360
OpenAI Codex

GPT-4.5: el mayor modelo de OpenAI escala el preentrenamiento

OpenAI lanza GPT-4.5, su modelo más grande y experto hasta la fecha. Promete menos alucinaciones, pero sus pruebas muestran fortalezas distintas de las de los modelos de razonamiento.

Admin IA360 7 min de lectura Generado con IA Read in English
GPT-4.5: el mayor modelo de OpenAI escala el preentrenamiento

OpenAI anunció el jueves 27 de febrero de 2025 GPT-4.5, una vista previa de investigación que describió como su modelo más grande, mejor para chat y más experto hasta la fecha. La compañía lo presenta como un avance al escalar preentrenamiento y postentrenamiento, no como un modelo de razonamiento. El anuncio no usa el nombre «Orion» ni dice que el modelo quede fuera de la frontera; ninguna de esas dos etiquetas es una caracterización oficial del lanzamiento.

Qué es GPT-4.5 y quién puede usarlo

GPT-4.5 llegó primero a los suscriptores de ChatGPT Pro dentro de una research preview, y los desarrolladores de todos los niveles de pago de la API obtuvieron acceso el mismo día. El calendario publicado por OpenAI situaba Plus y Team en la semana siguiente, y Enterprise y Edu una semana después. Ese era el alcance temporal declarado, no una disponibilidad simultánea para todos los planes.

La compañía insiste en un punto importante: GPT-4.5 no es un reemplazo directo de GPT-4o, el modelo de uso general que mueve la mayor parte de su API y de ChatGPT. Admite subida de archivos e imágenes y funciona con la herramienta canvas de ChatGPT, pero de momento carece de capacidades que GPT-4o sí tiene, como el modo de voz bidireccional realista.

Una vista previa con límites explícitos

La ficha de sistema de GPT-4.5 lo define como vista previa de investigación para estudiar fortalezas y limitaciones. Su evaluación de preparación asigna riesgo medio a CBRN y persuasión, y bajo a ciberseguridad y autonomía del modelo; son categorías internas del marco de OpenAI, no una certificación externa. La compañía afirma que sus evaluaciones previas al despliegue no hallaron un aumento significativo del riesgo respecto de modelos existentes, una conclusión acotada a su propio proceso y pruebas.

El marco fija además una regla de decisión: solo se despliegan modelos con riesgo posterior a mitigaciones medio o inferior, y solo se sigue desarrollando un modelo con riesgo alto o inferior. Es un umbral interno de gobierno, no una probabilidad de daño. «Bajo» en autonomía tampoco significa riesgo cero ni garantiza el comportamiento de cada respuesta.

El límite central está en el propio diseño: GPT-4.5 amplía aprendizaje no supervisado y no genera una cadena de razonamiento antes de responder como o1 u o3-mini. Eso le da un perfil diferente, no una incapacidad general para resolver problemas ni una prueba de que «no convence».

En el postentrenamiento, OpenAI dice que combinó ajuste supervisado y aprendizaje por refuerzo con retroalimentación humana con técnicas escalables nuevas que usan datos derivados de modelos más pequeños. Les atribuye mejoras en control, matiz y conversación natural. La fuente no publica la receta completa ni el conjunto de entrenamiento: «entiende mejor la intención» sigue siendo una conclusión de las evaluaciones y del fabricante, no una observación directa de la cognición del sistema.

En qué es mejor y en qué se queda corto

GPT-4.5 se construyó escalando cómputo y datos durante el preentrenamiento, junto con innovaciones de arquitectura, optimización y nuevas técnicas de supervisión. El informe técnico lo sitúa en la línea de aprendizaje no supervisado de GPT-3.5 y GPT-4, mientras que la serie o escala razonamiento mediante aprendizaje por refuerzo. Son dos ejes que OpenAI considera complementarios.

Esta vez el patrón se rompe. OpenAI afirma que el mayor tamaño le ha dado a GPT-4.5 "un conocimiento del mundo más profundo" y "una mayor inteligencia emocional". El modelo responde con un tono más cálido y natural, se defiende bien en tareas creativas como la escritura y, según la empresa, entiende mejor la intención humana.

Una fortaleza medida por OpenAI es la fiabilidad factual. En SimpleQA, un conjunto de preguntas breves con respuestas consideradas incontrovertibles, la compañía informa de mayor precisión y menor tasa de alucinación para GPT-4.5 que para GPT-4o, o1 y o3-mini. Es un resultado sobre ese conjunto y con la metodología del fabricante; no mide la veracidad de cualquier respuesta ni justifica compararlo aquí con sistemas ajenos no incluidos en la fuente primaria.

En programación, los resultados internos son desiguales. El apéndice del anuncio sitúa GPT-4.5 en 38,0% en SWE-bench Verified, frente a 30,7% para GPT-4o y 61,0% para o3-mini alto. En SWE-Lancer Diamond informa de 32,6%, frente a 23,3% y 10,8%, respectivamente. OpenAI etiqueta esas cifras como el mejor rendimiento interno; por tanto, comparan configuraciones elegidas por el fabricante y no bastan para ordenar todos los modelos en cualquier tarea de software.

En las pruebas académicas que OpenAI sí publica, GPT-4.5 obtiene 71,4% en GPQA y 36,7% en AIME 2024, mientras o3-mini alto alcanza 79,7% y 87,3%. En MMMLU multilingüe ocurre lo contrario: 85,1% para GPT-4.5 y 81,1% para o3-mini alto. La capacidad depende de la tarea; «modelo más grande» no significa primero en todas las métricas y «sin razonamiento» no significa incapaz de razonar en el sentido cotidiano.

La empresa apela a lo que las métricas no capturan. En una prueba informal, pidió a GPT-4.5, GPT-4o y o3-mini que dibujaran un unicornio en SVG, un formato de gráficos basado en fórmulas matemáticas y código. GPT-4.5 fue el único que produjo algo parecido a un unicornio. En otra, ante la frase "lo estoy pasando mal tras suspender un examen", los tres dieron información útil, pero la respuesta de GPT-4.5 fue la más adecuada socialmente.

El coste: una limitación reconocida

OpenAI describe GPT-4.5 como un modelo muy grande, intensivo en cómputo, más caro que GPT-4o y no destinado a reemplazarlo. La compañía dijo que evaluaría si mantenerlo en la API a largo plazo mientras equilibraba este servicio con la construcción de modelos futuros. El anuncio enlazado no contiene una tabla histórica que sostenga los múltiplos de 15 y 30 veces: solo permite afirmar la relación cualitativa «más caro» y la incertidumbre sobre su continuidad.

Qué demuestra —y qué no— el preentrenamiento

OpenAI afirma que GPT-4.5 está "en la frontera de lo posible en el aprendizaje no supervisado" y que cada nuevo orden de magnitud de cómputo trae capacidades nuevas. El lanzamiento no demuestra que la curva de escalado se esté aplanando ni que el preentrenamiento haya tocado techo: en sus pruebas, el modelo mejora algunas tareas y queda por detrás de o3-mini alto en otras.

La distinción técnica es más útil que el veredicto. El preentrenamiento busca ampliar conocimiento del mundo, reconocimiento de patrones e intuición; la serie o añade cómputo de razonamiento antes de contestar para tareas STEM o lógicas. OpenAI presenta ambos ejes como complementarios y dice que una base con más conocimiento puede alimentar agentes que razonan y usan herramientas. Eso es una hipótesis de producto del fabricante, no una ley ya demostrada sobre todos los modelos.

Un peldaño, no una cima

El anuncio no publica el coste de entrenamiento, retrasos ni expectativas internas de GPT-4.5. Sí documenta una vista previa mundial para desarrolladores de todos los niveles de pago mediante Chat Completions, Assistants y Batch, con llamadas a funciones, salidas estructuradas, streaming, mensajes de sistema y entrada de imagen. En ChatGPT admitía búsqueda, archivos, imágenes y canvas, pero no Voz, vídeo ni compartir pantalla.

El mismo nombre de modelo no implicaba la misma superficie: la API admitía imágenes como entrada, mientras ChatGPT restringía otras modalidades audiovisuales. Toda afirmación de capacidad debe nombrar el producto, la interfaz y la fecha, no solo el modelo.

Para evaluar el lanzamiento conviene separar cuatro preguntas: qué mide cada benchmark, qué modalidad admite el producto, quién tenía acceso en esa fecha y qué coste publica la fuente. «Modelo más grande» responde solo a la escala declarada; no prueba superioridad universal, razonamiento deliberado, disponibilidad completa ni rentabilidad.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar