IA 360
Actualidad

OpenAI lanza o1, modelos que razonan antes de responder

OpenAI presenta o1-preview y o1-mini, dos modelos diseñados para dedicar más tiempo al razonamiento interno. La compañía apunta a matemáticas, ciencia y programación, aunque el estreno llega con límites de uso y funciones ausentes.

5 min de lectura Generado con IA Read in English
OpenAI lanza o1, modelos que razonan antes de responder

El 12 de septiembre de 2024, OpenAI lanzó o1-preview y o1-mini, modelos diseñados para dedicar más cómputo a problemas de varios pasos antes de responder. El anuncio original publica resultados en matemáticas, programación y ciencia, además de límites de producto; esas pruebas describen tareas concretas y no una capacidad general de razonar sin errores.

La compañía había anticipado esta línea de investigación bajo el nombre en clave Strawberry. Su primer resultado comercial no sustituye a GPT-4o: está pensado para tareas en las que una respuesta rápida vale menos que una solución bien planteada, como un problema matemático complejo, una consulta científica o la depuración de código.

Pensar más tiempo antes de contestar

Los modelos de lenguaje convencionales producen texto prediciendo, palabra a palabra, cuál debería ser la continuación más probable. o1 añade una fase de razonamiento interno más extensa. Durante el entrenamiento, OpenAI ha usado aprendizaje por refuerzo, una técnica que recompensa las estrategias que llevan a una respuesta correcta y penaliza los errores.

El resultado es que el modelo puede probar distintos caminos, detectar que uno no funciona y corregirlo antes de ofrecer la contestación final. No equivale a que comprenda un problema como una persona ni convierte cada respuesta en correcta. Sí cambia la manera de abordar encargos que requieren encadenar varios pasos lógicos.

OpenAI no muestra la cadena de pensamiento completa al usuario. En su lugar, la interfaz puede enseñar una breve indicación del proceso mientras el modelo trabaja y después entrega la respuesta. Es una precaución relevante: el razonamiento interno no debe confundirse con una demostración verificable. En matemáticas, investigación o trabajo profesional, la respuesta sigue necesitando revisión humana y contraste con fuentes o cálculos independientes.

Mejores resultados en pruebas de matemáticas y código

La compañía ha acompañado el lanzamiento con resultados que retratan bien el objetivo de o1. En un examen clasificatorio para la Olimpiada Internacional de Matemáticas, GPT-4o resolvió correctamente el 13% de las preguntas, mientras que o1 alcanzó el 83%, según OpenAI. En competiciones de programación de Codeforces, el modelo se situó en el percentil 89.

Estas pruebas no miden toda la inteligencia ni garantizan el mismo rendimiento en un trabajo real. Pero señalan una debilidad conocida de los asistentes generativos: pueden explicar con soltura una solución errónea cuando el problema exige mantener la lógica durante muchos pasos. El avance de o1 está precisamente en reducir ese fallo en dominios estructurados.

o1-preview es la versión generalista y más capaz de la nueva serie. Está disponible desde hoy para los suscriptores de ChatGPT Plus y Team, con un límite inicial de 30 mensajes semanales. También llega a la API para desarrolladores que cumplan los requisitos de acceso de OpenAI.

La segunda versión, o1-mini, se concentra en programación y materias STEM, siglas en inglés para ciencia, tecnología, ingeniería y matemáticas. OpenAI la ofrece como una alternativa más rápida y un 80% más barata que o1-preview: cuesta 3 dólares por millón de tokens de entrada y 12 dólares por millón de tokens de salida, frente a 15 y 60 dólares, respectivamente, de o1-preview. Un token es una unidad de texto que utilizan los modelos para procesar y generar lenguaje.

Más capacidad, pero menos funciones que GPT-4o

El estreno tiene límites claros. En ChatGPT, o1-preview y o1-mini todavía no incorporan herramientas ya habituales en GPT-4o, como la navegación web, la subida de archivos o el análisis de imágenes. También son más lentos: esa pausa no es un defecto accidental, sino el coste de dedicar más recursos al razonamiento.

Esto obliga a elegir modelo según la tarea. Para redactar, resumir un documento o mantener una conversación ágil, GPT-4o seguirá siendo en muchos casos la opción más práctica. Para resolver un ejercicio técnico difícil, revisar una estrategia de programación o explorar una hipótesis científica, o1 puede justificar la espera y el mayor precio.

OpenAI ha evaluado además esta familia con su marco de preparación para riesgos avanzados. La compañía clasifica a o1-preview con riesgo medio en capacidades relacionadas con amenazas químicas, biológicas, radiológicas y nucleares, y aplica salvaguardas específicas a esas consultas. Es una señal de que el razonamiento más competente no solo mejora las respuestas útiles: también obliga a elevar la evaluación de seguridad antes de ampliar el acceso.

La primera versión de o1 es, por tanto, menos un asistente universal que una apuesta por modelos que sepan detenerse a resolver. Su evolución dependerá de si OpenAI logra extender ese razonamiento a más herramientas y tareas sin convertir cada consulta cotidiana en una espera costosa.

Más tiempo de inferencia cambia la economía

Un modelo que explora varios caminos puede mejorar en problemas estructurados, pero consume latencia y recursos de forma distinta. La comparación debe medir coste por respuesta aceptada, no solo precio por token: incluye intentos fallidos, duración, revisión y herramientas externas. Para una consulta rutinaria, la espera puede no comprar valor; para una demostración matemática, sí.

La selección empieza clasificando la tarea. Redacción, extracción y conversación suelen premiar rapidez; planificación, código con pruebas y cálculo verificable pueden beneficiarse de búsqueda interna adicional. Enviar todo al modelo más reflexivo desperdicia presupuesto y vuelve impredecible una interfaz.

Razonamiento privado no sustituye una demostración

La respuesta final debe contener los pasos que un tercero necesita comprobar: ecuaciones, supuestos, pruebas ejecutadas o fuentes. Que el sistema haya empleado una cadena interna larga no permite auditarla ni garantiza que el camino fuese válido. Se evalúa el artefacto visible y se reproduce con una herramienta independiente.

En programación, eso significa compilar, ejecutar pruebas y revisar el cambio, no valorar la explicación. En ciencia, se verifican unidades, referencias y condiciones de frontera. En planificación, se simulan restricciones y se conserva una salida segura cuando falta información.

Cómo leer un salto de benchmark

Se identifica el conjunto, el criterio de puntuación, las oportunidades de muestreo y la posible contaminación. Un resultado alto en una olimpiada o competición demuestra progreso en ese protocolo; no informa por sí solo sobre documentos empresariales, idiomas o hechos recientes. La réplica local mezcla ejercicios resueltos y casos nuevos con un evaluador ciego.

Los fallos merecen más peso que el promedio cuando una respuesta puede ejecutar código o apoyar una decisión delicada. Se registra la distribución: cuántos casos son correctos, cuántos reconocen incertidumbre y cuántos producen una solución convincente pero falsa. Una mejora media puede ser inaceptable si aumenta el último grupo.

La ruta de producción añade un límite de tiempo y presupuesto. Si el modelo no concluye dentro de ellos, el sistema entrega un estado explícito, no una respuesta parcial presentada como final. También conserva una alternativa: otro modelo, una herramienta determinista o revisión humana. Pensar más no debe bloquear indefinidamente el proceso.

La mejora se vigila con casos longitudinales. Repetir la misma batería después de cada versión muestra si el avance en problemas difíciles conserva tareas simples, formato y seguridad. Un nuevo máximo en el examen no compensa una regresión silenciosa en encargos cotidianos.

La calibración importa tanto como el acierto

Además de corregir respuestas, se pide al sistema que identifique supuestos y señale qué parte necesita una herramienta. Después se compara esa señal con el fallo real. Un modelo que reconoce bien sus límites puede integrarse con revisores; uno que mantiene confianza cuando se equivoca exige barreras más rígidas, aunque su promedio sea superior.

La capacidad transferible es enrutar cada tarea según verificabilidad, coste del error y beneficio de pensar más tiempo, y exigir una prueba externa a la respuesta. Ese marco permite aprovechar modelos de razonamiento sin antropomorfizarlos ni confundir cómputo adicional con certeza.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar