IA 360
Actualidad

Grok 4 y Heavy: cómo leer un benchmark sin confundirlo con fiabilidad

xAI presenta Grok 4 con búsqueda y herramientas, y reserva Grok 4 Heavy para un nuevo nivel de suscripción. Sus cifras sirven si se separan modelo, herramientas, cómputo y protocolo.

4 min de lectura Generado con IA Read in English
Grok 4 y Heavy: cómo leer un benchmark sin confundirlo con fiabilidad

El 9 de julio de 2025, xAI presentó Grok 4 y Grok 4 Heavy. El modelo principal incorpora uso nativo de herramientas, búsqueda web y búsqueda en X; la variante Heavy dedica más cómputo en el momento de responder para considerar varias hipótesis en paralelo. Grok 4 llegó a suscriptores SuperGrok y Premium+ y a la API, mientras Heavy quedó asociado a un nuevo nivel SuperGrok Heavy.

El anuncio está construido alrededor de puntuaciones llamativas, pero una cifra de razonamiento no es una etiqueta general de inteligencia ni una garantía de fiabilidad. Para interpretarla hay que separar cuatro piezas: qué conjunto se evaluó, qué herramientas recibió el sistema, cuánto cómputo empleó y quién verificó el resultado. Esa lectura permite comparar lanzamientos futuros aunque cambien los nombres y los líderes de la tabla.

Modelo, herramientas y cómputo no son lo mismo

xAI atribuye el avance a entrenamiento por refuerzo a gran escala sobre su clúster Colossus de 200.000 GPU. La compañía dice que amplió los datos verificables más allá de matemáticas y programación y utilizó más de un orden de magnitud de cómputo respecto a su anterior entrenamiento de razonamiento. Son datos del fabricante sobre el proceso, no una receta reproducible: el anuncio no publica arquitectura, corpus, presupuesto exacto ni una descripción suficiente para repetir el entrenamiento.

Grok 4 fue entrenado para decidir cuándo usar un intérprete de código, navegar por la web o buscar contenido en X. Esto cambia la unidad evaluada. Una respuesta puede depender del modelo que planifica, del buscador que recupera información, de las páginas disponibles y del código ejecutado. Un resultado «con herramientas» mide ese sistema completo. No debe compararse directamente con otro obtenido sin navegación o sin Python.

Heavy añade «parallel test-time compute», expresión que xAI describe como capacidad para considerar varias hipótesis a la vez. La página muestra varias instancias trabajando, pero no documenta un protocolo en el que agentes independientes debatan, comparen todos sus resultados y seleccionen mediante una regla publicada. La formulación prudente es que usa más cómputo paralelo durante la inferencia. Más intentos pueden aumentar la probabilidad de hallar una solución; también elevan tiempo y coste y no garantizan verdad cuando todos parten del mismo supuesto erróneo.

Qué mide Humanity's Last Exam

Humanity's Last Exam, o HLE, fue creado como un conjunto de preguntas cerradas y verificables en matemáticas, ciencias, humanidades y otras áreas de conocimiento experto. Su versión inicial reunió 3.000 preguntas de respuesta corta y elección múltiple, algunas multimodales. Los autores buscaban una prueba difícil de resolver mediante recuperación rápida de Internet y adecuada para calificación automática.

xAI afirma que Grok 4 Heavy alcanzó 50,7% en el subconjunto solo de texto de HLE con herramientas. El denominador contiene varias decisiones: se excluyen las preguntas multimodales, se permite Python e Internet y se evalúa el primer resultado mediante pass@1. La cifra no describe al modelo desnudo ni a la colección completa. Tampoco dice cuánto tardó o cuántos recursos consumió Heavy por pregunta.

El valor de HLE es acotar conocimiento experto verificable bajo un protocolo. Sus autores no lo diseñaron para medir toda la experiencia de un asistente: una buena nota no demuestra obediencia a instrucciones, calibración, privacidad, resistencia a manipulación o consistencia en una conversación larga. Saber resolver preguntas con respuesta conocida tampoco equivale a investigar de forma autónoma, formular el problema correcto o reconocer cuándo falta evidencia.

La comparación correcta exige conservar la misma versión del conjunto y las mismas condiciones. «Sin herramientas», «con herramientas», conjunto completo y subconjunto textual son pistas diferentes. Si dos laboratorios publican números sin idéntico acceso a búsqueda, límite de tiempo y presupuesto de inferencia, la diferencia puede reflejar tanto el andamiaje como el modelo. Antes de repetir un ranking conviene escribir una frase completa: sistema, conjunto, variante, herramientas y métrica.

Qué añade —y qué no— ARC-AGI-2

xAI también publica un 15,9% para Grok 4 en ARC-AGI-2. El documento técnico de ARC-AGI-2 explica que cada tarea presenta unas pocas parejas de cuadrículas de entrada y salida. El sistema debe inferir una regla no escrita y aplicarla a una cuadrícula nueva. No requiere conocimiento histórico ni vocabulario especializado; intenta medir composición de reglas, aplicación según contexto y definición de símbolos dentro del propio problema.

La prueba fue diseñada para resistir memorización y búsqueda exhaustiva. Sus autores validaron cada tarea con personas y encontraron que, en promedio, quienes intentaban una tarea resolvían el 66%; todas fueron resueltas por al menos dos personas en dos intentos o menos. En mayo de 2025, los modelos de referencia publicados estaban por debajo del 5%, franja que los autores consideraban demasiado cercana al ruido para interpretar una señal consistente.

Un 15,9% sería por tanto un salto relevante bajo un protocolo comparable, pero el anuncio de xAI es la fuente de esa ejecución. La página no enlaza un informe independiente que detalle configuración, número de intentos, coste o archivos de salida. ARC-AGI distingue además conjuntos públicos, semiprivados y privados. Sin saber exactamente qué conjunto y política se usaron, la cifra debe atribuirse a xAI, no presentarse como una propiedad certificada universalmente.

HLE y ARC-AGI-2 tampoco miden lo mismo. El primero exige amplitud de conocimiento experto en preguntas cerradas; el segundo reduce el conocimiento previo y exige deducir transformaciones visuales nuevas. Que un sistema destaque en ambos aporta señales complementarias. No permite calcular una media llamada «inteligencia» ni anticipar automáticamente cómo redactará un contrato, atenderá a un cliente o comprobará una noticia.

Lo que faltaba en el material de lanzamiento

El anuncio expone entrenamiento, herramientas, demostraciones y resultados, pero el 9 de julio no adjuntaba una tarjeta de modelo o informe de seguridad con evaluaciones de sesgo, usos indebidos, jailbreaks, alucinaciones y mitigaciones. Tampoco publicaba tasas de error por dominio ni intervalos de confianza para todas las comparaciones. Esa ausencia no demuestra que no hubiera pruebas internas; significa que el lector no podía auditarlas desde el material presentado.

La página introduce SuperGrok Heavy, pero no registra el precio mensual de ese nivel. Por eso una cifra comercial no debe convertirse en el eje del titular sin una fuente primaria localizable. Incluso con precio publicado, «el plan más caro» requeriría definir competidores, región, impuestos, modalidad mensual o anual y prestaciones incluidas. Una comparación de escaparate sin ese denominador envejece peor que la explicación técnica.

El acceso mediante API también necesita detalles que una frase de lanzamiento no resuelve: límites de uso, retención de datos, disponibilidad regional, latencia, precio por token, controles administrativos y estabilidad de la versión. La página menciona una ventana de contexto de 256.000 tokens y comprensión de texto e imagen, pero una ventana grande no garantiza que todos los datos reciban la misma atención ni que una respuesta larga permanezca fiel a cada instrucción.

Un protocolo de compra más útil que el ranking

Una organización puede empezar con diez o veinte tareas representativas y verificables: preguntas con documentos internos, búsquedas recientes, cálculos, código y casos donde la respuesta correcta sea «no hay evidencia suficiente». Debe ejecutar Grok 4 y, si está disponible, Heavy con el mismo prompt, herramientas y límite temporal. Además del acierto, conviene registrar citas correctas, errores convincentes, latencia, consumo y variación entre repeticiones.

Para medir el valor de Heavy hay que comparar el incremento de éxito con el incremento de recursos. Si resuelve dos casos más pero multiplica el tiempo o el coste, puede merecer la pena en investigación de alto valor y no en atención cotidiana. Si varias hipótesis convergen en una respuesta falsa, la paralelización no aporta independencia. Las pruebas deben incluir fuentes contradictorias, ambigüedad y datos ausentes, no solo problemas con solución limpia.

También hace falta un carril de seguridad separado del de capacidad: ataques al prompt, datos sensibles, contenido dañino, sobreconfianza y posibilidad de intervención humana. Un benchmark académico excelente no compensa un fallo operativo grave, del mismo modo que una política robusta no convierte un modelo débil en útil. Son requisitos simultáneos, no puntos intercambiables de una nota total.

Grok 4 mostró el 9 de julio una apuesta clara por herramientas y cómputo de inferencia. La enseñanza duradera no es memorizar quién encabezó una tabla, sino reconstruir la prueba detrás del porcentaje. Cuando se nombran conjunto, variante, herramientas, métrica, presupuesto y verificador, el benchmark se convierte en evidencia. Cuando faltan, queda una cifra de marketing imposible de trasladar con rigor a una decisión real.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar