DeepSeek actualiza su modelo R1 y estrecha el margen con OpenAI y Google
La nueva versión R1-0528 eleva el rendimiento en matemáticas del 70% al 87,5% en el benchmark AIME 2025 y reduce alucinaciones a casi la mitad, acercando el modelo abierto de DeepSeek a o3 y Gemini 2.5 Pro.
El 28 de mayo de 2025, DeepSeek publicó la actualización R1-0528 y su tarjeta con resultados declarados. La fuente original sostiene el núcleo documental del hecho; las cifras de benchmark son del desarrollador y no miden automáticamente la tarea ni la tasa de error del lector.
El salto de rendimiento es concreto y medible: en AIME 2025, un benchmark que evalúa la capacidad de resolver problemas matemáticos de nivel de competición, el modelo pasa de un 70% de aciertos a un 87,5%. La nueva versión también recorta las alucinaciones —respuestas que el modelo presenta como ciertas sin serlo— en torno a un 45-50% respecto a la versión anterior. Documento que sostiene la cifra.
Qué significa acercarse a o3 y Gemini 2.5 Pro
La comparación no es cosmética. o3 de OpenAI y Gemini 2.5 Pro de Google son, junto a otros modelos de razonamiento, la referencia actual en tareas que requieren pensar paso a paso antes de responder: matemáticas avanzadas, programación compleja o problemas lógicos de varios pasos. Que un modelo con pesos abiertos —es decir, cuyo archivo de parámetros puede descargarse, ejecutarse localmente y modificarse libremente— se acerque a ese nivel cambia el cálculo de quién puede permitirse construir sobre inteligencia artificial de frontera.
Hasta ahora, acceder a un razonador de ese calibre implicaba pagar por API a una empresa cerrada y aceptar sus condiciones de uso, sus límites de tasa y su opacidad sobre cómo se entrenó el modelo. Con pesos abiertos, cualquier empresa, laboratorio universitario o desarrollador independiente puede descargar R1-0528, ajustarlo a su caso concreto y correrlo en su propia infraestructura, sin depender de un proveedor externo ni enviar datos a servidores de terceros.
La amenaza del open source a los modelos cerrados
Es habitual escuchar en el sector el argumento de que la brecha de capacidad entre modelos cerrados y de pesos abiertos seguiría siendo amplia: estos últimos podían ser útiles, pero no competitivos en la frontera. Los datos de R1-0528 complican ese argumento: si un modelo abierto reduce alucinaciones a la mitad y sube casi 18 puntos porcentuales en un benchmark matemático exigente en una sola actualización, la distancia con los modelos propietarios parece estrecharse con rapidez. Documento que sostiene la cifra.
Esto no elimina el debate: los modelos cerrados siguen ofreciendo garantías de soporte, integración y, en teoría, controles de seguridad que un modelo descargable no lleva incorporados de fábrica. Pero el argumento económico para empresas con presupuestos ajustados —o para quienes buscan evitar dependencia de infraestructura externa— se inclina cada vez más hacia lo abierto.
Qué cambia para quien usa IA hoy
Para un desarrollador o una empresa que ya trabajaba con modelos de razonamiento, la actualización de DeepSeek amplía las opciones reales sin coste de licencia por token. Para el ecosistema en general, refuerza una tendencia que lleva meses consolidándose: el liderazgo en pesos abiertos ya no es terreno exclusivo de modelos de segunda fila, sino que empieza a tocar la primera línea de rendimiento en tareas de razonamiento complejo.
Queda por ver cómo responden OpenAI y Google a esta reducción de distancia, y si mantienen su ventaja centrándose en capacidades que un modelo descargable no puede replicar fácilmente, como la integración profunda con herramientas propias o el ajuste fino con datos propietarios a gran escala.
Cómo convertir el titular en una comprobación
El primer paso es congelar la identidad del sistema. DeepSeek publicó la actualización R1-0528 y su tarjeta con resultados declarados. Un nombre comercial puede cubrir revisiones, rutas automáticas y herramientas distintas. La ficha de prueba debe guardar fecha, modalidad de acceso, configuración, permisos y salida completa. Sin esa fotografía, una mejora o un fallo observado hoy no puede atribuirse con rigor a la versión que otra persona usará mañana.
Después hay que convertir cómo reproducir una comparación con versión, plantilla, presupuesto y conjunto independiente en casos con criterio de aceptación. Se prepara una muestra propia que incluya tareas fáciles, ambiguas, largas y deliberadamente imposibles. Se anota qué entrada recibe el modelo, qué información puede consultar y qué resultado sería suficiente. Una demostración elegida por el proveedor enseña posibilidad; una batería conservada por el usuario mide fiabilidad.
La autonomía requiere una escala de permisos. Leer y proponer no es lo mismo que modificar, enviar o comprar. La configuración segura concede primero acceso de solo lectura, exige una vista previa y reserva la ejecución para una aprobación explícita. También conserva un registro y una vía de deshacer. El modelo se juzga por los errores que el sistema contiene, no por la confianza con la que describe su plan.
Qué debe quedar registrado
Coste y calidad deben medirse juntos. Una respuesta barata que obliga a revisar desde cero puede costar más que otra lenta pero verificable. La medición incluye espera, reintentos, consumo, supervisión humana y consecuencias de un fallo. las cifras de benchmark son del desarrollador y no miden automáticamente la tarea ni la tasa de error del lector. Esa frontera convierte el anuncio en una hipótesis que puede comprobarse en lugar de una promesa que deba creerse.
Una ficha de evidencia separa cuatro columnas: lo que afirma la fuente, lo que muestra, lo que no midió y qué tendría que ocurrir para cambiar la conclusión. Esa disciplina evita que una ausencia se convierta en promesa y que una condición desaparezca al resumir. También permite actualizar la pieza sin reescribir la historia desde el resultado posterior.
Conviene incluir un caso negativo antes de decidir. Se busca una situación donde el sistema, norma, operación o estudio no resuelva la necesidad y se anota la señal que obligaría a parar. Los éxitos seleccionados muestran que algo puede ocurrir; el caso negativo revela el límite y reduce el coste de descubrirlo después del despliegue.
La capacidad que sobrevive al anuncio
La comparación válida conserva denominador y eje. No enfrenta una cifra puntual con un promedio, una capacidad futura con una instalada ni una predicción con una observación. Cuando dos fuentes usan palabras parecidas, se reconstruye qué contaron y durante qué periodo. Si no coinciden, se publican como medidas distintas en vez de fabricar una clasificación.
El registro debe sobrevivir al cambio de versión. Guarda URL, fecha de consulta, documento, configuración y decisión tomada. Al aparecer nueva evidencia, se añade con su fecha y se explica qué modifica. Esa trazabilidad protege contra dos errores opuestos: mantener una conclusión caducada o fingir que un dato posterior ya se conocía el día del hecho.
La capacidad transferible de esta pieza es cómo reproducir una comparación con versión, plantilla, presupuesto y conjunto independiente. El procedimiento es breve: nombrar el documento, conservar la fecha, fijar el eje, buscar la condición y diseñar una comprobación que pueda fallar. Con esos pasos, el lector no necesita aceptar ni rechazar el anuncio por intuición; puede decidir con una cadena visible de evidencia.
Antes de cerrar, otra persona debe poder reconstruir la conclusión sin conocer el titular. Recibe las fuentes, las condiciones y el caso negativo, y explica qué aceptaría y qué no. Si necesita una intención supuesta, una cifra sin denominador o un dato posterior sin fecha, la cadena todavía tiene un hueco. Esa revisión breve detecta errores que la fluidez del texto puede ocultar.
El resultado no es una puntuación eterna, sino una decisión fechada y revisable. Se establece cuándo volver a medir y qué señal obliga a revisar antes. Así la cautela no paraliza: convierte incertidumbre en una condición de seguimiento. También evita premiar al anuncio por una mejora futura que todavía no estaba disponible cuando se tomó la decisión.
Por último se conserva la alternativa. La pregunta no es solo si el anuncio funciona, sino si mejora el proceso frente a seguir como estaba, usar otra herramienta o esperar evidencia. Comparar contra una base concreta impide que la novedad se tome como beneficio. La decisión puede ser avanzar, limitar el alcance o no cambiar todavía, siempre con una razón comprobable.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.