IA 360
Modelos de lenguaje

DeepSeek actualiza su modelo R1 y estrecha el margen con OpenAI y Google

La nueva versión R1-0528 eleva el rendimiento en matemáticas del 70% al 87,5% en el benchmark AIME 2025 y reduce alucinaciones a casi la mitad, acercando el modelo abierto de DeepSeek a o3 y Gemini 2.5 Pro.

3 min de lectura Generado con IA Read in English
DeepSeek actualiza su modelo R1 y estrecha el margen con OpenAI y Google

El 28 de mayo de 2025, DeepSeek publicó la actualización R1-0528 y su tarjeta con resultados declarados. La fuente original sostiene el núcleo documental del hecho; las cifras de benchmark son del desarrollador y no miden automáticamente la tarea ni la tasa de error del lector.

El salto de rendimiento es concreto y medible: en AIME 2025, un benchmark que evalúa la capacidad de resolver problemas matemáticos de nivel de competición, el modelo pasa de un 70% de aciertos a un 87,5%. La nueva versión también recorta las alucinaciones —respuestas que el modelo presenta como ciertas sin serlo— en torno a un 45-50% respecto a la versión anterior. Documento que sostiene la cifra.

Qué significa acercarse a o3 y Gemini 2.5 Pro

La comparación no es cosmética. o3 de OpenAI y Gemini 2.5 Pro de Google son, junto a otros modelos de razonamiento, la referencia actual en tareas que requieren pensar paso a paso antes de responder: matemáticas avanzadas, programación compleja o problemas lógicos de varios pasos. Que un modelo con pesos abiertos —es decir, cuyo archivo de parámetros puede descargarse, ejecutarse localmente y modificarse libremente— se acerque a ese nivel cambia el cálculo de quién puede permitirse construir sobre inteligencia artificial de frontera.

Hasta ahora, acceder a un razonador de ese calibre implicaba pagar por API a una empresa cerrada y aceptar sus condiciones de uso, sus límites de tasa y su opacidad sobre cómo se entrenó el modelo. Con pesos abiertos, cualquier empresa, laboratorio universitario o desarrollador independiente puede descargar R1-0528, ajustarlo a su caso concreto y correrlo en su propia infraestructura, sin depender de un proveedor externo ni enviar datos a servidores de terceros.

La amenaza del open source a los modelos cerrados

Es habitual escuchar en el sector el argumento de que la brecha de capacidad entre modelos cerrados y de pesos abiertos seguiría siendo amplia: estos últimos podían ser útiles, pero no competitivos en la frontera. Los datos de R1-0528 complican ese argumento: si un modelo abierto reduce alucinaciones a la mitad y sube casi 18 puntos porcentuales en un benchmark matemático exigente en una sola actualización, la distancia con los modelos propietarios parece estrecharse con rapidez. Documento que sostiene la cifra.

Esto no elimina el debate: los modelos cerrados siguen ofreciendo garantías de soporte, integración y, en teoría, controles de seguridad que un modelo descargable no lleva incorporados de fábrica. Pero el argumento económico para empresas con presupuestos ajustados —o para quienes buscan evitar dependencia de infraestructura externa— se inclina cada vez más hacia lo abierto.

Qué cambia para quien usa IA hoy

Para un desarrollador o una empresa que ya trabajaba con modelos de razonamiento, la actualización de DeepSeek amplía las opciones reales sin coste de licencia por token. Para el ecosistema en general, refuerza una tendencia que lleva meses consolidándose: el liderazgo en pesos abiertos ya no es terreno exclusivo de modelos de segunda fila, sino que empieza a tocar la primera línea de rendimiento en tareas de razonamiento complejo.

Queda por ver cómo responden OpenAI y Google a esta reducción de distancia, y si mantienen su ventaja centrándose en capacidades que un modelo descargable no puede replicar fácilmente, como la integración profunda con herramientas propias o el ajuste fino con datos propietarios a gran escala.

Cómo convertir el titular en una comprobación

El primer paso es congelar la identidad del sistema. DeepSeek publicó la actualización R1-0528 y su tarjeta con resultados declarados. Un nombre comercial puede cubrir revisiones, rutas automáticas y herramientas distintas. La ficha de prueba debe guardar fecha, modalidad de acceso, configuración, permisos y salida completa. Sin esa fotografía, una mejora o un fallo observado hoy no puede atribuirse con rigor a la versión que otra persona usará mañana.

Después hay que convertir cómo reproducir una comparación con versión, plantilla, presupuesto y conjunto independiente en casos con criterio de aceptación. Se prepara una muestra propia que incluya tareas fáciles, ambiguas, largas y deliberadamente imposibles. Se anota qué entrada recibe el modelo, qué información puede consultar y qué resultado sería suficiente. Una demostración elegida por el proveedor enseña posibilidad; una batería conservada por el usuario mide fiabilidad.

La autonomía requiere una escala de permisos. Leer y proponer no es lo mismo que modificar, enviar o comprar. La configuración segura concede primero acceso de solo lectura, exige una vista previa y reserva la ejecución para una aprobación explícita. También conserva un registro y una vía de deshacer. El modelo se juzga por los errores que el sistema contiene, no por la confianza con la que describe su plan.

Qué debe quedar registrado

Coste y calidad deben medirse juntos. Una respuesta barata que obliga a revisar desde cero puede costar más que otra lenta pero verificable. La medición incluye espera, reintentos, consumo, supervisión humana y consecuencias de un fallo. las cifras de benchmark son del desarrollador y no miden automáticamente la tarea ni la tasa de error del lector. Esa frontera convierte el anuncio en una hipótesis que puede comprobarse en lugar de una promesa que deba creerse.

Una ficha de evidencia separa cuatro columnas: lo que afirma la fuente, lo que muestra, lo que no midió y qué tendría que ocurrir para cambiar la conclusión. Esa disciplina evita que una ausencia se convierta en promesa y que una condición desaparezca al resumir. También permite actualizar la pieza sin reescribir la historia desde el resultado posterior.

Conviene incluir un caso negativo antes de decidir. Se busca una situación donde el sistema, norma, operación o estudio no resuelva la necesidad y se anota la señal que obligaría a parar. Los éxitos seleccionados muestran que algo puede ocurrir; el caso negativo revela el límite y reduce el coste de descubrirlo después del despliegue.

La capacidad que sobrevive al anuncio

La comparación válida conserva denominador y eje. No enfrenta una cifra puntual con un promedio, una capacidad futura con una instalada ni una predicción con una observación. Cuando dos fuentes usan palabras parecidas, se reconstruye qué contaron y durante qué periodo. Si no coinciden, se publican como medidas distintas en vez de fabricar una clasificación.

El registro debe sobrevivir al cambio de versión. Guarda URL, fecha de consulta, documento, configuración y decisión tomada. Al aparecer nueva evidencia, se añade con su fecha y se explica qué modifica. Esa trazabilidad protege contra dos errores opuestos: mantener una conclusión caducada o fingir que un dato posterior ya se conocía el día del hecho.

La capacidad transferible de esta pieza es cómo reproducir una comparación con versión, plantilla, presupuesto y conjunto independiente. El procedimiento es breve: nombrar el documento, conservar la fecha, fijar el eje, buscar la condición y diseñar una comprobación que pueda fallar. Con esos pasos, el lector no necesita aceptar ni rechazar el anuncio por intuición; puede decidir con una cadena visible de evidencia.

Antes de cerrar, otra persona debe poder reconstruir la conclusión sin conocer el titular. Recibe las fuentes, las condiciones y el caso negativo, y explica qué aceptaría y qué no. Si necesita una intención supuesta, una cifra sin denominador o un dato posterior sin fecha, la cadena todavía tiene un hueco. Esa revisión breve detecta errores que la fluidez del texto puede ocultar.

El resultado no es una puntuación eterna, sino una decisión fechada y revisable. Se establece cuándo volver a medir y qué señal obliga a revisar antes. Así la cautela no paraliza: convierte incertidumbre en una condición de seguimiento. También evita premiar al anuncio por una mejora futura que todavía no estaba disponible cuando se tomó la decisión.

Por último se conserva la alternativa. La pregunta no es solo si el anuncio funciona, sino si mejora el proceso frente a seguir como estaba, usar otra herramienta o esperar evidencia. Comparar contra una base concreta impide que la novedad se tome como beneficio. La decisión puede ser avanzar, limitar el alcance o no cambiar todavía, siempre con una razón comprobable.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Artículos relacionados

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña
Modelos de lenguaje

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña

«Cuánta GPU hace falta» es la pregunta equivocada. Cómputo, datos y conocimiento no se suman: son tres puertas en serie, y la que casi nadie pasa no es la del hardware. Con el precio real de hoy, el corpus real de un modelo abierto y el cuaderno de bitácora real de un entrenamiento de 175.000 millones de parámetros, esta pieza hace la cuenta completa — y te dice en qué escalón estás tú.

7 min
Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no
Modelos de lenguaje

Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no

En 2023, un equipo de investigadores le pidió a ChatGPT que repitiera la palabra 'poema' sin parar, y el modelo acabó recitando 'El cuervo' de Poe palabra por palabra. Eso no prueba que los modelos guarden una copia de internet, pero tampoco que nunca memoricen nada: las dos afirmaciones son ciertas según el caso. Las cuatro preguntas que separan una demanda seria de un titular vacío.

7 min

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar