IA 360
Modelos de lenguaje

DeepSeek abre Coder V2, un rival chino para GPT-4 Turbo en código

DeepSeek publicó el 17 de junio de 2024 Coder V2, una familia de modelos de código con 236.000 millones de parámetros totales y 21.000 millones activos. Su comparación con GPT-4 Turbo exige leer tarea, métrica, arquitectura y licencia por separado.

5 min de lectura Generado con IA Read in English
DeepSeek abre Coder V2, un rival chino para GPT-4 Turbo en código

DeepSeek publicó el 17 de junio de 2024 DeepSeek-Coder-V2, una familia de modelos para generar, completar, comprender y reparar código. Su versión mayor almacena 236.000 millones de parámetros, pero activa 21.000 millones por cada token. El laboratorio afirmó que competía con GPT-4 Turbo en tareas específicas de programación y permitió descargar los pesos. Las tres frases son ciertas, pero cada una mide algo distinto: arquitectura, evaluación y derechos.

Ese desglose evita dos conclusiones precipitadas. Activar 21.000 millones de parámetros no convierte el modelo en un archivo de 21.000 millones: los expertos inactivos siguen almacenados y pueden ser elegidos para el siguiente token. Y superar a un sistema cerrado en algunas pruebas no establece que sea mejor en todo proyecto, lenguaje o condición de despliegue. El criterio duradero es preguntar siempre qué cifra describe qué parte del sistema.

Dos tamaños para necesidades muy distintas

El repositorio oficial de DeepSeek-Coder-V2 publicó cuatro variantes: modelos base e instructivos con 16.000 millones de parámetros totales y 2.400 millones activos, y equivalentes con 236.000 millones totales y 21.000 millones activos. Los modelos base continúan código; los instructivos han sido ajustados para seguir peticiones y conversar. Elegir el apellido correcto importa tanto como elegir el tamaño.

La familia usa una mezcla de expertos, o MoE. En un modelo denso, todas las capas y parámetros relevantes participan en cada token. En un MoE, un enrutador selecciona algunos bloques especializados para cada posición. El conjunto total puede albergar patrones diversos sin ejecutar cada experto todo el tiempo. De ahí que 21.000 millones activos describan aproximadamente el trabajo neuronal por token, no el volumen completo del modelo.

La diferencia afecta a dos presupuestos. Los parámetros activos influyen en el cómputo de inferencia; los totales influyen en almacenamiento, memoria y movimiento de datos. El propio repositorio advierte que la versión de 236.000 millones en BF16 necesita ocho GPU de 80 GB para inferencia. Por tanto, «solo 21B activos» no significa que quepa en una tarjeta doméstica. La variante Lite es la candidata razonable para una prueba modesta, y aun así exige medir memoria, velocidad y longitud de contexto.

Además, un MoE introduce costes que una cifra única oculta: el enrutamiento, la comunicación entre dispositivos y el equilibrio de carga. Si los expertos están repartidos entre GPU, mover activaciones puede limitar el rendimiento. Comparar modelos solo por parámetros activos sería tan incompleto como comparar vehículos solo por cilindrada sin mirar peso, transmisión y consumo real.

De 86 a 338 lenguajes y de 16K a 128K

La tarjeta oficial del modelo instructivo explica que Coder V2 parte de un punto intermedio de DeepSeek-V2 y recibió preentrenamiento adicional con seis billones de tokens. Amplió los lenguajes de programación declarados de 86 a 338 y la ventana de contexto de 16.000 a 128.000 tokens. Estas cifras describen cobertura y capacidad de entrada, no competencia uniforme.

El informe técnico depositado en arXiv detalla la mezcla del corpus adicional: 60% código fuente, 10% matemáticas y 30% lenguaje natural. También dice que la parte de código incluía material procedente de GitHub y Common Crawl. No publica un inventario completo de repositorios y licencias; por eso un adoptante no puede inferir solo de ese porcentaje qué fragmentos concretos aprendió el modelo ni resolver con él la procedencia de una salida.

«Soporta 338 lenguajes» significa que el proceso y la evaluación contemplan esa amplitud, no que Fortran, Rust y un lenguaje minoritario reciban la misma cantidad de datos o la misma calidad. Una auditoría útil selecciona los lenguajes, versiones y marcos que usa la organización y construye casos propios. El total de la lista es un punto de partida, no un certificado para cada elemento.

La ventana de 128.000 tokens también necesita traducción. Permite enviar más archivos, documentación y pruebas en una solicitud, pero no demuestra que el modelo localice y aplique cada dependencia. El trabajo publicó una prueba de «aguja en un pajar» hasta 128K: recuperar un dato oculto verifica acceso a contexto largo. Modificar un repositorio exige además relacionar interfaces, estados, versiones y consecuencias. Recuperación y comprensión de arquitectura son capacidades distintas.

En qué sentido rivalizaba con GPT-4 Turbo

DeepSeek resumió Coder V2 como comparable a GPT-4 Turbo en tareas específicas de código. El informe evaluó generación, completado, reparación, razonamiento sobre programas y matemáticas mediante baterías distintas. Entre ellas aparecen HumanEval, MBPP, LiveCodeBench, RepoBench, Defects4J, SWE-Bench, Aider y CruxEval. Un modelo puede encabezar una tabla y quedar detrás en otra porque cambia la tarea.

HumanEval y MBPP preguntan si funciones cortas superan pruebas; RepoBench evalúa completado con contexto de repositorio; SWE-Bench intenta resolver incidencias reales en proyectos; Aider mide edición de código bajo su propio protocolo. Ninguna métrica absorbe a las demás. Decir «rival» es razonable como resumen de una frontera competitiva, pero «mejor programador» sería una afirmación mucho más amplia que los experimentos.

También hay que registrar quién ejecutó la comparación. Los resultados fueron publicados por el propio creador, y los modelos cerrados se identifican por versiones concretas disponibles entonces. Cambiar el prompt, el muestreo, las herramientas o la fecha de una API puede cambiar la tabla. Una comparación reproducible necesita versión, conjunto, métrica, número de intentos y configuración; el nombre comercial aislado no basta.

El resultado más honesto del propio artículo no es una victoria uniforme. Coder V2 superaba a alternativas cerradas en algunas pruebas, se acercaba en otras y conservaba brechas en razonamiento de código. Esa variación enseña más que un podio: escoger un asistente requiere ponderar el tipo de trabajo que realmente ocupa al equipo.

Qué estaba abierto y bajo qué condiciones

DeepSeek publicó pesos y código para ejecutar los modelos. El código del repositorio usa licencia MIT, mientras los pesos se rigen por un contrato diferente. El texto íntegro de la licencia del modelo concede derechos amplios de reproducción, modificación, distribución y servicio remoto, y el repositorio declara que admite uso comercial.

Pero no es una licencia de software permisiva sin condiciones de campo de uso. Obliga a transmitir restricciones a usuarios posteriores y prohíbe, entre otros supuestos, uso militar, ciertas decisiones automatizadas que perjudiquen derechos, discriminación y generación maliciosa de información falsa o datos identificables. También aclara que los datos de entrenamiento no quedan licenciados. Por eso «pesos abiertos», «código abierto» y «licencia sin restricciones de uso» no son sinónimos.

Para una organización, el examen debe responder al menos cinco preguntas: ¿puede descargar los pesos?, ¿puede modificarlos?, ¿puede redistribuir una derivada?, ¿puede ofrecerla comercialmente?, ¿qué usos y obligaciones sobreviven en su producto? Coder V2 contestaba afirmativamente las primeras cuatro bajo condiciones, pero la quinta seguía exigiendo leer el contrato y aplicar la legislación correspondiente. El nombre que el fabricante da a su apertura no sustituye ese análisis.

Una prueba que mida ahorro y riesgo

El piloto adecuado combina calidad con coste total. Se eligen incidencias ya resueltas, se oculta la solución y se mide si el modelo modifica los archivos correctos, compila, supera pruebas nuevas y existentes, evita dependencias innecesarias y no debilita controles. También se registran latencia, consumo de memoria, tiempo de revisión y tasa de propuestas descartadas. Parámetros activos no equivalen por sí solos a menor coste de propiedad.

El modelo debe trabajar en un entorno limitado: repositorio de prueba, secretos excluidos, red restringida, comandos revisables y cambios sujetos a diff. Descargar los pesos ofrece control sobre dónde viaja el código, pero traslada al operador la seguridad, actualización, observabilidad y capacidad. La privacidad mejora solo si la arquitectura completa conserva realmente los datos dentro del perímetro previsto.

La capacidad transferible es leer cualquier anuncio de un MoE en cuatro capas: parámetros totales para almacenamiento, parámetros activos para cómputo, benchmark para la tarea exacta y licencia para los derechos reales. DeepSeek-Coder-V2 estrechó la distancia con modelos cerrados y abrió una vía comercial de despliegue propio. Su valor no estaba en una etiqueta de «abierto» o «rival», sino en poder comprobar cada capa sin pedir que una sola cifra respondiera por todas.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Artículos relacionados

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña
Modelos de lenguaje

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña

«Cuánta GPU hace falta» es la pregunta equivocada. Cómputo, datos y conocimiento no se suman: son tres puertas en serie, y la que casi nadie pasa no es la del hardware. Con el precio real de hoy, el corpus real de un modelo abierto y el cuaderno de bitácora real de un entrenamiento de 175.000 millones de parámetros, esta pieza hace la cuenta completa — y te dice en qué escalón estás tú.

7 min
Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no
Modelos de lenguaje

Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no

En 2023, un equipo de investigadores le pidió a ChatGPT que repitiera la palabra 'poema' sin parar, y el modelo acabó recitando 'El cuervo' de Poe palabra por palabra. Eso no prueba que los modelos guarden una copia de internet, pero tampoco que nunca memoricen nada: las dos afirmaciones son ciertas según el caso. Las cuatro preguntas que separan una demanda seria de un titular vacío.

7 min

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar