NousCoder-14B: un modelo abierto para programación competitiva afinado con aprendizaje por refuerzo
Nous Research publica NousCoder-14B, un modelo de código basado en Qwen3-14B y entrenado con problemas verificables, bajo licencia Apache 2.0.
Los modelos de código no se diferencian solo por cuántos parámetros tienen. También importa qué tareas han practicado, cómo reciben la señal de que una solución funciona y si otros equipos pueden inspeccionarlos y adaptarlos. El 6 de enero de 2026, Nous Research publicó NousCoder-14B, un modelo orientado a programación competitiva que parte de Qwen3-14B y añade una fase de aprendizaje por refuerzo con problemas verificables.
La publicación es relevante por tres motivos sencillos: el modelo tiene pesos disponibles bajo licencia Apache 2.0, la ficha describe de forma concreta el entrenamiento y el equipo comunica un resultado medible en LiveCodeBench. Eso no convierte automáticamente al modelo en un sustituto de un agente de desarrollo, pero sí ofrece una pieza abierta para evaluar y ajustar.
Aprender con problemas que se pueden comprobar
El punto de partida de NousCoder-14B es Qwen3-14B. Sobre ese modelo base, Nous Research aplicó postentrenamiento mediante aprendizaje por refuerzo. La diferencia frente a pedir simplemente grandes cantidades de código a un modelo es que los ejercicios cuentan con pruebas o verificadores: la salida puede comprobarse y el entrenamiento recibe una señal más clara sobre si resolvió el problema.
Según la ficha del modelo, el equipo usó 24.000 problemas de programación verificables y entrenó durante cuatro días con 48 GPU NVIDIA B200. También enlaza un conjunto público propio, RLVR_Coding_Problems, que contiene enunciados y pruebas. Esa procedencia no elimina todas las dudas sobre datos, contaminación de benchmarks o generalización, pero permite que otros desarrolladores examinen parte del material y reproduzcan aspectos del enfoque.
La licencia Apache 2.0 es la otra parte importante. Permite reutilizar los pesos bajo condiciones relativamente permisivas, incluidos usos comerciales, siempre que se respeten sus avisos y términos. Para equipos que quieren experimentar con modelos de código fuera de una API cerrada, eso abre opciones de evaluación local, ajuste y despliegue propio. No significa, sin embargo, que un modelo de unos 14.000 millones de parámetros sea ligero: la ficha lista pesos BF16 y un tamaño de repositorio cercano a 30 GB, además de las necesidades de memoria de inferencia.
Qué dice el benchmark
Nous Research comunica un resultado Pass@1 del 67,87% en LiveCodeBench v6, frente al 60,79% que atribuye al Qwen3-14B de referencia. La comparación cubre problemas fechados entre el 1 de agosto de 2024 y el 5 de enero de 2025. Pass@1 mide si la primera solución generada supera las pruebas del benchmark, una medida útil cuando el objetivo es resolver un problema sin varios intentos.
La mejora declarada es de 7,08 puntos porcentuales. Es una señal de que el postentrenamiento con ejercicios verificables puede cambiar el comportamiento del modelo en la clase de tareas para la que se diseñó. Pero la cifra procede de la model card del propio equipo y de un benchmark concreto. No debe leerse como una clasificación general de todos los asistentes de programación ni como prueba de que superará a cualquier sistema propietario en desarrollo real.
También importa la naturaleza de la programación competitiva. Sus problemas suelen tener una especificación cerrada y pruebas precisas. Crear y mantener software de producción exige además comprender un repositorio, negociar requisitos ambiguos, revisar seguridad, integrar servicios, escribir pruebas y responder a cambios. Un buen resultado en una prueba de algoritmos es una capacidad valiosa, no una garantía para esas otras etapas.
Una base abierta para medir, no una promesa total
La publicación encaja en una tendencia útil: usar verificadores ejecutables para enseñar a modelos de lenguaje a producir código que no solo parezca razonable, sino que pase una prueba. Al liberar pesos, datos de procedencia y una métrica, Nous Research deja más material para que la comunidad contraste la afirmación.
El siguiente paso debería ser precisamente ese contraste. Equipos independientes podrán medir NousCoder-14B en otros lenguajes, bases de código y condiciones de hardware, y comparar la calidad de sus soluciones, no solo si una primera respuesta resuelve un ejercicio. La aportación más concreta del lanzamiento no es una promesa de automatizar el desarrollo: es un modelo abierto que permite poner esa promesa a prueba.
Fuentes de esta pieza
Esta pieza se apoya en 4 fuente(s) primaria(s), recogidas durante la investigación.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.