IA 360
Modelos de lenguaje

Nemotron 3 Nano muestra qué significa realmente abrir un modelo para agentes

Nvidia publica pesos, ficha, datos y herramientas alrededor de un modelo de mezcla de expertos. «Abierto» no es una propiedad binaria: licencia, procedencia, recetas, evaluaciones y dependencia de hardware deben auditarse por separado.

5 min de lectura Generado con IA Read in English
Nemotron 3 Nano muestra qué significa realmente abrir un modelo para agentes

Nvidia presentó el 15 de diciembre de 2025 Nemotron 3, una familia de modelos orientada a sistemas de agentes, y publicó ese día su primer integrante utilizable: Nemotron 3 Nano. El comunicado de lanzamiento prometía tres tamaños —Nano, Super y Ultra— junto con datos y bibliotecas. Solo Nano estaba disponible; los otros dos pertenecían a la hoja de ruta del primer semestre de 2026.

El episodio permite aprender algo más útil que memorizar parámetros. Un modelo «abierto» puede abrir los pesos y mantener cerrados datos, receta o infraestructura; puede permitir investigación pero restringir usos; puede ser portable en teoría y depender en la práctica de un proveedor. La capacidad duradera es construir una matriz de apertura antes de decidir si un modelo ofrece control real.

Total y activo no son la misma cifra

Nemotron 3 Nano usa una arquitectura híbrida que combina capas Mamba, atención de transformador y mezcla de expertos. En una mezcla de expertos, una red de encaminamiento activa una parte de los componentes para cada token en lugar de movilizar todos los parámetros. El total aproxima la capacidad almacenada; el número activo se acerca más al trabajo neuronal realizado en un paso, aunque no equivale por sí solo a memoria, latencia o coste.

El comunicado describe Nano como un modelo de 30.000 millones de parámetros que activa hasta 3.000 millones. La ficha técnica del modelo detalla 30.000 millones en total y 3.500 millones activos, con seis expertos seleccionados por token y uno compartido. La diferencia muestra que las cifras del nombre y de prensa pueden estar redondeadas. Para dimensionar infraestructura hay que usar la configuración técnica de la versión descargada, no reconstruirla desde «30B-A3B».

La mezcla de expertos reduce cálculo activo, pero los pesos totales siguen necesitando memoria o una estrategia para distribuirse y cuantizarse. También crece la caché necesaria con el contexto y la concurrencia. «Tres mil millones activos» no convierte el modelo en equivalente operativo a uno denso de ese tamaño.

Una ventana larga no es memoria fiable

Nvidia anunció un contexto nativo de un millón de tokens. Esa capacidad indica cuánto material puede aceptar la configuración, no cuánto recuerda con igual precisión. Encontrar un dato situado en medio, relacionar hechos distantes y seguir instrucciones sin contaminación son evaluaciones distintas. La longitud máxima tampoco expresa cuánta memoria de GPU requiere, cuánto tarda el primer token ni cuánto cuesta generar la respuesta.

Para probar contexto largo conviene construir documentos con respuestas verificables en posiciones variadas, distractores parecidos y preguntas que exijan varias evidencias. Se mide recuperación, atribución y resistencia a instrucciones insertadas en el material. Después se compara con una alternativa que recupera solo fragmentos relevantes. Enviar todo puede ser más simple, pero aumenta superficie de ataque, latencia y posibilidad de que evidencia irrelevante desvíe al modelo.

En un sistema de agentes, el historial tampoco debería crecer sin gobierno. Cada agente debe recibir el mínimo contexto necesario, con procedencia y permisos. Un plan, una salida de herramienta y un texto externo no merecen la misma confianza. La ventana es capacidad de transporte; la memoria útil exige selección, estado estructurado y comprobación.

La matriz de apertura

La primera fila es acceso: ¿se pueden descargar pesos y ejecutarlos fuera del servicio del fabricante? La ficha de Nano proporciona pesos y ejemplos para varios motores. La segunda es licencia: hay que leer qué usos comerciales, redistribuciones y modificaciones permite la licencia Nemotron, y qué obligaciones conserva. Que un repositorio sea visible no lo convierte en software de dominio público.

La tercera fila es arquitectura y código. Nvidia publicó detalles del diseño y recetas, pero reproducir un modelo exige versiones, dependencias, configuración y recursos. La cuarta son los datos. El artículo técnico del lanzamiento afirmaba que pesos, datos y recetas se abrían, mientras el comunicado cuantificaba tres billones de tokens nuevos repartidos entre preentrenamiento, ajuste y aprendizaje por refuerzo. La ficha debe indicar qué porción exacta corresponde a la versión y qué corpus no es accesible.

La quinta fila son evaluaciones. Una tabla reproducible necesita instrucciones, herramientas, contenedores, límites y versiones de los conjuntos. La ficha de Hugging Face enlaza configuraciones y declara fechas de corte de los datos, información útil para detectar contaminación temporal. Sigue siendo una evaluación del fabricante hasta que un tercero repite el protocolo.

La sexta fila es operación. Un modelo puede ejecutarse con motores abiertos y, a la vez, rendir mejor en bibliotecas o formatos del fabricante. Se deben probar vLLM, SGLang u otra ruta elegida con el hardware real. Portabilidad significa que otra combinación cumple el contrato de servicio, no solo que inicia.

Rendimiento anunciado y rendimiento medido

Nvidia declaró hasta cuatro veces más rendimiento de tokens que Nemotron 2 Nano y hasta un 60 % menos de tokens de razonamiento. Ambos «hasta» exigen la configuración: hardware, precisión, longitud, concurrencia, modo de pensamiento y criterio de parada. Un modelo que genera menos tokens puede ser más eficiente o terminar antes de completar la tarea.

La evaluación interna debe registrar entradas y salidas por segundo, tiempo hasta el primer token, tiempo total, memoria máxima, energía si se dispone y tasa de éxito. El coste se calcula por tarea correcta, no por token. Si una configuración barata requiere reintentos o revisión adicional, el ahorro de inferencia puede desaparecer.

En una mezcla de expertos, también se vigila el encaminamiento. Ciertas tareas o idiomas pueden concentrarse en expertos concretos y cambiar el rendimiento. La ficha declara compatibilidad con inglés, alemán, español, francés, italiano y japonés, pero esa lista no garantiza paridad. Cada idioma necesita ejemplos propios, incluidos usos de herramientas y formatos.

Un agente multiplica los puntos de fallo

Nvidia dirigió Nemotron a equipos de agentes: recuperadores, planificadores, ejecutores y verificadores. Separar funciones puede facilitar permisos y pruebas, pero no crea fiabilidad automáticamente. Cada transferencia añade una interfaz donde se puede perder contexto, confundir autoridad o introducir una instrucción hostil.

El diagrama mínimo etiqueta quién puede leer datos, quién puede escribir, qué herramientas admite y qué salida requiere aprobación. Un agente de recuperación no necesita modificar archivos; un verificador no debería confiar en el resumen del ejecutor sin acceder a evidencia; el planificador no debe convertir contenido recuperado en instrucciones del sistema. Los registros deben conservar la versión del modelo, entradas de herramientas y decisiones de enrutamiento.

El uso de varios modelos también puede ser económico. Nano puede resolver clasificación, extracción o resumen, y un modelo mayor recibir excepciones. El enrutador se evalúa como un clasificador: falsos escalados elevan coste; falsos no escalados dejan tareas difíciles en un modelo insuficiente. Una comparación de modelos aislados no mide ese sistema.

Hoja de ruta no es producto

En diciembre, Nvidia describió Super con unos 100.000 millones de parámetros totales y hasta 10.000 millones activos, y Ultra con alrededor de 500.000 millones y hasta 50.000 millones activos. También anticipó precisión NVFP4 sobre Blackwell. Esas eran especificaciones proyectadas, no artefactos disponibles. Deben citarse en futuro y comprobarse de nuevo al publicarse.

Este límite importa porque nombres y planes cambian durante el desarrollo. Una decisión de compra no debería basarse en la promesa del siguiente modelo. Se prueba Nano si Nano es el producto; Super y Ultra se anotan como opciones pendientes con fecha, evidencia y criterio de revaluación.

Nemotron 3 Nano amplió la oferta de modelos descargables y mostró un paquete poco habitual de pesos, datos, herramientas y documentación. Eso no elimina la auditoría: la hace posible. La capacidad transferible es leer «abierto» como una matriz de seis filas —acceso, licencia, código, datos, evaluación y operación— y medir cada una con el artefacto exacto que se va a desplegar.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Artículos relacionados

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña
Modelos de lenguaje

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña

«Cuánta GPU hace falta» es la pregunta equivocada. Cómputo, datos y conocimiento no se suman: son tres puertas en serie, y la que casi nadie pasa no es la del hardware. Con el precio real de hoy, el corpus real de un modelo abierto y el cuaderno de bitácora real de un entrenamiento de 175.000 millones de parámetros, esta pieza hace la cuenta completa — y te dice en qué escalón estás tú.

7 min
Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no
Modelos de lenguaje

Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no

En 2023, un equipo de investigadores le pidió a ChatGPT que repitiera la palabra 'poema' sin parar, y el modelo acabó recitando 'El cuervo' de Poe palabra por palabra. Eso no prueba que los modelos guarden una copia de internet, pero tampoco que nunca memoricen nada: las dos afirmaciones son ciertas según el caso. Las cuatro preguntas que separan una demanda seria de un titular vacío.

7 min

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar