IA 360
Actualidad

NVIDIA presenta Blackwell, su nueva plataforma para IA a gran escala

NVIDIA presentó Blackwell el 18 de marzo de 2024 con las GPU B200, el superchip GB200 y sistemas a escala de rack. Sus cifras enseñan a leer una promesa de hardware: carga, precisión, métrica, configuración y base comparada.

5 min de lectura Generado con IA Read in English
NVIDIA presenta Blackwell, su nueva plataforma para IA a gran escala

NVIDIA presentó Blackwell el lunes 18 de marzo de 2024 durante su conferencia GTC. No anunció solo una GPU: mostró una plataforma que abarca la GPU B200, el superchip GB200 Grace Blackwell, enlaces NVLink, sistemas completos, redes y software. La nota de lanzamiento de NVIDIA promete ejecutar modelos de lenguaje de un billón anglosajón de parámetros con hasta 25 veces menos coste y consumo energético que la generación anterior.

El «hasta» es la palabra más importante de esa frase. No convierte la cifra en falsa, pero señala que corresponde a una carga, una configuración y unas condiciones concretas. Blackwell ofrece un buen caso para aprender a leer cualquier anuncio de chips: antes de repetir un multiplicador hay que anotar la tarea, la precisión numérica, la métrica, el sistema comparado y el software usado.

Blackwell es una plataforma, no una pieza aislada

La GPU Blackwell integra 208.000 millones de transistores. NVIDIA la construye con dos grandes dados fabricados en un proceso 4NP de TSMC y conectados mediante un enlace de 10 terabytes por segundo para que funcionen como una GPU unificada. La decisión permite superar el tamaño que cabría en un único dado, pero también muestra que la ingeniería de empaquetado y comunicación ya es tan decisiva como añadir unidades de cálculo.

El GB200 Grace Blackwell conecta dos GPU B200 con una CPU Grace basada en Arm mediante NVLink-C2C, con 900 gigabytes por segundo de ancho de banda bidireccional. La CPU prepara y coordina trabajo; las GPU ejecutan gran parte del cálculo paralelo; la memoria y el enlace procuran que los datos lleguen a tiempo. Llamarlo «superchip» describe esa integración, no un tercer procesador independiente.

El siguiente nivel es el GB200 NVL72: 36 superchips, por tanto 36 CPU Grace y 72 GPU Blackwell, interconectados y refrigerados por líquido a escala de rack. El desglose técnico de NVIDIA describe 18 nodos de cómputo y una red NVLink Switch que permite a las GPU intercambiar datos sin tratar cada servidor como una isla. En modelos repartidos entre muchos aceleradores, comunicar resultados parciales puede limitar el rendimiento tanto como calcularlos.

Esta escalera —dado, GPU, superchip, bandeja, rack y clúster— evita una comparación engañosa. Una cifra atribuida a «Blackwell» puede medir una GPU o un rack entero. Comparar el petaflop de un chip con los tokens por segundo de 72 GPU no dice cuál producto es mejor; mezcla unidades y escalas distintas.

Qué significa FP4 y qué no demuestra

Los Tensor Cores de Blackwell admiten cálculo de IA con formatos de cuatro bits, FP4. Reducir la cantidad de bits usada para representar valores permite mover más datos, almacenar más parámetros y ejecutar más operaciones con la misma capacidad física. La contrapartida es una representación menos precisa. El sistema necesita escalado, calibración y software que decida qué operaciones pueden bajar de precisión sin degradar de forma inaceptable el resultado.

Por eso «20 petaflops de FP4» no equivale a 20 petaflops con cualquier formato ni anticipa directamente la velocidad de una aplicación. Un FLOP cuenta una operación matemática; una respuesta de un modelo depende además de memoria, comunicación, forma del modelo, longitud del contexto, tamaño del lote, compilación y latencia exigida. La precisión debe aparecer siempre junto a la cifra de cómputo.

Tampoco basta con decir que dos salidas «parecen iguales». Para adoptar baja precisión hay que medir la tarea real: pérdida del modelo, exactitud en un conjunto de evaluación, tasa de errores relevantes o calidad juzgada con un protocolo reproducible. Ahorrar memoria no compensa si los fallos se concentran precisamente en la parte que importa al producto.

Cómo leer el 30x y el 25x

NVIDIA afirmó que el GB200 NVL72 alcanzaba hasta 30 veces el rendimiento de inferencia de un conjunto con el mismo número de GPU H100 y reducía hasta 25 veces el coste y la energía. El documento técnico permite ver el eje: inferencia de un modelo Mixture of Experts de 1,8 billones anglosajones de parámetros, con una latencia entre tokens de 50 milisegundos, 5.000 milisegundos hasta el primer token, entrada de 32.768 tokens y salida de 1.024. También advierte que era rendimiento proyectado y sujeto a cambios.

Esos detalles no son letra pequeña decorativa; son la afirmación completa. Un modelo Mixture of Experts activa solo parte de sus parámetros para cada token y exige mucha comunicación entre «expertos». Un gran dominio NVLink puede favorecer especialmente ese patrón. Otra arquitectura, otro tamaño de modelo o una aplicación con lotes pequeños puede producir una diferencia distinta.

La métrica también altera la conclusión. Rendimiento agregado mide cuánto trabajo termina el sistema por unidad de tiempo; latencia mide cuánto espera una petición; tiempo hasta el primer token y velocidad de los tokens siguientes son experiencias distintas. Un servidor puede maximizar tokens por segundo agrupando muchas solicitudes y, a la vez, empeorar la espera de cada usuario. Comprar «el chip más rápido» sin fijar un objetivo de servicio deja la decisión sin criterio.

El coste y la energía requieren denominador. «Energía por token» o «por respuesta» mide eficiencia de una tarea; «potencia del rack» mide demanda instantánea; «consumo anual del centro de datos» depende del volumen total, refrigeración, redes y utilización. Una mejora por unidad puede convivir con un consumo total mayor si la empresa multiplica el número de peticiones o instala muchos más racks.

El cuello de botella puede estar fuera de la GPU

Los 208.000 millones de transistores atraen la atención, pero un sistema de IA grande pasa tiempo moviendo pesos, activaciones y resultados parciales. Si el modelo no cabe en la memoria de una GPU, debe dividirse. Cada frontera añade comunicación; si un acelerador espera datos, su pico teórico permanece sin usar.

Blackwell responde con memoria rápida, NVLink de quinta generación, NVSwitch y redes InfiniBand o Ethernet. El GB200 NVL72 reúne 30 terabytes de memoria rápida y NVIDIA lo presenta como un dominio que actúa de forma coordinada. La capacidad útil, sin embargo, depende de cuánto ocupa el modelo con la precisión elegida, cuánta memoria consumen las cachés de atención y cuánto margen necesita el software.

También intervienen electricidad, refrigeración, espacio y operación. Un rack refrigerado por líquido no se instala como un servidor convencional: el centro necesita suministro y retorno de refrigerante, distribución eléctrica adecuada, control de fugas, procedimientos de mantenimiento y personal preparado. La disponibilidad del chip no implica que cualquier instalación pueda recibirlo inmediatamente.

El software forma parte del rendimiento

La plataforma incluye CUDA, bibliotecas matemáticas, TensorRT-LLM, herramientas de entrenamiento, redes y microservicios de inferencia. Esa capa traduce el modelo a núcleos optimizados y decide cómo repartirlo entre GPU. Una arquitectura puede mejorar después de su lanzamiento sin cambiar el silicio porque un compilador fusiona operaciones, una biblioteca reduce comunicación o un motor gestiona mejor la caché.

También crea dependencia. Migrar no consiste solo en sustituir una tarjeta: hay que revisar código CUDA, extensiones propias, contenedores, observabilidad, controladores, redes y competencias del equipo. La comparación económica debe incluir ese coste de cambio, el soporte, la capacidad reservada en la nube y el riesgo de que una optimización solo exista en una pila.

Los anuncios de AWS, Google Cloud, Microsoft Azure, Oracle y fabricantes de servidores indican intención de ofrecer Blackwell; no garantizan precio, fecha ni capacidad para cada cliente. El 18 de marzo de 2024, NVIDIA estaba anunciando una hoja de despliegue. Una carta de adopción no debe leerse como una medición independiente ni como inventario ya disponible.

Una ficha de seis líneas antes de creer un benchmark

Cualquier cifra de rendimiento debería poder reescribirse en seis líneas. Primera: carga exacta, modelo, tamaño, arquitectura y longitudes de entrada y salida. Segunda: tarea, entrenamiento o inferencia. Tercera: precisión numérica y criterio usado para comprobar calidad. Cuarta: configuración completa, desde número de aceleradores hasta memoria, red y refrigeración. Quinta: versión del software y ajustes. Sexta: métrica y base comparada, incluida la normalización por GPU, rack, vatio, petición o euro.

Después se pregunta quién midió. Una proyección del fabricante sirve para entender la intención del producto; un resultado reproducible o un benchmark externo aporta otra clase de evidencia; la prueba con la carga del comprador decide la utilidad local. No son fuentes intercambiables. La forma rigurosa de comunicar el anuncio es «NVIDIA proyecta hasta 30x bajo estas condiciones», no «Blackwell es 30 veces más rápido».

Para una compra, el piloto debe fijar un presupuesto de calidad y un objetivo de servicio antes de tocar el hardware. Hay que medir tokens o tareas útiles por euro y por kilovatio-hora, latencia en percentiles, utilización, errores, tiempo de recuperación y complejidad operativa. También conviene probar picos y fallos de red: el promedio en condiciones ideales oculta el momento que rompe un servicio.

Blackwell eleva el techo técnico mediante más cálculo, menor precisión y comunicación a escala de rack. Pero su lección duradera está en otra parte: un multiplicador sin eje no es una comparación. Quien conserva carga, precisión, métrica, configuración, software y referencia puede convertir una promesa espectacular en una hipótesis comprobable; quien pierde una de esas piezas solo conserva el eslogan.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar