Meta libera Llama 3.1 con un modelo de 405.000 millones de parámetros
Meta publicó el 23 de julio de 2024 Llama 3.1 en tamaños de 8.000, 70.000 y 405.000 millones de parámetros. Descargar los pesos amplía el control, pero no elimina el coste de inferencia, la licencia propia ni la necesidad de evaluar el sistema completo.
Meta publicó el 23 de julio de 2024 Llama 3.1 en versiones de 8.000, 70.000 y 405.000 millones de parámetros. La mayor puso a disposición pública los pesos de un modelo denso situado por Meta en la frontera de capacidad de aquel momento. También permitió utilizar sus salidas para mejorar otros modelos. Pero descargar 405B no equivale a poder ejecutarlo con facilidad, reproducir su entrenamiento ni usarlo sin condiciones.
La novedad ofrece una lección que sirve para cualquier modelo «abierto»: hay que separar acceso, coste, reproducibilidad y derechos. Un archivo disponible puede dar control sobre el alojamiento y la adaptación, mientras sigue exigiendo cientos de gigabytes, una licencia propia y salvaguardas construidas por quien lo despliega. La apertura útil no es un sí o un no, sino una matriz.
Tres modelos, no una sola experiencia
El anuncio original de Meta presentó Llama 3.1 405B junto con versiones actualizadas de 8B y 70B. Las tres ampliaron el contexto a 128.000 tokens y admitían ocho idiomas: inglés, alemán, francés, italiano, portugués, hindi, español y tailandés. Meta ofreció variantes preentrenadas y ajustadas para instrucciones, destinadas a trabajos diferentes.
Un modelo preentrenado predice continuaciones y sirve como base para adaptación. Uno instructivo ha recibido entrenamiento posterior para responder peticiones y dialogar. Elegir 405B Instruct para un asistente y 8B Base para una investigación de ajuste no es comparar «calidad» sobre una misma tarea. Antes del tamaño hay que fijar función, latencia, volumen de usuarios y restricciones de datos.
La tarjeta oficial de Llama 3.1 señala además un corte de conocimiento de diciembre de 2023. Una ventana larga permite introducir información posterior, pero no actualiza los pesos. Contexto, conocimiento aprendido y acceso a herramientas son capas separadas: el sistema solo consulta una base de datos o API si el desarrollador construye y autoriza esa integración.
Qué significa 405B en memoria
El informe técnico de la familia Llama 3 define el modelo mayor como un transformador denso de 405.000 millones de parámetros. «Denso» significa que, a diferencia de una mezcla de expertos, no conserva una gran reserva para activar solo una fracción en cada token. El número total se acerca también al conjunto que participa en la inferencia.
Puede hacerse una estimación inicial multiplicando parámetros por bytes. En BF16, con dos bytes por parámetro, los pesos solos rondan 810 GB. En FP8, con aproximadamente un byte, rondan 405 GB. Todavía faltan memoria de ejecución, caché de claves y valores, contexto, software y margen operativo. No es una cotización de hardware, sino una forma de detectar enseguida que 405B no pertenece a un portátil corriente.
Meta explicó que cuantizó la versión de producción de 16 a 8 bits para que cupiera en un solo nodo de servidor. «Un nodo» puede contener varias GPU de centro de datos; no significa una sola tarjeta. Cuantizar reduce memoria y cómputo, pero puede alterar calidad y exige comprobar el formato realmente distribuido, la longitud de contexto, el tamaño de lote y la latencia requerida.
El tamaño menor puede ganar en el producto real. Si 8B responde suficientemente bien, cabe en infraestructura más accesible, genera antes y permite más usuarios simultáneos. 405B puede ser útil como profesor para datos sintéticos, evaluación o destilación y seguir siendo excesivo para cada consulta. La pregunta no es cuál es mayor, sino cuál cumple el umbral al menor coste total.
Capacidad declarada y evidencia
Meta dijo que 405B rivalizaba con GPT-4, GPT-4o y Claude 3.5 Sonnet en conocimiento, matemáticas, uso de herramientas, traducción y seguimiento de instrucciones. La empresa evaluó más de 150 conjuntos y publicó resultados automáticos y comparaciones humanas. Esa amplitud es información valiosa; sigue siendo una evaluación del creador y no una garantía sobre cada aplicación.
La tarjeta identifica, por ejemplo, HumanEval y MBPP para código, MMLU para conocimiento, GSM8K y MATH para matemáticas y varias baterías de uso de herramientas. Cada resultado tiene número de ejemplos, métrica y configuración. Decir «modelo de frontera» resume muchas filas; una decisión técnica debe volver a la fila que se parece al trabajo previsto.
El español aparece entre los idiomas soportados y tiene resultados propios en la evaluación multilingüe. Eso es más sólido que inferir calidad porque el modelo responde alguna frase. Aun así, una prueba local debe incluir variedades, terminología del sector, instrucciones ambiguas y riesgos del dominio. «Soportado» no quiere decir idéntico rendimiento al inglés ni adecuación automática a cualquier país.
Los 128.000 tokens de contexto tampoco son 128.000 tokens de atención perfecta. Un documento puede caber y una respuesta omitir su cláusula decisiva. Para medir contexto largo conviene sembrar hechos contradictorios, pedir citas localizables y variar su posición; después se comprueba fidelidad, no solo fluidez. Caber, recuperar y razonar son tres peldaños diferentes.
Pesos disponibles no son entrenamiento reproducible
Meta declaró más de 15 billones de tokens de preentrenamiento y más de 16.000 GPU H100 en la ejecución de mayor escala. La tarjeta describe una mezcla nueva de datos en línea públicamente disponibles y más de 25 millones de ejemplos sintéticos para ajuste. No entrega un inventario completo de cada documento ni todos los artefactos necesarios para repetir el entrenamiento desde cero.
Publicar pesos permite inspeccionar la arquitectura, alojar inferencia, ajustar el modelo y comparar proveedores. Es una apertura material que una API cerrada no ofrece. Pero reproducibilidad requiere además datos identificables, código, receta, orden, filtros y cómputo. Una organización que necesita rastrear procedencia no debe convertir «pesos descargables» en «origen completamente auditable».
La licencia amplió otra capacidad: usar salidas de Llama 3.1, incluido 405B, para mejorar otros modelos. Eso hacía posibles destilación y generación de datos sintéticos bajo el contrato. Sin embargo, la salida de un profesor no se vuelve verdadera por repetición. Un modelo menor puede heredar errores, sesgos y respuestas fabricadas; el conjunto sintético necesita pruebas, diversidad y datos reales de control.
La licencia también forma parte del modelo
La Llama 3.1 Community License concede uso, reproducción, modificación y distribución mediante una licencia comercial personalizada y gratuita. Al redistribuir exige entregar el contrato, conservar atribución y mostrar «Built with Llama». Si un producto o sus afiliadas superaban 700 millones de usuarios activos mensuales en el mes anterior al lanzamiento, debían solicitar permiso a Meta y no quedaban autorizados hasta obtenerlo.
El contrato incorpora además la política de uso aceptable, con prohibiciones para categorías como malware, determinadas actividades de alto riesgo, tratamiento no autorizado de datos sensibles y engaño. Esas condiciones impiden tratar la licencia como equivalente automático de Apache o MIT. La etiqueta de Meta era «open source»; la descripción verificable es más precisa: pesos y código accesibles bajo una licencia comunitaria con obligaciones y umbral comercial.
Abrir pesos tampoco abre el sistema final. Si una empresa consume Llama a través de una nube, debe revisar además términos, ubicación y retención del proveedor. Si lo aloja, asume parches, control de acceso, observabilidad y seguridad. La opción local cambia quién controla la infraestructura; no elimina el trabajo operativo.
Cómo escoger entre 8B, 70B y 405B
Un piloto empieza con tareas representativas y el modelo más pequeño plausible. Se miden exactitud con fuentes, seguimiento de formato, errores graves, latencia, memoria y coste por respuesta. Luego se prueba 70B o 405B solo si el aumento de calidad resuelve fallos que importan. El tamaño es una variable del experimento, no el objetivo.
Para herramientas, el modelo no recibe permisos generales. Se define una lista de funciones, se validan argumentos, se limita el alcance y se exige confirmación para acciones irreversibles. La propia tarjeta de Meta advierte que un modelo no debe desplegarse aislado y que los desarrolladores son responsables de las salvaguardas del sistema. Llama Guard o Prompt Guard pueden ayudar, pero no sustituyen políticas y controles de aplicación.
La capacidad transferible es evaluar apertura en cuatro columnas: pesos disponibles, receta y datos reproducibles, derechos de licencia y coste operativo. Llama 3.1 405B amplió de forma real lo que podía estudiarse y construirse fuera de una API cerrada. Al mismo tiempo, sus 405.000 millones densos, el origen incompleto del corpus y el contrato personalizado fijaban límites igualmente reales. Ver las cuatro columnas permite aprovechar la apertura sin prometer independencia donde todavía hay dependencia.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.