IA 360
Actualidad

Mixtral 8x7B: por qué activar menos parámetros no significa cargar un modelo pequeño

Mixtral activa 12.900 millones de 46.700 millones de parámetros por token. Guía para separar cálculo, memoria, benchmark, variante y apertura real.

4 min de lectura Generado con IA Read in English
Mixtral 8x7B: por qué activar menos parámetros no significa cargar un modelo pequeño

El 11 de diciembre de 2023, Mistral AI publicó Mixtral 8x7B, un modelo de pesos abiertos que activa una parte de su red para procesar cada token. La ficha de lanzamiento de la compañía declara 46.700 millones de parámetros totales, 12.900 millones utilizados por token, contexto de 32.000 tokens y licencia Apache 2.0. También sostiene que supera a Llama 2 70B y alcanza o rebasa a GPT-3.5 en la mayoría de sus pruebas.

La arquitectura hace posible separar dos recursos que a menudo se mezclan: capacidad almacenada y cálculo por token. Mixtral puede contener muchas rutas sin recorrerlas todas en cada paso. Pero que use 12.900 millones de parámetros para calcular un token no significa que el archivo pese como un modelo de 12.900 millones ni que baste la misma memoria. Esa distinción es la clave para leer cualquier nuevo modelo de mezcla de expertos.

Ocho expertos, dos rutas por token

Mixtral es un Transformer decodificador cuya capa feed-forward contiene ocho grupos de parámetros. En cada capa, un enrutador asigna cada token a dos grupos y combina sus salidas. «Experto» es un nombre técnico: no implica que uno se dedique a medicina y otro a francés, ni que una persona pueda seleccionar manualmente una profesión. Son bloques aprendidos durante el entrenamiento, y su especialización puede ser parcial o difícil de interpretar.

Un ejemplo simplificado ayuda. La palabra «banco» entra en una capa; el enrutador calcula ocho puntuaciones y elige las dos mayores. Sus bloques procesan la representación y las salidas se ponderan. En la capa siguiente pueden elegirse otros dos expertos. La ruta depende del token y del contexto. El modelo no ejecuta ocho respuestas completas ni celebra una votación final entre ocho chatbots.

La idea es anterior a Mixtral. El paper Switch Transformers, publicado por investigadores de Google en 2021, explicó cómo seleccionar parámetros distintos para cada entrada permite aumentar el número total manteniendo contenido el cálculo, y también documentó problemas: comunicación entre dispositivos, inestabilidad de entrenamiento y equilibrio de carga. La escasez de activación ofrece eficiencia, no magia gratuita.

También hay que separar eficiencia de entrenamiento y de inferencia. Switch Transformers informó de aumentos de hasta siete veces en velocidad de preentrenamiento con los mismos recursos y de cuatro veces frente a T5-XXL en su configuración. Esos resultados prueban que la activación dispersa puede ahorrar cálculo en un experimento concreto; no garantizan la latencia de Mixtral al servir usuarios. Entrenar mide pasos y comunicación durante el aprendizaje; servir añade lotes, caché y movimiento de expertos. Una cifra de una fase no debe vender la otra.

Cálculo activo no es memoria residente

Para generar un token, Mixtral recorre solo dos expertos por capa, además de componentes compartidos. De ahí los 12.900 millones de parámetros activos que declara Mistral, no 14.000 millones obtenidos multiplicando dos por siete. El nombre 8x7B es una etiqueta útil, no la contabilidad exacta de la arquitectura. Los parámetros totales son 46.700 millones, tampoco 56.000 millones, porque existen partes compartidas y la denominación redondea.

El cálculo disminuye frente a un modelo denso de tamaño total parecido, pero los pesos de los ocho expertos deben estar disponibles para que el enrutador pueda elegirlos. En una implementación normal se cargan en memoria de GPU o se distribuyen entre varias. En BF16, dos bytes por parámetro dan una estimación de unos 93,4 GB solo para 46.700 millones de pesos, antes de caché, activaciones y software. Cuantizar o repartir reduce la presión por dispositivo, aunque puede cambiar rendimiento y añadir comunicación.

Por eso «más barato que Llama 2 70B» necesita condiciones. Mistral declara una inferencia seis veces más rápida en sus comparaciones, pero velocidad depende de hardware, tamaño de lote, longitud de contexto, precisión, biblioteca y distribución de expertos. Un MoE puede ahorrar operaciones y aun sufrir esperas al mover tokens entre dispositivos. La métrica útil para una empresa es tokens por segundo y coste por salida correcta en su configuración, no parámetros activos aislados.

La comparación con GPT-3.5 tiene apellidos

La afirmación de que Mixtral iguala o supera a GPT-3.5 procede del fabricante. Su tabla reúne pruebas de conocimiento, razonamiento, comprensión, matemáticas, código y varios idiomas. Es una razón para evaluar el modelo, no un certificado de equivalencia de producto. «GPT-3.5» puede referirse a versiones y fechas diferentes; una API conversacional incorpora instrucciones, moderación y ajustes que no son idénticos a un modelo base.

Mixtral también se publicó en dos variantes. La base predice texto y, según la tarjeta oficial del repositorio de pesos, no incorpora mecanismos de moderación. Mixtral Instruct recibió ajuste supervisado y optimización de preferencias para seguir instrucciones. Comparar la base con un chatbot o usar el marcador de Instruct para describir la base mezcla sistemas. El nombre completo, versión, plantilla de conversación y configuración deben acompañar cualquier cifra.

Una reproducción mínima fija cinco variables: commit exacto de los pesos, precisión, motor de inferencia, prompts y conjunto de datos. Después registra calidad, latencia, memoria máxima y fallos. Si se compara con una API cerrada, hay que anotar su versión o fecha, porque el proveedor puede actualizarla. Si un resultado solo existe como imagen en la página del fabricante y no incluye salidas o código, su auditabilidad es menor aunque la cifra sea real.

Pesos abiertos no significa que todo sea abierto

Mistral liberó los pesos con Apache 2.0, una licencia permisiva que permite uso, modificación y distribución bajo sus condiciones. Es una apertura material: el repositorio permite descargar el modelo y ejecutarlo con infraestructura propia. El usuario puede inspeccionar archivos, cuantizar, ajustar y evitar depender de una API para cada consulta.

Pero «pesos abiertos» no equivale a reproducibilidad completa. La página de lanzamiento dice que el preentrenamiento usó datos extraídos de la web abierta, sin publicar el corpus, el código de entrenamiento, el presupuesto de cálculo ni todos los filtros. Se puede estudiar y transformar el artefacto terminado; no reconstruir el proceso desde cero con la información disponible. Llamarlo «código abierto» sin precisar qué componentes se entregan borra esa diferencia.

La licencia tampoco aporta seguridad automática. El repositorio advierte que el modelo base carece de moderación. Quien lo despliega controla los datos y gana flexibilidad, pero también asume evaluación, filtrado, protección del servicio, privacidad, monitorización y cumplimiento. Ejecutar en servidores propios puede mejorar soberanía; no convierte la salida en fiable ni exime de revisar la procedencia de los datos introducidos.

Cómo decidir si un MoE conviene

Una prueba práctica empieza por el cuello de botella. Si falta capacidad de cálculo pero existe memoria y una red rápida entre dispositivos, la activación escasa puede ser atractiva. Si el límite es cargar todos los pesos en una sola GPU, el total de 46.700 millones sigue siendo decisivo. Si la aplicación requiere respuestas cortas para muchos usuarios, importa el rendimiento por lote; si usa documentos largos, crecen la caché de atención y el coste del contexto.

Después se evalúa la tarea. Diez benchmarks generales no sustituyen cien ejemplos propios con idioma, formato y errores reales. Hay que incluir instrucciones que no tienen respuesta, datos privados ficticios, entradas largas y casos que exigen negarse. La variante Instruct puede ser adecuada para diálogo; la base puede servir para ajuste especializado. La elección correcta depende del sistema final, no de la tabla más favorable.

Mixtral marca un avance importante porque combina una licencia permisiva, pesos descargables y una arquitectura eficiente que una organización puede medir. La lección duradera es más precisa que «8x7B iguala a GPT-3.5»: en un MoE hay que separar parámetros totales, parámetros activos, memoria, cálculo y protocolo de evaluación. Quien haga esas cinco preguntas sabrá cuándo la escasez reduce el coste y cuándo el nombre solo está ocultando un modelo grande.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar