IA 360
Actualidad

Mistral lanza Large 2, con 123.000 millones de parámetros

Mistral AI presenta Large 2, un modelo de 123.000 millones de parámetros centrado en código, matemáticas y trabajo multilingüe. Sus pesos se publican para investigación y el modelo llega a la API de la compañía y a grandes nubes.

4 min de lectura Generado con IA Read in English
Mistral lanza Large 2, con 123.000 millones de parámetros

El 24 de julio de 2024, Mistral AI presentó Mistral Large 2, un modelo de 123.000 millones de parámetros con contexto amplio, soporte multilingüe y pesos disponibles para investigación. El anuncio técnico de Mistral publica capacidades, licencia, evaluaciones y acceso; cada una responde a una pregunta distinta y no debe comprimirse en “más potente”.

El lanzamiento importa por dos motivos. Mistral no solo actualiza el modelo insignia que presentó en febrero: también publica sus pesos bajo una licencia para investigación y reduce de forma notable el precio de acceso por API. Es una combinación poco habitual en la gama alta del mercado, donde los modelos más capaces suelen funcionar exclusivamente como servicios cerrados.

Un modelo grande para código y documentos extensos

Mistral Large 2 admite un contexto de hasta 128.000 tokens. En términos sencillos, puede recibir y relacionar textos muy largos dentro de una misma conversación: documentación técnica, repositorios de código, contratos o colecciones de informes. Que un modelo admita ese volumen no garantiza que razone bien sobre cada detalle, pero elimina una limitación práctica frecuente al trabajar con archivos extensos. Fuente

La compañía ha puesto el foco en la generación de código y declara soporte para más de 80 lenguajes de programación. También refuerza las capacidades de llamada a funciones, el mecanismo por el que un asistente decide usar una herramienta externa —por ejemplo, consultar una base de datos o ejecutar una operación en un programa— en lugar de limitarse a redactar texto. Fuente

En sus evaluaciones, Mistral sitúa a Large 2 en el 92% en HumanEval, una prueba de pequeños problemas de programación en Python; en el 84% en MATH, centrada en ejercicios matemáticos; y en el 84% en MMLU, un test amplio de conocimientos y comprensión. Son referencias útiles para comparar modelos, aunque no sustituyen las pruebas con los datos, el código y los procesos reales de cada empresa. Fuente

El multilingüismo como apuesta europea

La mejora lingüística es uno de los elementos más relevantes del anuncio. Mistral Large 2 está diseñado para trabajar en inglés, francés, alemán, español, italiano, portugués, árabe, hindi, ruso, chino, japonés y coreano, entre otros idiomas.

La mayoría de los grandes modelos se entrenan con una proporción muy superior de contenido en inglés. Eso puede traducirse en respuestas menos fiables, peores resúmenes o instrucciones mal interpretadas cuando se usan en otros idiomas. Para compañías europeas que redactan, atienden clientes o analizan documentos en varias lenguas, la calidad multilingüe no es una prestación secundaria: determina si el modelo puede incorporarse al flujo de trabajo sin obligar a traducir primero la información.

Mistral ya había convertido el francés y otros idiomas europeos en una de sus señas de identidad. Large 2 amplía esa estrategia en un momento en el que el mercado se concentra alrededor de laboratorios estadounidenses y chinos, con modelos cada vez más costosos de entrenar y operar.

Pesos disponibles, pero no software libre

Los pesos de Mistral Large 2 pueden descargarse para investigación bajo la Mistral Research License. Esto permite a investigadores estudiar y probar el modelo en su propia infraestructura, algo que no es posible con servicios totalmente cerrados.

Conviene distinguirlo de una licencia abierta sin restricciones comerciales. La licencia de investigación no concede automáticamente permiso para explotar el modelo en productos o servicios comerciales. Las empresas que quieran ese uso deben acudir a Mistral para obtener las condiciones correspondientes o emplear el servicio alojado por la compañía y sus socios.

El modelo está disponible en La Plateforme, la API de Mistral, con un precio de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida. También llega a plataformas como Amazon Bedrock, Azure AI Studio, Google Cloud Vertex AI, IBM watsonx y NVIDIA NIM. Fuente

La rebaja de precio es relevante: el anterior Mistral Large se lanzó con tarifas de 8 dólares por millón de tokens de entrada y 24 dólares por millón de salida. Para aplicaciones que procesan grandes volúmenes de texto o generan código de forma continua, el coste por consulta puede decidir qué modelo resulta viable. Fuente

La prueba decisiva será si esas mejoras se mantienen fuera de los benchmarks. Mistral Large 2 entra en un segmento donde la calidad importa, pero también la privacidad, la facilidad de despliegue y una factura previsible. La posibilidad de investigarlo localmente y usarlo en varias nubes da a clientes y desarrolladores más opciones para comparar esas variables.

Una ficha de modelo evita comparaciones falsas

El nombre comercial no basta para reproducir un resultado. La ficha mínima incluye identificador de versión, fecha, licencia, formato de pesos, cuantización, plantilla de chat, contexto usado, parámetros de generación y hardware. Dos equipos pueden decir que ejecutan Large 2 y obtener latencias, memoria y respuestas diferentes porque no comparten esas condiciones.

El contexto anunciado es capacidad de entrada, no memoria perfecta. Una prueba divide un documento en hechos distribuidos al principio, centro y final; añade información contradictoria y pregunta por la fuente exacta. Se mide recuperación, fidelidad y tendencia a completar huecos. Introducir un archivo completo solo ahorra segmentación si el modelo encuentra lo relevante de forma consistente.

Benchmark, idioma y tarea deben usar el mismo eje

Un promedio en código no demuestra rendimiento en el repositorio de una empresa. Se conserva el lenguaje, dependencias, pruebas y criterio de aceptación; el código generado se ejecuta. Para multilingüismo, se escriben casos originalmente en cada idioma en vez de traducir un conjunto inglés, y se revisan instrucciones, matices y terminología local.

Los pesos descargables amplían la capacidad de inspección, pero la licencia de investigación no equivale a permiso comercial ni revela los datos de entrenamiento. Hay que separar acceso técnico, derechos de uso, documentación y posibilidad de modificar. “Abierto” sin apellido oculta esas diferencias.

La capacidad transferible es comparar modelos mediante una ficha estable y una tarea propia. Calcula calidad, latencia, memoria, licencia y coste por resultado aceptado. Si cambia una de esas variables, ya no estás repitiendo la misma comparación, aunque el nombre del modelo permanezca.

El coste útil termina en una respuesta aceptada

La tarifa por token permite presupuestar tráfico, pero no dice cuánto trabajo resuelve el sistema. Una comparación conserva el mismo conjunto de peticiones, cuenta reintentos, respuestas descartadas, herramientas usadas y revisión humana. Después divide el gasto total entre resultados que superan el criterio. Un modelo barato que obliga a repetir puede costar más por tarea terminada.

El despliegue local añade otra contabilidad: memoria, aceleradores, energía, personal de operación y periodos sin uso. La API convierte parte de esos costes en tarifa y traslada control al proveedor. Ninguna opción gana por definición; la decisión depende de volumen, sensibilidad de los datos, tolerancia a cambios y capacidad del equipo para mantener el sistema.

Un protocolo pequeño y repetible

Selecciona casos reales, fija una versión y ejecuta varias veces con parámetros registrados. Revisa exactitud, citas, formato y fallos peligrosos; mide latencia y coste junto a calidad. Repite el protocolo tras cualquier cambio de modelo, plantilla o proveedor. Así el anuncio se convierte en una hipótesis comprobable y la comparación sobrevive al siguiente nombre comercial.

Antes de decidir, publica la ficha y pide a otro equipo que reproduzca una muestra. Los desacuerdos revelan dependencias ocultas: permisos, versiones de bibliotecas, límites del servicio o decisiones de revisión. Si el segundo equipo no puede repetir el resultado, la cifra aún describe una demostración, no una capacidad operativa. Documentar también los casos rechazados impide optimizar el informe ocultando las peticiones que más cuestan. El protocolo gana valor cuando otro puede discutirlo con la misma evidencia.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar