IA 360
Actualidad

Alibaba lanza Qwen 2.5, modelos abiertos de 0,5 a 72.000 millones

Alibaba ha publicado Qwen 2.5, una familia de modelos de lenguaje abiertos con tamaños entre 500 millones y 72.000 millones de parámetros. La apuesta amplía las opciones para ejecutar IA generativa con costes y capacidades muy distintos.

5 min de lectura Generado con IA Read in English
Alibaba lanza Qwen 2.5, modelos abiertos de 0,5 a 72.000 millones

El 19 de septiembre de 2024, el equipo Qwen de Alibaba presentó Qwen 2.5, una familia de modelos generales, de código y matemáticas en varios tamaños. El anuncio técnico de Qwen enumera parámetros, contexto, idiomas, licencias y resultados propios; elegir una variante exige relacionar esas dimensiones con una tarea y un equipo concretos.

El lanzamiento refuerza una realidad que se ha acelerado durante 2024: los laboratorios chinos ya no compiten solo con servicios de IA cerrados, sino también mediante modelos cuyos pesos —los archivos que contienen lo aprendido durante el entrenamiento— pueden descargarse y adaptarse.

Siete tamaños para no pagar de más

Qwen 2.5 llega en versiones de 0,5, 1,5, 3, 7, 14, 32 y 72 mil millones de parámetros. Los parámetros son las conexiones numéricas que un modelo ajusta durante su entrenamiento; su cifra no determina por sí sola la calidad, pero suele dar una idea de la capacidad de cómputo y memoria que necesitará para funcionar. Fuente

La amplitud de tamaños tiene una consecuencia práctica importante. No todas las empresas necesitan, ni pueden asumir, el coste de servir un modelo de decenas de miles de millones de parámetros. Las versiones pequeñas permiten probar asistentes internos, clasificación de documentos o automatización de respuestas con una infraestructura mucho más asequible. Los modelos grandes apuntan a trabajos en los que la calidad de la respuesta, el seguimiento de instrucciones y la capacidad para manejar problemas largos justifican más recursos.

Alibaba ha publicado variantes base y variantes Instruct. Las primeras están pensadas para desarrolladores que quieran continuar el entrenamiento con datos propios. Las segundas ya han sido afinadas para conversar y obedecer indicaciones en lenguaje natural, por lo que son las que encajan en un chatbot, un asistente de programación o una herramienta de consulta documental.

Lenguaje, código y matemáticas en la misma familia

La compañía presenta Qwen 2.5 como una mejora en conocimiento general, comprensión lingüística, programación y resolución de problemas matemáticos. También anuncia soporte para más de 29 idiomas y un contexto de hasta 128.000 tokens en los modelos de la serie. Fuente

Ese contexto es la cantidad de texto que el sistema puede tener presente al elaborar una respuesta. Una ventana de 128.000 tokens permite trabajar con documentos extensos, repositorios de código o conversaciones largas sin dividirlos en fragmentos tan pequeños. No elimina los errores de razonamiento ni garantiza que el modelo interprete bien un contrato o una base de código, pero reduce una limitación habitual de los asistentes anteriores. Fuente

Alibaba acompaña la familia general con modelos Qwen2.5-Math, orientados específicamente a las matemáticas. Es una distinción relevante: los modelos de lenguaje son convincentes al redactar una solución, pero pueden equivocarse en cálculos elementales o construir argumentos que parecen correctos sin serlo. El entrenamiento especializado puede mejorar el rendimiento en pruebas de este tipo, aunque sigue siendo prudente verificar los resultados en contextos académicos, financieros o de ingeniería.

Una alternativa abierta frente a los modelos de pago

Los pesos de Qwen 2.5 se distribuyen bajo licencia Apache 2.0, una licencia permisiva que permite su uso comercial y modificaciones. Eso facilita que una organización lo ejecute en su propia infraestructura, lo adapte a terminología interna o evite enviar información sensible a una API externa.

Conviene precisar qué significa «abierto» en este caso. Poder descargar los pesos supone una diferencia material frente a modelos exclusivamente accesibles por API, como los principales productos comerciales estadounidenses. Sin embargo, no equivale a conocer cada detalle del proceso de entrenamiento: los modelos abiertos no suelen publicar de forma completa los datos utilizados, el coste de cómputo ni todas las decisiones de filtrado y ajuste.

La familia Qwen ya estaba entre las alternativas abiertas más seguidas junto a Llama de Meta y Mistral. Con Qwen 2.5, Alibaba incorpora el tamaño de 32.000 millones de parámetros, una escala intermedia que puede resultar atractiva para equipos que consideran insuficientes los modelos de 7.000 o 14.000 millones, pero no quieren operar uno de 72.000 millones. Fuente

La competencia se traslada a la infraestructura

Para los usuarios finales, el nombre Qwen 2.5 importará menos que sus efectos: más proveedores podrán integrar asistentes de texto y código sin depender de un único fabricante. Para las empresas, la decisión seguirá siendo un equilibrio entre coste, rendimiento, privacidad, idiomas soportados y facilidad de despliegue.

La comparación real no se resolverá solo con los resultados de referencia publicados por cada laboratorio. Los modelos deberán demostrar cómo responden a documentos imperfectos, instrucciones ambiguas y consultas en español fuera de los conjuntos de pruebas. Alibaba ha puesto una gama amplia sobre la mesa; ahora desarrolladores y empresas tendrán que medir qué versión resuelve mejor tareas concretas y con qué coste.

Una familia no tiene una sola capacidad

Los tamaños responden a restricciones diferentes. Antes de descargar, define memoria disponible, latencia, volumen y daño de un error. Un modelo pequeño puede clasificar o extraer con menor coste; una variante grande puede resolver mejor tareas complejas y seguir siendo inviable en el equipo elegido. El parámetro es una variable de despliegue, no una puntuación universal.

La licencia se comprueba por repositorio y variante. Un anuncio de familia puede incluir excepciones; copiar la etiqueta “Apache” a todos los pesos crea un error jurídico y técnico. Guarda archivo de licencia, revisión y condiciones junto al modelo, porque el nombre de la familia no sustituye ese documento.

Cómo probar idioma, contexto y especialización

Para cada idioma se preparan instrucciones originales, documentos locales y términos que no tienen traducción literal. Se miden omisión, formato, mezcla de idiomas y exactitud, con revisores competentes. La lista de lenguas admitidas significa que el sistema puede procesarlas; no garantiza igual calidad.

El contexto largo se evalúa con hechos distribuidos, versiones contradictorias y preguntas que exigen citar posición. Los modelos de código y matemáticas se prueban solo en su dominio declarado y con ejecución o verificación. Un resultado alto en una especialidad no autoriza a usarla como asistente general.

La capacidad transferible es escoger un modelo por tarea, hardware, licencia y prueba propia. Conserva la variante exacta y los fallos, no solo el promedio del fabricante. Esa ficha permite cambiar de familia sin volver a empezar la evaluación.

El archivo descargado necesita identidad propia

Nombre, hash, repositorio, revisión y configuración deben viajar juntos. Así se puede demostrar qué pesos produjeron una salida y detectar si el proveedor sustituyó archivos bajo una etiqueta estable. También se conservan tokenizer y plantilla: un desajuste puede degradar un modelo sin modificar los pesos.

La cuantización intercambia memoria y velocidad por una posible pérdida de calidad. No se extrapola desde la versión original; se repite la prueba sobre el artefacto que realmente se desplegará. Latencia en una demostración aislada tampoco predice el servicio con concurrencia, colas y entradas largas.

La elección termina en un umbral operativo

Define qué fallos obligan a revisión humana y qué tareas no puede ejecutar el modelo. Después mide la proporción que supera el umbral sin ayuda, el tiempo de los casos revisados y el daño de un error no detectado. Ese resultado permite comparar una variante pequeña y otra grande sin premiar capacidad que la aplicación no utiliza.

La ficha se actualiza cuando cambian pesos, instrucciones, hardware o datos de prueba. Mantener esos ejes estables convierte una colección de benchmarks en un control de cambios y evita que una mejora anunciada borre fallos conocidos.

Publica además el presupuesto de error. Si una extracción incorrecta se detecta fácilmente, el sistema admite un umbral distinto al de una decisión automática irreversible. Vincular métrica y consecuencia evita escoger el mayor modelo por inercia.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar