IA 360
Modelos de lenguaje

Kimi K2 lleva los modelos abiertos al billón de parámetros

Moonshot AI publica Kimi K2, un modelo de un billón de parámetros con arquitectura de expertos y pesos descargables. Activa 32.000 millones de parámetros por consulta y apunta a la programación con agentes, un terreno dominado hasta ahora por sistemas cerrados.

5 min de lectura Generado con IA Read in English
Kimi K2 lleva los modelos abiertos al billón de parámetros

El 11 de julio de 2025, Moonshot AI publicó la tarjeta y los pesos de Kimi K2 Instruct. La fuente original sostiene el núcleo documental del hecho; el total de parámetros describe arquitectura; no equivale a memoria activa, velocidad ni calidad.

El lanzamiento importa menos por el número en sí que por lo que habilita: empresas y desarrolladores pueden ejecutar, adaptar y estudiar un modelo de gran tamaño sin depender por completo de una API ajena. Kimi K2 se presenta además como un modelo pensado para agentes, sistemas que no solo responden texto, sino que usan herramientas, escriben código y encadenan pasos para completar una tarea.

Un billón de parámetros, pero no todos a la vez

Kimi K2 emplea una arquitectura MoE, siglas de mixture of experts o mezcla de expertos. En vez de activar toda la red para cada token, el sistema enruta el procesamiento a una pequeña parte de expertos.

Moonshot indica que, de su billón de parámetros, activa unos 32.000 millones por token procesado. Es una diferencia decisiva: permite reunir mucha capacidad potencial sin asumir el coste de cálculo que tendría utilizar un modelo denso de un billón de parámetros en cada respuesta. Documento que sostiene la cifra.

No es una idea nueva. DeepSeek popularizó esta estrategia con modelos como DeepSeek-V3, de 671.000 millones de parámetros totales, y Meta también la ha adoptado en Llama 4. Pero Kimi K2 eleva el listón de los pesos abiertos a una escala inédita entre los modelos ya disponibles para descarga. Documento que sostiene la cifra.

Moonshot ha publicado una versión base, destinada a ajustes posteriores, y Kimi K2-Instruct, preparada para seguir instrucciones y utilizar herramientas. El modelo admite contextos de hasta 128.000 tokens, una ventana suficiente para trabajar con repositorios de código, documentación extensa o historiales largos de una tarea. Documento que sostiene la cifra.

La apuesta está en los agentes de programación

La compañía ha centrado la presentación en pruebas de programación agéntica. A diferencia de un examen convencional de código, estas evaluaciones miden si el modelo puede localizar un error en un proyecto real, modificar varios archivos, ejecutar pruebas y proponer una solución funcional.

Según la tabla publicada por Moonshot, Kimi K2-Instruct alcanza el 65,8% en SWE-bench Verified, una referencia basada en incidencias reales de GitHub. La compañía lo sitúa por encima de GPT-4.1 y por debajo de los mejores resultados atribuidos a los modelos Claude más recientes en esa misma prueba. Documento que sostiene la cifra.

La empresa también lo sitúa por delante de GPT-4.1 y Claude Opus 4 en algunas pruebas de código con agentes, como LiveCodeBench. Esa precisión importa: los benchmarks no coronan a un ganador universal. El resultado cambia según las herramientas permitidas, el tiempo de ejecución, el modelo que planifica la tarea y la versión exacta de cada evaluación.

Aun así, la distancia con los modelos cerrados se ha estrechado. Hace dos años, descargar un modelo abierto capaz de competir en reparaciones complejas de software habría sido impensable; ahora el límite puede estar más en la infraestructura necesaria para servirlo que en la disponibilidad de los pesos.

Pesos abiertos no significa una licencia sin condiciones

Según la licencia publicada por Moonshot, Kimi K2 se distribuye bajo una licencia MIT modificada. Permite usos amplios, incluidos muchos comerciales, pero establece condiciones adicionales para servicios de gran escala: quien supere 100 millones de usuarios activos mensuales o 20 millones de dólares de ingresos mensuales deberá solicitar una licencia comercial a Moonshot. Documento que sostiene la cifra.

Por eso conviene distinguir entre pesos abiertos y software plenamente libre bajo una licencia estándar sin restricciones de uso. Para investigadores, empresas pequeñas y equipos que quieran desplegar el modelo internamente, la licencia deja un margen amplio. Para una gran plataforma de consumo, Moonshot conserva capacidad de negociación.

Moonshot también ofrece Kimi K2 a través de API. Según las tarifas anunciadas por la compañía, el precio es de 0,60 dólares por millón de tokens de entrada sin caché y 2,50 dólares por millón de tokens de salida; las entradas reutilizadas desde caché cuestan 0,15 dólares por millón. Es un precio competitivo para un modelo de esta escala, aunque ejecutar los pesos por cuenta propia seguirá exigiendo servidores con varias GPU de gama alta. Documento que sostiene la cifra.

China consolida su peso en los modelos abiertos

El anuncio refuerza una tendencia clara: varios de los avances más ambiciosos en modelos con pesos accesibles están llegando de laboratorios chinos. DeepSeek, Qwen de Alibaba y ahora Moonshot AI han convertido la apertura de pesos y los modelos de expertos en una vía para competir con los sistemas estadounidenses cerrados.

Kimi K2 no elimina la ventaja de quienes controlan los modelos propietarios más potentes ni demuestra por sí solo que un equipo pueda sustituirlos sin costes. Pero sí cambia la conversación para las compañías que necesitan control sobre sus datos, ajustes propios o independencia de un único proveedor. La próxima prueba será menos vistosa que el anuncio: comprobar si sus resultados de benchmark se reproducen en proyectos reales y si el modelo mantiene ese rendimiento fuera de entornos cuidadosamente preparados.

Cómo convertir el titular en una comprobación

El primer paso es congelar la identidad del sistema. Moonshot AI publicó la tarjeta y los pesos de Kimi K2 Instruct. Un nombre comercial puede cubrir revisiones, rutas automáticas y herramientas distintas. La ficha de prueba debe guardar fecha, modalidad de acceso, configuración, permisos y salida completa. Sin esa fotografía, una mejora o un fallo observado hoy no puede atribuirse con rigor a la versión que otra persona usará mañana.

Después hay que convertir cómo convertir una ficha de mezcla de expertos en requisitos y pruebas de uso en casos con criterio de aceptación. Se prepara una muestra propia que incluya tareas fáciles, ambiguas, largas y deliberadamente imposibles. Se anota qué entrada recibe el modelo, qué información puede consultar y qué resultado sería suficiente. Una demostración elegida por el proveedor enseña posibilidad; una batería conservada por el usuario mide fiabilidad.

La autonomía requiere una escala de permisos. Leer y proponer no es lo mismo que modificar, enviar o comprar. La configuración segura concede primero acceso de solo lectura, exige una vista previa y reserva la ejecución para una aprobación explícita. También conserva un registro y una vía de deshacer. El modelo se juzga por los errores que el sistema contiene, no por la confianza con la que describe su plan.

Qué debe quedar registrado

Coste y calidad deben medirse juntos. Una respuesta barata que obliga a revisar desde cero puede costar más que otra lenta pero verificable. La medición incluye espera, reintentos, consumo, supervisión humana y consecuencias de un fallo. el total de parámetros describe arquitectura; no equivale a memoria activa, velocidad ni calidad. Esa frontera convierte el anuncio en una hipótesis que puede comprobarse en lugar de una promesa que deba creerse.

Una ficha de evidencia separa cuatro columnas: lo que afirma la fuente, lo que muestra, lo que no midió y qué tendría que ocurrir para cambiar la conclusión. Esa disciplina evita que una ausencia se convierta en promesa y que una condición desaparezca al resumir. También permite actualizar la pieza sin reescribir la historia desde el resultado posterior.

Conviene incluir un caso negativo antes de decidir. Se busca una situación donde el sistema, norma, operación o estudio no resuelva la necesidad y se anota la señal que obligaría a parar. Los éxitos seleccionados muestran que algo puede ocurrir; el caso negativo revela el límite y reduce el coste de descubrirlo después del despliegue.

La capacidad que sobrevive al anuncio

La comparación válida conserva denominador y eje. No enfrenta una cifra puntual con un promedio, una capacidad futura con una instalada ni una predicción con una observación. Cuando dos fuentes usan palabras parecidas, se reconstruye qué contaron y durante qué periodo. Si no coinciden, se publican como medidas distintas en vez de fabricar una clasificación.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Artículos relacionados

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña
Modelos de lenguaje

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña

«Cuánta GPU hace falta» es la pregunta equivocada. Cómputo, datos y conocimiento no se suman: son tres puertas en serie, y la que casi nadie pasa no es la del hardware. Con el precio real de hoy, el corpus real de un modelo abierto y el cuaderno de bitácora real de un entrenamiento de 175.000 millones de parámetros, esta pieza hace la cuenta completa — y te dice en qué escalón estás tú.

7 min
Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no
Modelos de lenguaje

Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no

En 2023, un equipo de investigadores le pidió a ChatGPT que repitiera la palabra 'poema' sin parar, y el modelo acabó recitando 'El cuervo' de Poe palabra por palabra. Eso no prueba que los modelos guarden una copia de internet, pero tampoco que nunca memoricen nada: las dos afirmaciones son ciertas según el caso. Las cuatro preguntas que separan una demanda seria de un titular vacío.

7 min

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar