IA 360
Gemini

Google estrena Gemini 1.5 Pro con un millón de tokens

Google DeepMind presenta Gemini 1.5 Pro, un modelo capaz de manejar hasta un millón de tokens de contexto en pruebas. El salto permite analizar documentos, vídeo, audio y código a una escala hasta ahora poco habitual.

5 min de lectura Generado con IA Read in English
Google estrena Gemini 1.5 Pro con un millón de tokens

El 15 de febrero de 2024, Google presentó Gemini 1.5 Pro con una ventana estándar de 128.000 tokens y una modalidad experimental de hasta un millón para un grupo limitado. El anuncio de Google publica ejemplos y resultados propios; “cabe en el contexto” no significa “el modelo lo entiende, lo recupera y razona bien sobre ello”.

En términos prácticos, Google calcula que ese límite equivale a unos 700.000 términos, 11 horas de audio, una hora de vídeo o decenas de miles de líneas de código. El modelo no solo recibe texto: Gemini 1.5 Pro conserva el carácter multimodal de Gemini y puede combinar texto, imágenes, audio y vídeo en una misma petición.

Un contexto más de treinta veces mayor que el de Gemini 1.0

La ventana de contexto es el espacio de trabajo temporal de un modelo. Determina cuánto material puede leer y relacionar antes de responder. No debe confundirse con una memoria permanente: que el sistema procese un libro durante una consulta no significa que vaya a recordarlo en conversaciones futuras.

Gemini 1.0 Pro, presentado por Google en diciembre, ofrecía una ventana de contexto de unos 32.000 tokens. Gemini 1.5 Pro eleva esa cifra a un millón: más de treinta veces el límite anterior. Google DeepMind también está probando contextos de hasta 10 millones de tokens en investigación, aunque esa capacidad no forma parte de la vista previa anunciada para desarrolladores y empresas.

Hasta ahora, los modelos con grandes ventanas de contexto habían mostrado que podían aceptar documentos muy extensos, pero no siempre que sabían usar con precisión la información situada al principio o en medio de ese material. El desafío no es únicamente almacenar más texto, sino recuperar el dato pertinente y razonar sobre él sin perderse entre miles de páginas.

Google afirma que Gemini 1.5 Pro mantiene una recuperación casi perfecta en sus pruebas de búsqueda de información dentro de grandes volúmenes de contenido, incluidas combinaciones de texto, audio y vídeo. Son evaluaciones elaboradas por la propia compañía, por lo que habrá que comprobar su comportamiento en tareas reales y con información menos estructurada.

Mezcla de expertos: activar solo una parte del modelo

La otra novedad técnica es su arquitectura de mezcla de expertos, conocida como MoE por sus siglas en inglés. En lugar de activar todos los componentes internos del modelo para cada petición, un sistema de selección deriva cada fragmento de la tarea hacia los "expertos" más adecuados.

La idea permite aumentar la capacidad total del modelo sin que cada respuesta requiera usar todos sus parámetros. Google ya empleó este enfoque en investigaciones previas y otras compañías lo utilizan en algunos de sus modelos, pero Gemini 1.5 Pro lo sitúa en un producto de primer nivel de la compañía.

Google sostiene que el modelo alcanza un rendimiento comparable al de Gemini 1.0 Ultra, su versión más potente hasta la fecha, pese a que Gemini 1.5 Pro se define como un modelo de tamaño intermedio. La empresa no ha publicado el número de parámetros de esta versión, una cifra que por sí sola tampoco permite medir de forma fiable la utilidad de un modelo.

Del análisis de contratos al mantenimiento de software

Un millón de tokens abre posibilidades claras para quienes trabajan con información extensa. Un despacho podría pedir al modelo que compare un contrato con cientos de documentos relacionados. Una empresa podría analizar una transcripción completa de reuniones, manuales internos y correos seleccionados sin dividirlos en fragmentos. Un equipo de programación podría ofrecer al sistema una base de código amplia para localizar dependencias o explicar el efecto de un cambio.

También hay aplicaciones audiovisuales. Un modelo que reciba una hora de vídeo puede responder preguntas sobre una secuencia concreta, localizar un elemento que aparece brevemente o relacionar una explicación oral con una diapositiva mostrada más tarde.

Pero el contexto largo no elimina los límites habituales de la IA generativa. El modelo puede interpretar mal una instrucción, inventar una respuesta plausible o pasar por alto una excepción importante. En ámbitos jurídicos, financieros o médicos, su salida seguirá necesitando revisión humana y acceso controlado a los datos.

Disponible primero para un grupo limitado

Gemini 1.5 Pro llega inicialmente en vista previa privada para desarrolladores y clientes empresariales a través de AI Studio y Vertex AI, las plataformas de Google para crear y desplegar aplicaciones de IA. La compañía ha abierto una lista de espera para quienes quieran probar la ventana de un millón de tokens.

El anuncio coloca el tamaño del contexto como una de las principales áreas de competencia entre los grandes laboratorios. Durante el último año, la carrera se ha centrado en que los modelos redacten, programen y razonen mejor; ahora también importa cuánto material pueden manejar de una vez. La prueba decisiva será si esa escala se traduce en respuestas fiables, rápidas y asumibles en coste para las empresas que quieran incorporarla a sus herramientas.

Contexto disponible no es memoria fiable

Un token es una unidad del modelo, no una palabra ni una página. La misma ventana admite cantidades distintas según idioma, código, formato y contenido. Además, el límite solo indica lo que puede enviarse en una petición. No garantiza que el sistema encuentre una cláusula pequeña, conecte hechos alejados o ignore una instrucción hostil escondida en un documento.

Para medir recuperación se insertan hechos únicos en posiciones distintas y se pide citar el fragmento exacto. Para medir razonamiento se distribuyen premisas que deben combinarse y se añaden distractores o versiones contradictorias. Las dos pruebas deben separarse: repetir una frase oculta no demuestra comprender un expediente, y razonar bien sobre un extracto no demuestra encontrarlo dentro del conjunto.

Una ventana larga cambia el diseño de la aplicación

Enviar todos los archivos puede simplificar un prototipo, pero aumenta coste, latencia y superficie de privacidad. Un sistema de recuperación selecciona fragmentos antes de llamar al modelo y deja un rastro más claro de qué documentos influyeron. La decisión entre contexto completo y recuperación debe probarse con la misma colección, consultas y criterio de exactitud.

También importa el orden. Un modelo puede atender mejor el principio y el final que la zona central, o dejarse guiar por una instrucción incluida dentro de un archivo. Las aplicaciones deben delimitar datos y órdenes, registrar procedencia y exigir citas que el usuario pueda abrir. Más capacidad de entrada amplía tanto el material útil como el material capaz de confundir.

La capacidad transferible es evaluar contexto largo en cuatro capas: cabida, recuperación, razonamiento y coste. Conserva posición de la evidencia, respuesta, cita y tiempo. Ese protocolo sigue siendo válido cuando el siguiente modelo anuncie una ventana aún mayor y evita convertir una cifra de capacidad en una promesa de comprensión.

La prueba debe incluir también abstención. Si la evidencia necesaria no está en los documentos, el modelo debería decirlo en vez de completar el hueco con conocimiento previo. Se añaden preguntas imposibles y se puntúa si distingue ausencia de dificultad. Un sistema que siempre responde puede parecer útil mientras fabrica justo los detalles que una ventana larga pretendía reunir.

Finalmente se repite tras una actualización. Los servicios comerciales pueden cambiar sin que la aplicación modifique su código, de modo que versión, fecha y configuración forman parte del resultado. Conservar casos y salidas detecta regresiones y evita atribuir a “Gemini” una conducta que pertenecía a una revisión concreta.

En documentos vivos se guarda la fecha de cada fuente. Una ventana amplia puede contener versiones incompatibles y producir una síntesis fluida que no respete cuál sustituyó a cuál. Pedir una tabla de documento, revisión y cita antes del resumen convierte el contexto en una cadena verificable.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar