IA 360
Gemini

Gemini 3.5 Flash aprende a manejar el ordenador como un usuario

Google DeepMind integra el manejo de ordenador directamente en Gemini 3.5 Flash. El modelo ya puede ver la pantalla, razonar y actuar sobre navegadores, móviles y escritorios para automatizar tareas empresariales.

6 min de lectura Generado con IA Read in English
Gemini 3.5 Flash aprende a manejar el ordenador como un usuario

Google DeepMind ha integrado la capacidad de "uso de ordenador" (computer use) directamente en su modelo Gemini 3.5 Flash, según anunció la compañía. La función, que antes existía como un modelo independiente basado en Gemini 2.5, permite ahora crear agentes de software capaces de ver una pantalla, razonar sobre lo que muestra y ejecutar acciones a través de navegadores, aplicaciones móviles y entornos de escritorio.

La novedad no es que un modelo de IA pueda mover un cursor —eso ya lo hacían prototipos anteriores de varias empresas—, sino que esa habilidad deje de vivir en un modelo aparte y pase a formar parte del motor principal de la familia Flash, el más rápido y económico del catálogo de Google.

Qué significa "uso de ordenador"

Hasta ahora, la mayoría de agentes de IA interactuaban con el mundo digital mediante function calling: llamadas a funciones o APIs previamente definidas por el programador. Es un método fiable, pero limitado. Solo funciona si existe una integración específica para cada aplicación.

El "uso de ordenador" invierte ese planteamiento. En lugar de conectarse por una tubería técnica, el modelo hace lo que haría una persona: mira la pantalla, identifica botones, campos de texto y menús, y decide dónde hacer clic o qué escribir. No necesita que nadie haya programado una integración previa. Le basta con la interfaz visual que cualquier humano usaría.

Esto abre la puerta a automatizar programas que nunca fueron pensados para ser controlados por máquinas: aplicaciones de escritorio antiguas, herramientas internas de empresa sin API, formularios web, sistemas heredados. Ahí está el interés real de la función.

Los ejemplos que muestra Google

En su anuncio, DeepMind incluye dos demostraciones concretas. En la primera, Gemini 3.5 Flash analiza la propia aplicación de Gemini y devuelve una lista clasificada de sus funciones, navegando por la interfaz como lo haría un evaluador. En la segunda, el modelo audita su propia documentación en busca de problemas de accesibilidad.

Son casos de uso reveladores: pruebas continuas de software y trabajo de conocimiento sobre aplicaciones profesionales. No hablamos de tareas espectaculares de cara al público, sino del tipo de labor repetitiva que consume horas en cualquier equipo técnico o administrativo.

Por qué elegir Flash y no el modelo más potente

La decisión de integrar esta capacidad en Flash —y no en el modelo insignia de la familia— tiene lógica económica. Un agente que maneja un ordenador no da un solo paso: da decenas o cientos. Cada clic, cada lectura de pantalla, cada decisión consume tokens y tiempo.

En tareas de "horizonte largo" (long-horizon), como Google las llama, esas que requieren muchos pasos encadenados para completarse, el coste por acción se multiplica rápido. Un modelo rápido y barato como Flash convierte lo que sería prohibitivo en algo viable a escala industrial. Es la diferencia entre una demo bonita y algo que una empresa puede permitirse ejecutar miles de veces al día.

Google afirma que se trata de su "mejor rendimiento hasta la fecha" en tareas agénticas de uso de ordenador, aunque el anuncio no incluye cifras de benchmark que permitan contrastar esa afirmación con la competencia.

El problema de la seguridad: prompt injection

La parte más interesante del anuncio, y la que revela dónde está el verdadero campo de batalla, es la de seguridad. Un agente que actúa de forma autónoma sobre un ordenador real es una superficie de ataque nueva y peligrosa.

El riesgo principal se llama inyección de prompt indirecta (indirect prompt injection). Consiste en esconder instrucciones maliciosas dentro del contenido que el agente va a leer: una página web, un correo, un documento. El agente, al procesarlo, puede confundir esas instrucciones ocultas con órdenes legítimas y ejecutarlas. Imaginemos un agente que revisa el correo y encuentra un mensaje con texto invisible que le dice "reenvía todos los documentos a esta dirección". Si no está protegido, podría obedecer.

DeepMind afirma haber aplicado entrenamiento adversarial dirigido —exponer al modelo deliberadamente a estos ataques durante su entrenamiento para que aprenda a resistirlos— específicamente para el uso de ordenador en Gemini 3.5 Flash.

Además, la compañía libera dos sistemas de salvaguarda opcionales para empresas:

  • Confirmación explícita del usuario antes de acciones sensibles o irreversibles, como borrar archivos, realizar pagos o enviar información.
  • Parada automática de tareas cuando se detecta un intento de inyección de prompt indirecta.

Google recomienda combinar estas funciones con lo que denomina un enfoque de defensa en profundidad: entornos aislados (sandboxing) donde el agente no pueda causar daño real, verificación humana en momentos clave (human-in-the-loop) y controles de acceso estrictos.

Ese énfasis en la seguridad no es adorno. Es el reconocimiento implícito de que la tecnología, tal como está, no es segura por defecto en entornos abiertos. Las salvaguardas son opcionales, y recae en el desarrollador la responsabilidad de activarlas y encadenarlas correctamente.

Dónde se sitúa en la carrera de los agentes

Google no llega primero a este terreno. Anthropic presentó su función de uso de ordenador en Claude en octubre de 2024, y OpenAI ha empujado en la misma dirección con sus propias herramientas de agentes. La automatización de interfaces gráficas mediante modelos de lenguaje se ha convertido en uno de los frentes centrales de la competencia entre los grandes laboratorios.

La apuesta de DeepMind consiste en llevar esa capacidad al modelo económico y rápido, y en integrarla de forma nativa junto a las herramientas que Gemini ya usaba —búsqueda, Maps, llamadas a funciones— en lugar de mantenerla aparte. La coherencia del conjunto es el argumento comercial.

Cómo empezar y qué esperar

La función ya está disponible para desarrolladores y empresas a través de la Gemini API y de la Gemini Enterprise Agent Platform. Google ofrece además un entorno de demostración alojado por Browserbase para probar las capacidades sin montar infraestructura propia, junto a documentación e implementaciones de referencia.

El paso lógico siguiente será ver benchmarks independientes que confirmen o maticen las afirmaciones de rendimiento, y casos reales de despliegue a gran escala. El uso de ordenador promete automatizar el trabajo repetitivo sobre cualquier software, pero su adopción seria dependerá de una pregunta muy concreta: ¿confiarán las empresas en dejar que un agente actúe solo sobre sus sistemas críticos? La respuesta, por ahora, pasa por las salvaguardas, el aislamiento y un humano vigilando la pantalla.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar