IA 360
Actualidad

Apple crea réplicas de la web para entrenar agentes visuales

Weblica combina copias HTTP y sitios sintéticos para entrenar agentes que navegan por capturas de pantalla. Sus benchmarks mejoran, pero la web real sigue siendo más compleja.

4 min de lectura Generado con IA Read in English
Apple crea réplicas de la web para entrenar agentes visuales

El 7 de mayo de 2026, investigadores de Apple presentaron Weblica, un marco que convierte interacciones web en entornos locales y repetibles para entrenar agentes visuales. Entrenar a un agente para navegar por la web parece sencillo hasta que se intenta repetir el experimento: las páginas cambian, los formularios caducan, aparecen avisos de cookies, los servidores responden con distinta lentitud y los sistemas antibots interrumpen el recorrido.

El proyecto no enseña a un modelo a leer el código de una página ni a depender del DOM. Parte de capturas de pantalla y acciones por coordenadas, como haría una persona al usar un navegador. Su objetivo es que el agente aprenda a completar flujos de varios pasos —buscar, filtrar, rellenar un formulario o navegar por pestañas— sin que cada sesión dependa de que la web pública se comporte exactamente igual.

Dos formas de replicar la web

Weblica combina dos vías. La primera, Weblica-Cache, registra el tráfico HTTP de una navegación y lo reproduce después. El sistema normaliza parámetros que cambian entre sesiones, como marcas de tiempo o tokens, para que la reproducción funcione incluso sin conexión de red. Solo conserva para entrenamiento las sesiones que el agente logra completar bajo esas condiciones.

La segunda, Weblica-Synth, crea sitios interactivos desde cero. Los autores describen una tubería en la que agentes de programación generan HTML, CSS y JavaScript a partir de una capacidad de navegación, una categoría de sitio y un estilo visual. Los sitios son autocontenidos; sus estados se guardan durante la sesión y se validan con capturas antes de entrar en el conjunto de entrenamiento.

El propósito de esta mezcla es práctico. Las copias HTTP aportan elementos de sitios reales, mientras que los entornos sintéticos permiten producir muchas variantes de una interacción sin esperar a un servidor externo. El artículo cifra en 15.600 los entornos y tareas cacheados que retuvo y en 2.810 los sitios sintéticos generados; de estos últimos, 2.560 se reservaron para entrenamiento y cubrían 44.227 tareas.

Un agente de 8.000 millones de parámetros

Sobre esos entornos, el equipo ajustó modelos Qwen3-VL con aprendizaje supervisado y refuerzo. La recompensa de las tareas abiertas se obtiene con GPT-4o como juez, al que se entregan la instrucción, las acciones y las capturas resultantes. Los autores indican un 88% de acuerdo entre ese juez y evaluaciones humanas, una señal útil pero que también deja claro que no toda la medición descansa en verificadores programáticos.

Su principal modelo, Weblica-8B, obtiene una media del 35,6% en tres benchmarks web en vivo con una sola tentativa de 30 pasos. El modelo base Qwen3-VL-Instruct-8B alcanzaba el 24,8% con el mismo presupuesto: una mejora absoluta de 10,8 puntos. Con más intentos y pasos, el resultado aumenta, pero ese avance también consume más cómputo en el momento de usar el agente. Comparar cifras exige, por tanto, mirar tanto la tasa de éxito como el presupuesto de pasos y reintentos.

El manuscrito informa además de que, con 60 pasos totales, Weblica-8B supera la media de uno de los baselines abiertos comparados con 100 pasos. Es un resultado prometedor para agentes abiertos de interfaz visual, no una demostración de que puedan ejecutar sin supervisión cualquier operación en la red.

Lo que todavía no replica

Los propios autores son explícitos sobre los límites. Una copia cacheada es una instantánea: no recoge los cambios posteriores de una web ni toda la complejidad de una aplicación dinámica. Los sitios sintéticos cubren patrones de navegación, pero conservan una brecha entre simulación y realidad. Y las evaluaciones parten de una meta fija en un único turno, mientras que el uso cotidiano incluye correcciones del usuario, memoria entre sesiones y objetivos que evolucionan.

Esa cautela importa si se piensa en asistentes que compran, reservan o tramitan información. Weblica aporta una infraestructura para entrenar y comparar agentes sin convertir cada prueba en una apuesta contra la red en vivo. El siguiente examen será comprobar cuánto de esa habilidad se conserva cuando cambian el sitio, el contexto y la intención del usuario.

Fuentes de esta pieza

Esta pieza se apoya en 3 fuente(s) primaria(s), recogidas durante la investigación.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar