Anthropic lanza Claude 3.5 Sonnet, más capaz que Opus y más barato
Anthropic presenta Claude 3.5 Sonnet, un modelo que supera a Claude 3 Opus en varias pruebas pese a costar mucho menos. También estrena Artifacts, un espacio para trabajar sobre código y documentos generados.
El 20 de junio de 2024, Anthropic presentó Claude 3.5 Sonnet y Artifacts, un espacio lateral para trabajar con el resultado del modelo. El anuncio técnico de Anthropic publica precio, velocidad y evaluaciones frente a otros modelos; son mediciones del fabricante y sirven como punto de partida, no como prueba de que el sistema gane en cualquier tarea.
El lanzamiento llega acompañado de Artifacts, una nueva función de Claude.ai que separa el resultado útil de la conversación. En lugar de dejar un documento, una página web o un bloque de código perdido entre mensajes, Claude lo muestra en un espacio propio para poder verlo, modificarlo y reutilizarlo.
Más rendimiento con el precio de Sonnet
Claude 3.5 Sonnet mantiene el precio de Claude 3 Sonnet: 3 dólares por cada millón de tokens de entrada y 15 dólares por cada millón de tokens de salida. Los tokens son las unidades de texto que usan estos sistemas para leer instrucciones y producir una respuesta.
Claude 3 Opus, en cambio, cuesta 15 dólares por millón de tokens de entrada y 75 dólares por millón de tokens de salida. Es decir, 3.5 Sonnet se sitúa como una alternativa mucho más asequible al modelo de gama alta de Anthropic, sin renunciar a competir con él en capacidad.
La empresa afirma además que el nuevo modelo funciona a aproximadamente el doble de velocidad que Opus. Para quien utiliza un chatbot de forma ocasional, esa diferencia puede parecer secundaria. Para una empresa que procesa miles de documentos, atiende clientes o integra el modelo en una aplicación, precio y velocidad determinan si una función es viable fuera de una demostración.
En su evaluación interna de tareas de programación con herramientas, Anthropic indica que Claude 3.5 Sonnet resolvió el 64% de los problemas, frente al 38% de Claude 3 Opus. Este tipo de prueba mide la capacidad de un modelo para abordar incidencias reales de software, donde no basta con completar unas líneas de código: debe localizar archivos, interpretar un error y proponer cambios coherentes.
La comparación conviene leerla con cautela. Los benchmarks permiten medir avances y contrastar modelos, pero no sustituyen las pruebas en el trabajo concreto de cada usuario. Un asistente puede rendir muy bien en una batería de ejercicios y seguir cometiendo errores al interpretar datos incompletos, aplicar una norma interna o generar código que parece correcto sin serlo.
Artifacts saca el trabajo de la ventana de chat
La novedad más visible para los usuarios de Claude.ai es Artifacts. Cuando la conversación produce contenido suficientemente extenso y autónomo —por ejemplo, código, un informe, un diagrama SVG o una pequeña web—, Claude puede abrirlo en un panel situado junto al chat.
El cambio parece de interfaz, pero afecta a la forma de usar un asistente. Los chats tradicionales mezclan instrucciones, respuestas, correcciones y versiones sucesivas en una única secuencia. Encontrar el resultado final puede resultar incómodo, especialmente cuando se trabaja sobre una aplicación sencilla o un documento con varias revisiones.
Con Artifacts, el usuario puede revisar el resultado mientras sigue conversando con el modelo. Si Claude crea una página HTML, el espacio puede mostrar el código y una vista del resultado; si redacta un documento, este queda separado de las explicaciones que llevaron a producirlo. La función está disponible en vista previa para los usuarios de Claude.ai.
Anthropic no inventa la idea de un lienzo de trabajo junto al chat. Microsoft y Google ya han explorado interfaces que combinan generación de texto, edición y ejecución de código. Pero la incorporación de este formato a Claude apunta a una competición que ya no consiste únicamente en responder mejor que el rival. Los grandes laboratorios quieren que el usuario haga el trabajo entero dentro de su producto.
Una estrategia distinta a reservar lo mejor para la gama alta
El movimiento de Anthropic tiene una lectura comercial clara. En vez de colocar su modelo más capaz en el escalón de precio más alto, la compañía mejora su opción intermedia. Eso aumenta la presión sobre proveedores que separan con más claridad sus modelos premium de los más baratos.
Para desarrolladores y empresas, la promesa es atractiva: obtener un nivel de razonamiento cercano o superior al de un modelo de élite sin multiplicar la factura de infraestructura. Para Anthropic, el reto será demostrar que esa ventaja se mantiene en usos cotidianos y no solo en sus evaluaciones publicadas.
Claude 3.5 Sonnet ya está disponible a través de Claude.ai y de la API de Anthropic. La compañía ha adelantado que prepara nuevas versiones de Claude 3.5 Haiku y Claude 3.5 Opus, además de más funciones para Artifacts. De momento, el lanzamiento desplaza la atención desde el modelo más grande hacia una pregunta más práctica: cuánto rendimiento útil puede ofrecer un asistente antes de que su coste deje de tener sentido.
La tabla del fabricante es una hipótesis de trabajo
Una comparación útil empieza por copiar tarea, conjunto de datos, versión, instrucción, herramientas permitidas y regla de puntuación. “Supera a Opus” resume una tabla; no dice si el margen se mantiene con documentos propios, español, código privado o solicitudes ambiguas. Cuando falte un dato del protocolo, se anota como desconocido en vez de rellenarlo con la reputación del modelo.
Las pruebas internas de programación requieren especial cuidado. Resolver una incidencia puede significar localizar el archivo, modificarlo y superar verificaciones preparadas por el evaluador. Antes de comprar esa cifra se repite una muestra con repositorios del equipo, pruebas ocultas y revisión de regresiones. Una solución que pasa el examen pero rompe otra ruta no es una solución útil.
Precio por token no es coste de la tarea
El coste real se calcula con entrada, salida, reintentos, llamadas a herramientas, caché, tiempo de revisión y porcentaje de trabajos aceptados. Un modelo barato que exige tres intentos puede costar más que otro caro que termina a la primera. También importa la latencia sostenida: velocidad declarada y tiempo de una sesión con archivos, red y colas no son la misma medida.
La prueba conserva veinte o treinta encargos representativos y un resultado de referencia. Se ejecutan con temperatura y límites comparables; después se miden exactitud, edición humana, segundos y coste total. Esa ficha permite detectar si una actualización mejora el promedio a costa de fallos raros pero graves.
Artifacts añade un objeto que hay que gobernar
Separar el resultado del chat facilita revisar y reutilizar, pero no convierte código o documentos en material validado. Un artefacto ejecutable se trata como cualquier contribución externa: permisos mínimos, dependencias inspeccionadas, pruebas, historial de cambios y una persona responsable de aprobarlo. La vista previa enseña una interfaz, no su seguridad.
En documentos, se comprueban citas, números y diferencias entre versiones. En código, se evita introducir secretos en la conversación y se ejecuta en un entorno aislado antes de tocar producción. La capacidad transferible es evaluar un modelo por una cartera propia de tareas y por coste aceptado, no por una tabla agregada. Así, una mejora de producto se convierte en decisión reproducible y no en entusiasmo prestado.
La adopción se revisa después del piloto. Si el equipo usa Artifacts para crear pequeñas aplicaciones, se cuentan los cambios aceptados sin corrección, los defectos descubiertos después y el tiempo de mantenimiento. El valor de una interfaz no está en producir más borradores, sino en aumentar resultados que alguien puede conservar con responsabilidad clara.
La decisión final cabe en una tabla breve: tarea, modelo y fecha, calidad mínima, coste máximo, latencia, riesgo y alternativa manual. El equipo la firma antes de ampliar uso y la vuelve a medir tras cada cambio de versión. Así no confunde una buena primera impresión con una capacidad estable ni queda atado a una comparación antigua.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.