IA 360
Actualidad

Anthropic lanza Claude Sonnet 4.5 para código y agentes

Claude Sonnet 4.5 mejora la programación, el uso autónomo del ordenador y las tareas prolongadas. Anthropic mantiene el precio de Sonnet 4 y abre a terceros la tecnología de Claude Code.

6 min de lectura Generado con IA Read in English
Anthropic lanza Claude Sonnet 4.5 para código y agentes

El 29 de septiembre de 2025, Anthropic presentó Claude Sonnet 4.5 para programación, agentes y uso del ordenador. La fuente original sostiene el núcleo documental del hecho; las comparaciones de rendimiento y autonomía son mediciones del fabricante bajo configuraciones concretas.

Un salto en programación que necesita contexto

Sonnet 4.5 obtiene un 77,2% en SWE-bench Verified, de acuerdo con las evaluaciones publicadas por Anthropic. Esta prueba utiliza 500 incidencias reales y revisadas de proyectos alojados en GitHub: el modelo debe entender el repositorio, localizar el problema y producir un cambio de código que supere las comprobaciones correspondientes. Documento que sostiene la cifra.

Es uno de los indicadores más utilizados para comparar modelos de programación, aunque no equivale al trabajo cotidiano de un desarrollador. Un resultado correcto en el banco de pruebas no mide por sí solo la calidad del diseño, la seguridad del código, el mantenimiento posterior o la capacidad para aclarar requisitos ambiguos con un cliente.

Anthropic asegura además haber observado que Sonnet 4.5 mantiene el foco durante más de 30 horas en tareas complejas con múltiples pasos. La formulación importa: no significa que cualquier encargo pueda dejarse funcionando durante ese tiempo sin supervisión, sino que el modelo ha sostenido determinados procesos prolongados dentro de la infraestructura y las pruebas de la empresa. Documento que sostiene la cifra.

El avance encaja con el cambio que vive la programación asistida por IA. Los primeros copilotos completaban líneas o generaban funciones aisladas. Las herramientas actuales pueden explorar un repositorio, modificar varios archivos, ejecutar pruebas, consultar documentación y corregir sus propios errores. Es un trabajo más parecido al de un agente que al de un autocompletado.

Claude aprende a manejar mejor un ordenador

La otra cifra relevante procede de OSWorld, un banco de pruebas que evalúa tareas realizadas sobre interfaces informáticas reales. Sonnet 4.5 alcanza un 61,4%, frente al 42,2% obtenido por Sonnet 4 cuatro meses antes. Son 19,2 puntos porcentuales de mejora. Documento que sostiene la cifra.

Esta capacidad permite que Claude navegue por páginas, complete hojas de cálculo o interactúe con aplicaciones mediante sus interfaces. Anthropic la está aplicando en su extensión Claude for Chrome, disponible desde hoy para suscriptores Max que se apuntaron a la lista de espera.

El uso autónomo del ordenador amplía mucho las aplicaciones posibles, pero también aumenta el riesgo. Un agente con acceso al navegador puede encontrarse instrucciones maliciosas escondidas en una web, un correo o un documento. Es lo que se conoce como inyección de instrucciones: contenido externo diseñado para desviar al modelo de la orden original y conseguir que revele información o ejecute acciones indebidas.

Anthropic afirma haber reforzado las defensas frente a estos ataques. Aun así, las empresas tendrán que limitar permisos, registrar las acciones y exigir confirmación humana antes de operaciones sensibles como enviar mensajes, borrar archivos, publicar cambios o realizar pagos.

Claude Code incorpora puntos de restauración

El lanzamiento viene acompañado de cambios en Claude Code, la herramienta de programación de Anthropic. La principal novedad son los checkpoints o puntos de restauración, que guardan el progreso y permiten regresar de inmediato a un estado anterior si el agente introduce un cambio problemático.

También llegan una interfaz de terminal renovada y una extensión nativa para Visual Studio Code. En la API, Anthropic añade edición del contexto y una herramienta de memoria para que los agentes administren mejor la información durante tareas largas. En las aplicaciones de Claude, el modelo puede ejecutar código y crear hojas de cálculo, presentaciones y documentos dentro de la conversación.

Los checkpoints responden a un problema práctico de los agentes de programación: cuanto más tiempo trabajan y más archivos modifican, mayor es el coste de una decisión equivocada. Poder retroceder reduce ese riesgo, aunque no sustituye al control de versiones, las pruebas automatizadas ni la revisión humana.

El motor de Claude Code se abre a otros desarrolladores

Anthropic también ha presentado Claude Agent SDK, un paquete para construir agentes con la misma base tecnológica utilizada en Claude Code. Incluye mecanismos para gestionar memoria, permisos y subagentes que colaboran en una tarea común.

La apuesta va más allá de vender acceso a un modelo. Anthropic quiere proporcionar la infraestructura necesaria para convertirlo en un sistema capaz de actuar: decidir qué herramienta utilizar, conservar información relevante y repartir el trabajo entre varios procesos. El SDK no está limitado a programación y puede aplicarse, por ejemplo, al análisis documental, la investigación o la automatización interna de una empresa.

Para los desarrolladores, Sonnet 4.5 está disponible desde hoy en la API con el identificador claude-sonnet-4-5. Mantener las tarifas de Sonnet 4 facilita sustituir el modelo anterior sin elevar el precio por token, aunque el coste total dependerá de cuántos pasos, llamadas a herramientas y reintentos necesite cada agente.

Más capacidad, pero también mayores medidas de seguridad

Sonnet 4.5 se despliega bajo las protecciones AI Safety Level 3 de Anthropic. Este nivel interno exige salvaguardas adicionales ante capacidades que podrían elevar el riesgo relacionado con armas químicas, biológicas, radiológicas o nucleares.

Entre esas medidas figuran clasificadores que examinan entradas y respuestas potencialmente peligrosas. Anthropic reconoce que estos filtros pueden bloquear contenido legítimo y permite continuar determinadas conversaciones con Sonnet 4, al que atribuye un riesgo menor en este ámbito. La empresa afirma haber reducido los falsos positivos diez veces desde que describió inicialmente el sistema y a la mitad desde el lanzamiento de Claude Opus 4 en mayo.

La compañía también comunica mejoras frente a conductas como la adulación excesiva al usuario, el engaño, la búsqueda de poder o el refuerzo de ideas delirantes. Son resultados de evaluaciones propias recogidas en la ficha de seguridad del modelo; la experiencia con despliegues reales permitirá comprobar cómo se trasladan a conversaciones y agentes con acceso a herramientas.

Sonnet 4.5 refuerza así el terreno comercial más disputado de la IA generativa: sistemas que no se limitan a responder, sino que modifican código y operan aplicaciones. Para las empresas, la decisión ya no dependerá solo de qué modelo acierta más en un benchmark, sino de cuánto trabajo completa por euro, qué errores comete y qué controles ofrece cuando actúa sobre sistemas reales.

Cómo convertir el titular en una comprobación

El primer paso es congelar la identidad del sistema. Anthropic presentó Claude Sonnet 4.5 para programación, agentes y uso del ordenador. Un nombre comercial puede cubrir revisiones, rutas automáticas y herramientas distintas. La ficha de prueba debe guardar fecha, modalidad de acceso, configuración, permisos y salida completa. Sin esa fotografía, una mejora o un fallo observado hoy no puede atribuirse con rigor a la versión que otra persona usará mañana.

Después hay que convertir si conviene delegarle cambios de código o acciones sobre un ordenador en casos con criterio de aceptación. Se prepara una muestra propia que incluya tareas fáciles, ambiguas, largas y deliberadamente imposibles. Se anota qué entrada recibe el modelo, qué información puede consultar y qué resultado sería suficiente. Una demostración elegida por el proveedor enseña posibilidad; una batería conservada por el usuario mide fiabilidad.

La autonomía requiere una escala de permisos. Leer y proponer no es lo mismo que modificar, enviar o comprar. La configuración segura concede primero acceso de solo lectura, exige una vista previa y reserva la ejecución para una aprobación explícita. También conserva un registro y una vía de deshacer. El modelo se juzga por los errores que el sistema contiene, no por la confianza con la que describe su plan.

Qué debe quedar registrado

Coste y calidad deben medirse juntos. Una respuesta barata que obliga a revisar desde cero puede costar más que otra lenta pero verificable. La medición incluye espera, reintentos, consumo, supervisión humana y consecuencias de un fallo. las comparaciones de rendimiento y autonomía son mediciones del fabricante bajo configuraciones concretas. Esa frontera convierte el anuncio en una hipótesis que puede comprobarse en lugar de una promesa que deba creerse.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar