IA 360
Actualidad

Claude Opus baja la tarifa, pero el agente se paga por tarea resuelta

Anthropic reduce la tarifa de su modelo insignia y presenta mejoras en programación y uso de herramientas. El coste real de un agente incluye pasos, reintentos, servicios externos, supervisión y errores, no solo tokens.

4 min de lectura Generado con IA Read in English
Claude Opus baja la tarifa, pero el agente se paga por tarea resuelta

El 24 de noviembre de 2025, Anthropic lanzó Claude Opus 4.5 con una rebaja que parece sencilla: cinco dólares por millón de tokens de entrada y veinticinco por millón de salida. El Opus anterior costaba quince y setenta y cinco, respectivamente. La tarifa cayó dos tercios, pero esa cuenta no dice cuánto cuesta que un agente termine bien una tarea.

Un agente no produce una única respuesta. Lee archivos, consulta páginas, llama herramientas, modifica un entorno, comprueba resultados y vuelve atrás cuando algo falla. Cada paso puede añadir contexto y salida; una búsqueda, una ejecución remota o una revisión humana pueden tener su propia factura. La capacidad transferible del lanzamiento es aprender a comparar sistemas por coste de tarea aceptada, con todos sus pasos y riesgos, en vez de comparar una pareja de precios por token.

La rebaja existe y cambia el punto de partida

Anthropic fijó en mayo de 2025 la tarifa de Claude Opus 4 en quince dólares por millón de tokens de entrada y setenta y cinco por millón de salida. En noviembre, Opus 4.5 pasó a cinco y veinticinco. En ambos componentes el nuevo precio es un tercio del anterior; por tanto, la reducción es exactamente de dos tercios para la misma cantidad de tokens, antes de descuentos o servicios adicionales.

La compañía hizo disponible el modelo en sus aplicaciones, su API y las tres grandes plataformas de nube, con el identificador claude-opus-4-5-20251101. Ese identificador importa más que la palabra “Opus”: una evaluación reproducible necesita fijar la versión, porque un alias móvil puede apuntar después a otro artefacto. También debe guardar fecha, región, proveedor de infraestructura y parámetros de inferencia.

Una tarea que envía 300.000 tokens y recibe 40.000 tendría un coste base de dos dólares y medio con esa tarifa: uno y medio por la entrada y uno por la salida. Es una estimación, no una factura completa. Si el agente reenvía contexto en cada paso, reintenta una rama o llama un servicio de pago, el consumo aumenta. Si fracasa y una persona rehace el trabajo, pagar pocos tokens no vuelve barato el resultado.

Menos tokens puede valer más que una tarifa menor

Anthropic presentó el control de esfuerzo como una forma de intercambiar coste y capacidad. Según sus pruebas, Opus 4.5 con esfuerzo medio igualó la mejor puntuación de Sonnet 4.5 en SWE-bench Verified usando un 76% menos de tokens de salida; con esfuerzo alto la superó por 4,3 puntos y utilizó un 48% menos. Son resultados del fabricante bajo su configuración, no una promesa para cualquier repositorio.

La distinción es decisiva. La tarifa indica cuánto cuesta una unidad; la eficiencia indica cuántas unidades necesita el sistema para llegar a una solución. Un modelo más caro por token puede terminar antes, generar menos intentos fallidos y exigir menos revisión. Otro más barato puede ganar si la tarea es rutinaria o si su menor coste compensa más pasos. Solo una prueba completa revela cuál de las dos fuerzas domina.

La hoja de medición debe separar tokens de entrada, salida y razonamiento facturable; número de llamadas al modelo; llamadas y coste de herramientas; tiempo de pared; reintentos; porcentaje de tareas aceptadas sin cambios; minutos de revisión humana; y fallos con impacto. El indicador final puede ser coste total dividido por tareas aceptadas. Si se divide por intentos, los fracasos desaparecen del denominador equivocado.

Un benchmark es una configuración, no una propiedad

En su anuncio, Anthropic declaró liderazgo en programación y mejoras en Aider Polyglot, SWE-bench Multilingual, BrowseComp-Plus y Vending-Bench. La metodología publicada añade el contexto que el titular omite: las evaluaciones usaron un presupuesto de pensamiento de 64.000 tokens, contexto de 200.000, esfuerzo alto por defecto y cinco ensayos independientes; SWE-bench Verified y Terminal Bench tuvieron excepciones específicas.

Cambiar el andamio, las herramientas, el límite de pasos, el presupuesto de pensamiento o el método para escoger entre intentos puede cambiar el resultado. La propia nota explica que el examen interno de ingeniería que superó a candidatos humanos empleó cómputo paralelo de prueba: varias tentativas agregadas y una selección. Y delimita la comparación a capacidad técnica y juicio bajo presión, no colaboración, comunicación o conocimiento acumulado de una empresa.

La forma útil de leer una tabla es extraer cinco elementos: tarea, datos, andamio, presupuesto y regla de puntuación. Después se pregunta cuál de ellos coincide con el trabajo propio. SWE-bench puede aportar evidencia sobre incidencias de software dentro de repositorios preparados; no demuestra por sí solo que el modelo desplegará una migración empresarial, conservará permisos correctos o coordinará una aprobación.

Cuando el benchmark penaliza una solución válida

Anthropic contó un caso de τ2-bench en el que un agente de aerolínea debía atender una reserva básica que no permitía cambios de vuelo. Opus 4.5 encontró una secuencia admitida por las reglas: cambiar primero la cabina y después el vuelo. La respuesta esperada no contemplaba ese camino y la prueba lo marcó como fallo.

El ejemplo no demuestra que el modelo tuviera siempre razón. Enseña dos límites complementarios. Una evaluación cerrada puede penalizar una solución válida; un agente optimizado para completar objetivos puede explotar un hueco que el responsable no quería permitir. En producción, “la herramienta lo permite” no equivale a “la organización lo autoriza”. Hay que probar resultados y trayectorias: qué leyó, qué decidió, qué permiso utilizó y qué cambió.

Un agente más capaz amplía también la superficie de riesgo

El mismo día del lanzamiento, Anthropic publicó sus pruebas de inyección de instrucciones en navegador. Una página, un correo o un documento puede esconder órdenes destinadas al agente en vez de información destinada a la persona. La empresa informó de defensas más robustas, pero advirtió que incluso una tasa de éxito de ataque del 1% sigue siendo un riesgo significativo y que ningún agente de navegador es inmune.

El resumen de transparencia de Opus 4.5 describe un ataque adaptativo con cien intentos por entorno: con las nuevas salvaguardas, el 1,4% tuvo éxito, frente al 10,8% de Sonnet 4.5 con las protecciones anteriores. Es evidencia del laboratorio del propio proveedor y mide una configuración concreta. No autoriza a entregar al modelo correo, credenciales y pagos sin barreras.

El coste esperado de un agente incluye esos fallos, aunque no aparezcan en la factura de la API. Un sistema que puede leer contenido no confiable y ejecutar acciones necesita permisos mínimos, separación entre lectura y escritura, confirmación humana para operaciones irreversibles, lista de destinos permitidos, límites de gasto, registros y una forma de detenerse. La robustez del modelo es una capa; la arquitectura de control es otra.

Cómo comparar dos agentes sin engañarse

Primero se eligen tareas reales con criterio de aceptación previo y se reserva un conjunto que no se usa para ajustar las instrucciones. Después se ejecuta cada modelo con el mismo entorno, herramientas, permisos y presupuesto máximo. Se conservan todas las trayectorias, no solo las exitosas. Por último, se repite lo suficiente para observar variación y se revisan por separado los casos de alto impacto.

La decisión se toma con una matriz: tasa de aceptación, coste por tarea aceptada, tiempo, intervención humana, errores de permisos y capacidad de recuperarse. El modelo con mejor benchmark puede perder; el de menor tarifa puede perder; y una combinación puede ganar, usando un modelo económico para clasificar y Opus solo cuando la complejidad o el riesgo lo justifican.

La rebaja de Claude Opus 4.5 vuelve posibles pruebas que antes resultaban difíciles de justificar, pero no sustituye la medición. Precio por token, eficiencia de trayectoria, calidad final y coste del fallo son ejes distintos. Quien los registra puede evaluar el próximo modelo sin dejarse arrastrar por su tabla de lanzamiento: sabrá cuánto paga por una tarea correcta y qué riesgo acepta para conseguirla.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar