IA 360
Modelos de lenguaje

Anthropic añade caché de prompts a la API de Claude

Anthropic abrió el 14 de agosto de 2024 la caché de prompts para Claude. La función prometía ahorrar hasta un 90% en la entrada repetida, pero aprovecharla exige separar el contexto estable, medir aciertos y no confundir caché con memoria.

5 min de lectura Generado con IA Read in English
Anthropic añade caché de prompts a la API de Claude

Anthropic abrió el 14 de agosto de 2024 una beta pública de caché de prompts para la API de Claude. La función permite procesar una vez el comienzo estable de una petición —instrucciones, ejemplos, documentación o una conversación extensa— y reutilizarlo en llamadas posteriores. El anuncio original prometía reducir hasta un 90% el coste de esa entrada repetida y hasta un 85% la latencia.

Esas dos cifras describen el mejor caso del fragmento almacenado, no una rebaja automática de toda la petición. La pregunta útil para un equipo no es «¿la caché ahorra un 90%?», sino «¿qué proporción de nuestra entrada permanece idéntica, cuántas veces se reutiliza dentro de la ventana y cuánto cuestan las salidas?». Aprender a descomponer esa factura evita convertir un porcentaje de marketing en un presupuesto falso.

Qué se reutiliza y qué se sigue pagando

Una llamada normal envía de nuevo todo el contexto que el modelo necesita. Si un asistente responde sobre un manual de 50.000 tokens, las instrucciones y ese manual pueden viajar junto a cada pregunta de 500 tokens. El modelo no recuerda el documento entre peticiones independientes por el mero hecho de haberlo leído antes.

La caché cambia el procesamiento del prefijo. El desarrollador coloca primero el contenido común y marca un punto de corte; después sitúa la parte variable. Según la documentación técnica de Anthropic, una coincidencia permite leer el prefijo ya procesado, mientras que un cambio dentro de él invalida desde ese punto la reutilización posterior. La pregunta nueva y la respuesta del modelo siguen teniendo su coste normal.

No es una memoria personal de Claude, una base documental ni entrenamiento con los datos del cliente. Tampoco decide qué fragmentos son relevantes para una consulta. Es una optimización temporal de cómputo sobre el comienzo de una petición. Una base de datos o un sistema de recuperación selecciona información; la caché evita procesar repetidamente la información que la aplicación ya decidió enviar.

En el lanzamiento, la duración predeterminada era de cinco minutos y un acierto renovaba esa vigencia. Por eso encajaba en una sesión activa, una tanda de análisis o varias preguntas sucesivas sobre el mismo expediente. No sustituía el almacenamiento que debe recuperar un documento al día siguiente.

La aritmética detrás del «hasta 90%»

Anthropic fijó la escritura de un bloque en caché en 1,25 veces el precio normal de entrada y la lectura en 0,1 veces. Para Claude 3.5 Sonnet, la tabla del lanzamiento traducía esos multiplicadores a 3 dólares por millón de tokens de entrada normal, 3,75 por la escritura y 0,30 por la lectura. Eran precios de agosto de 2024, no una tarifa que deba darse por vigente sin consultar la tabla actual.

La cuenta puede hacerse sin dólares. Llamemos P al coste normal de un prefijo estable. Dos llamadas sin caché cuestan 2P. Crear la caché y acertar una vez cuesta 1,25P + 0,1P, es decir, 1,35P. El ahorro ya aparece en la segunda llamada: un 32,5% sobre ese prefijo. Con diez llamadas, el coste pasa de 10P a 2,15P y el ahorro alcanza el 78,5% sobre la parte estable.

El 90% es el límite al que se aproxima cada lectura frente a procesar otra vez el mismo bloque. No incluye la escritura inicial, el sufijo variable ni los tokens de salida. Si el prefijo de un caso representa 50.000 tokens, cada pregunta añade 500 y la respuesta otros 800, solo los 50.000 repetidos reciben el multiplicador de lectura. Presentar el 90% como descuento del total ocultaría las tres partidas restantes.

También hay un coste de oportunidad: una entrada que solo se usa una vez paga el recargo de escritura y no obtiene lectura barata. Para decidir, el equipo estima la longitud estable, el número de reutilizaciones durante cinco minutos y su tasa real de aciertos. Si las peticiones llegan espaciadas o el contenido cambia constantemente, una tarifa atractiva no rescata un patrón incompatible.

Diseñar el prompt para conservar el prefijo

La caché premia un orden deliberado. Primero van las herramientas y sus definiciones, luego las instrucciones de sistema, los documentos comunes y los ejemplos; al final, el historial reciente o la pregunta específica. Una fecha actual, un identificador de solicitud o un saludo personalizado colocado al principio puede romper la coincidencia para todo lo que viene después.

Conviene pensar el prefijo como una versión de software. Un conjunto de políticas aprobado recibe una versión; los documentos se ordenan de forma determinista; espacios, etiquetas y serialización permanecen estables. Cuando cambia una regla, se acepta conscientemente una nueva escritura. Así, un fallo de caché se puede atribuir a una modificación concreta en vez de parecer azar del proveedor.

Eso no obliga a mandar una enciclopedia a cada llamada. La caché abarata repetición, pero no mejora por sí sola la relevancia. Un contexto excesivo todavía puede distraer al modelo, aumentar el tiempo de generación y contener material que no debía cruzar esa frontera. Recuperar pocos fragmentos pertinentes y almacenar un bloque estable son decisiones complementarias, no rivales.

Hay además una sutileza de arranque: el bloque se vuelve reutilizable cuando comienza la respuesta que lo crea. Si muchas peticiones idénticas salen simultáneamente antes de que termine ese calentamiento, varias pueden comportarse como escrituras o fallos. Un piloto debe calentar el prefijo y después lanzar la carga, o registrar por separado esa primera ráfaga.

Medir el acierto, no inferirlo de la factura

La respuesta de la API distingue los tokens que crean caché, los que se leen de ella y la entrada ordinaria. Esos contadores permiten construir tres métricas: tasa de aciertos por versión del prefijo, tokens recuperados frente a tokens elegibles y ahorro real frente a una ejecución sin caché. Medir solo el coste mensual mezcla crecimiento de usuarios, respuestas más largas y cambios de modelo.

La latencia también necesita una definición. El anuncio hablaba de reducciones de hasta el 85%, pero reutilizar el prefijo afecta sobre todo al trabajo previo al primer token. El equipo debe registrar tiempo hasta el primer token y tiempo hasta completar la respuesta. Una contestación larga puede conservar casi todo su tiempo de generación aunque empiece antes.

Un ensayo limpio usa el mismo modelo, región, longitud máxima y conjunto de preguntas. Primero ejecuta una tanda sin caché; después calienta un prefijo y repite durante su ventana. Registra aciertos, entrada ordinaria, salida, primer token y tiempo total. Cambiar el modelo o resumir documentos al mismo tiempo impediría saber qué produjo la diferencia.

Los ejemplos de Anthropic y su límite

En sus pruebas, Anthropic describió una conversación sobre un libro de aproximadamente 100.000 tokens que pasaba de 11,5 a 2,4 segundos y reducía un 90% el coste declarado. También mostró ejemplos de muchos disparos y conversaciones extensas. Son mediciones del proveedor sobre cargas escogidas para demostrar la función, no garantías para cualquier red, herramienta o patrón de tráfico.

Los candidatos más claros eran soporte sobre un catálogo común, análisis repetidos de un expediente, revisión de repositorios y agentes con muchas herramientas estables. El patrón compartido no era el sector, sino la geometría del prompt: un prefijo grande que cambia poco y muchas preguntas pequeñas mientras la caché sigue viva.

El 14 de agosto la beta estaba disponible para Claude 3.5 Sonnet, Claude 3 Opus y Claude 3 Haiku. Esa lista también pertenece a su momento. Una integración mantenible consulta modelos y precios actuales, pero conserva el método: verificar la variante exacta, el multiplicador, la duración, el mínimo admitido y los contadores de uso antes de proyectar ahorros.

Una lista de decisión que sobrevive al producto

Antes de activar cualquier caché de contexto, el equipo puede responder cinco preguntas: cuánto del prompt es idéntico; cuántas lecturas llegan durante la vigencia; qué cambios rompen la coincidencia; qué parte de la factura es salida; y cómo observará un acierto. Si una respuesta depende de «creemos», todavía falta instrumentación.

Después se prueba con tráfico representativo y un presupuesto de calidad. Abaratar el contexto no justifica conservar información obsoleta, saltarse permisos o enviar más datos sensibles. Las políticas de acceso y retención se evalúan por separado: una optimización de infraestructura no transforma automáticamente un dato permitido en otro permitido.

La capacidad transferible es leer una promesa de caché como una ecuación y una estructura: escritura inicial, lecturas, ventana, prefijo estable, sufijo variable y salida. Con esas piezas se puede calcular el punto de equilibrio y detectar por qué falla una integración, incluso cuando cambien el nombre del proveedor, los precios o la duración. El ahorro no nace del botón; nace de que la carga de trabajo realmente repite lo que la tarifa descuenta.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Artículos relacionados

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña
Modelos de lenguaje

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña

«Cuánta GPU hace falta» es la pregunta equivocada. Cómputo, datos y conocimiento no se suman: son tres puertas en serie, y la que casi nadie pasa no es la del hardware. Con el precio real de hoy, el corpus real de un modelo abierto y el cuaderno de bitácora real de un entrenamiento de 175.000 millones de parámetros, esta pieza hace la cuenta completa — y te dice en qué escalón estás tú.

7 min
Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no
Modelos de lenguaje

Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no

En 2023, un equipo de investigadores le pidió a ChatGPT que repitiera la palabra 'poema' sin parar, y el modelo acabó recitando 'El cuervo' de Poe palabra por palabra. Eso no prueba que los modelos guarden una copia de internet, pero tampoco que nunca memoricen nada: las dos afirmaciones son ciertas según el caso. Las cuatro preguntas que separan una demanda seria de un titular vacío.

7 min

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar