Mantener la caché KV caliente — midiendo la evicción del prompt en Anthropic, OpenAI y Google
TLDR DevOps escribió un post práctico sobre la evicción del prompt cache, comparando cómo Anthropic, OpenAI y Google manejan la caché KV en sus APIs de LLM. La caché permite que prompts repetidos reutilicen cómputo previo — si la caché se mantiene caliente, pagas menos. Si se evicciona, pagas de nuevo.
El artículo recorre mediciones reales: cuánto tiempo mantiene cada provider la caché activa, qué dispara la evicción, y cuánto ahorras manteniendo los prompts juntos en el tiempo. Los números varían por provider, pero el patrón es claro: la evicción es un costo silencioso que no notas hasta que llega la factura.
Para nosotros, este es el tipo de detalle de infra que aparece en el margen. Corremos modelos por múltiples providers y hacemos cache agresivo, así que la diferencia entre caliente y frío importa más de lo normal. Si logramos mantener la caché caliente entre nuestras llamadas a la API, los ahorros se acumulan.
Por qué nos importa: la caché es una palanca silenciosa — caché caliente significa menor latencia y menor costo en cada llamada que hacemos, y los providers no siempre te avisan cuando está a punto de expirar.
“La evicción es un costo silencioso que no notas hasta que llega la factura.”