El desarrollador Maxim Khailo realizó un estudio de medición sobre el "keepalive" de caché de prompts: la práctica habitual de reenviar periódicamente el prefijo de una petición durante las pausas de un agente (esperando una compilación, una prueba o una aprobación humana) para evitar que caduque la caché del proveedor de LLM. Probó Anthropic (Sonnet 4.5), OpenAI (GPT-5.1), Google Gemini 2.5 Pro y DeepSeek V3.2, con pausas de hasta 10 minutos, prefijos de hasta 100.000 tokens y tres ejecuciones independientes por condición.

La convención ampliamente copiada de pingar cada 30 segundos resultó costar unas 8 veces más de lo necesario; el intervalo realmente óptimo ronda los 4 minutos, justo por debajo del TTL de 5 minutos de Anthropic. Un keepalive de 4 minutos mantuvo caliente 23 de 24 muestras, con un coste 7,8 veces menor que la versión de 30 segundos.

Los proveedores se agruparon en tres regímenes distintos. Anthropic tiene un TTL estricto: la caché sobrevive 5 minutos pero está completamente caducada a los 10 (0 de 48 muestras base seguían calientes), por lo que allí el keepalive ahorra dinero claramente: con una pausa de 10 minutos y un prefijo de 100.000 tokens, el keepalive de 4 minutos costó 0,414 $ frente a 0,667 $ sin él, un ahorro del 38%. DeepSeek (vía DeepInfra) es "con fugas": la caché se degrada incluso con pings, debido al balanceo de carga entre máquinas distintas — allí el keepalive aporta sobre todo mejora de latencia (1,4-2,0 s frente a 5,4 s en frío), no ahorro de coste. OpenAI y Google Gemini son "pegajosos": su caché suele sobrevivir 10 minutos sin ayuda (39/48 y 20/24 muestras respectivamente) — allí el keepalive fue mayormente un desperdicio, y en Gemini llegó a costar un 40% más que no hacer nada (0,186 $ frente a 0,131 $).

Según la fórmula de rentabilidad de Khailo, pingar solo compensa si la pausa supera aproximadamente el intervalo multiplicado por (ratio coste de escritura/lectura menos 1) — unos 46 minutos en Anthropic, 36 minutos en OpenAI y DeepSeek, pero solo 12 minutos en Google, cuyas lecturas de caché cuestan cuatro veces más que las de Anthropic. Más allá de ese umbral, resulta más barato dejar que la caché caduque y pagar un nuevo prellenado.

El proyecto se inspiró en un artículo de CacheWise (Shubham Tiwari, Tapan Chugh, Nash Rickert, Simon Peter, Ratul Mahajan, Haiying Shen) sobre gestión de caché KV para agentes de codificación, presentado en la conferencia AgentSys en Bellevue. Khailo también especula que el uso generalizado del keepalive genera un problema de "vecino ruidoso" en las capas de caché compartidas, y predice que los proveedores acabarán facturando directamente la residencia en caché por token-hora, como ya hacen en parte la caché explícita de Google y el nivel de 1 hora de Anthropic (con doble coste de escritura). Su framework de agentes de código abierto "pi" implementa esta política: keepalive solo mientras se ejecuta un lote de herramientas activo, desactivado por defecto.