En el mundo de la inteligencia artificial, la gestión de la caché KV en agentes LLM es fundamental para la eficiencia de las inferencias. Para maximizar la utilización, los motores de inferencia existentes eliminan la caché KV de las solicitudes finalizadas si hay nuevas solicitudes en espera. Sin embargo, este enfoque falla en cargas de trabajo exigentes, donde las llamadas LLM se entrelazan con herramientas, introduciendo pausas que impiden la reutilización efectiva de KV entre turnos.
En Q2BSTUDIO, entendemos la importancia de optimizar el tiempo de completitud de trabajos para cargas de trabajo de agentes de varias vueltas. Es por eso que presentamos Continuum, un sistema de servicio que introduce un mecanismo de tiempo de vida para retener la caché KV. Este enfoque selectivo permite mantener la caché KV en la memoria de la GPU durante las llamadas de herramientas, con un valor de tiempo de vida determinado teniendo en cuenta el costo de recarga y los beneficios de preservar el orden.
Además, Continuum se encarga de evictar automáticamente la caché KV cuando el tiempo de vida expira, liberando memoria en la GPU y asegurando un rendimiento robusto incluso en casos extremos. Al combinar esto con un sistema de programación de tipo primero en llegar, primero en ser servido, Continuum logra preservar la continuidad en las interacciones de varias vueltas y reduce la demora en flujos de trabajo complejos.
Nuestra evaluación en cargas de trabajo del mundo real, como SWE-Bench y BFCL, utilizando Llama-3.1 8B/70B, ha demostrado que Continuum mejora significativamente los tiempos promedio de completitud de trabajos, y esta mejora escala a medida que aumenta el número de turnos. Puedes acceder a una versión de demostración en GitHub.




