…
También conocido como: caché clave-valor
Memoria que un LLM conserva para cada token de su contexto durante la inferencia. Los contextos largos y las muchas solicitudes en paralelo necesitan mucha, además de los pesos del modelo.
Ordenadas por $ por GB de VRAM y hora al precio bajo demanda más bajo de cada GPU.