…
Noto anche come: key-value cache, cache chiave-valore
La memoria che un LLM conserva per ogni token del contesto durante l'inferenza. Contesti lunghi e molte richieste in parallelo ne richiedono molta, oltre ai pesi del modello.
Ordinate per $ per GB di VRAM all'ora al prezzo on demand più basso di ogni GPU.