…
Auch bekannt als: Key-Value-Cache
Speicher, den ein LLM während der Inferenz für jedes Token in seinem Kontext belegt. Lange Kontexte und viele parallele Anfragen brauchen viel davon, zusätzlich zu den Modellgewichten.
Sortiert nach $ pro GB VRAM und Stunde zum jeweils niedrigsten On-Demand-Preis jeder GPU.