La mémoire qu'un LLM conserve pour chaque token de son contexte pendant l'inférence. Les contextes longs et les nombreuses requêtes en parallèle en demandent beaucoup, en plus des poids du modèle.
GPU avec KV cache, du plus avantageux au moins avantageux
Classés par $ par GB de VRAM et par heure, au prix à la demande le plus bas de chaque GPU.