PetaPrice

Glossaire GPU

Les termes que vous rencontrerez en comparant et en louant des GPU cloud, expliqués simplement.

Calcul

FLOPS, TFLOPS, PFLOPS
TeraFLOPS, PetaFLOPS, FLOP/s
Opérations en virgule flottante par seconde : la quantité de calcul qu'une puce peut effectuer. 1 TFLOPS correspond à mille milliards d'opérations par seconde, 1 PFLOPS (PetaFLOPS) à mille TFLOPS. PetaPrice exprime toute la puissance de calcul en PFLOPS.
FLOPS denses vs sparses
sparsité 2:4, sparsité structurée
Les fabricants annoncent souvent le débit tensor avec une sparsité structurée 2:4, qui double le chiffre mis en avant. Presque aucun entraînement ni aucune inférence ne l'utilise : PetaPrice affiche donc toujours les valeurs denses.
$ par PFLOP-heure
$/PFLOP·h, coût par PFLOP
Le prix d'une heure GPU divisé par les PFLOPS crête denses du GPU dans la précision choisie. Il indique la quantité de calcul qu'achète un dollar, ce qui permet de comparer directement des GPU rapides et chers à des GPU lents et bon marché. Plus c'est bas, mieux c'est.
Précision
format numérique, type de données
Le nombre de bits utilisés pour chaque nombre. Moins de bits signifie plus de débit et moins de mémoire, au prix d'une certaine perte d'exactitude. Un même GPU a une valeur crête différente pour chaque précision.
FP16 et BF16
bfloat16, demi-précision
Des formats 16 bits, la norme pour entraîner et exécuter des LLM. Le BF16 conserve la plage de valeurs du FP32 avec moins de précision, ce qui rend l'entraînement plus stable ; il nécessite Ampere, CDNA 2 ou plus récent.
FP8
E4M3, E5M2, Float8
Virgule flottante 8 bits pour l'entraînement et l'inférence, avec environ deux fois le débit du FP16. Pris en charge nativement par Hopper, Ada, Blackwell et AMD CDNA 3 et plus récents.
FP4
NVFP4, MXFP4
Virgule flottante 4 bits, utilisée pour l'inférence quantifiée. Seuls Blackwell et AMD CDNA 4 l'exécutent nativement.
TF32
TensorFloat-32
Le format 19 bits de NVIDIA qui exécute les calculs matriciels FP32 sur les tensor cores. PyTorch peut l'utiliser pour les multiplications matricielles FP32 à partir d'Ampere.
INT8 et TOPS
entier 8 bits, TOPS
Des entiers 8 bits pour l'inférence quantifiée. Le débit se compte en TOPS (milliers de milliards d'opérations par seconde) plutôt qu'en FLOPS.
Tensor cores / matrix cores
matrix cores
Des unités qui multiplient de petites matrices en une seule étape, d'où provient la quasi-totalité du débit IA d'un GPU. NVIDIA les appelle tensor cores, AMD matrix cores.
MFU (model FLOPS utilization)
model FLOPS utilization, taux d'utilisation du GPU
La part des FLOPS crête qu'atteint une charge de travail réelle. Les grands entraînements atteignent généralement 30 à 60 % : les valeurs crêtes des fiches techniques servent donc à comparer les GPU, pas à prédire des temps d'exécution.

Mémoire

VRAM
mémoire GPU
La mémoire propre du GPU. Les poids du modèle, les activations et le KV cache doivent y tenir (ou être répartis sur plusieurs GPU) : c'est donc souvent la VRAM qui détermine si un GPU est utilisable.
HBM
HBM2e, HBM3, HBM3e, High Bandwidth Memory
High Bandwidth Memory, empilée à côté de la puce sur les GPU de data center (HBM2e, HBM3, HBM3e). Plusieurs fois plus rapide que la mémoire GDDR des cartes grand public et des stations de travail.
Bande passante mémoire
GB/s, TB/s
La vitesse à laquelle le GPU lit sa mémoire, en GB/s ou TB/s. La génération de tokens d'un LLM est généralement limitée par la bande passante plutôt que par les FLOPS, c'est pourquoi PetaPrice permet de classer les GPU par bande passante par dollar.
KV cache
cache clé-valeur
La mémoire qu'un LLM conserve pour chaque token de son contexte pendant l'inférence. Les contextes longs et les nombreuses requêtes en parallèle en demandent beaucoup, en plus des poids du modèle.

Matériel et interconnexion

SXM vs PCIe
SXM5, PCI Express, format
Les GPU SXM sont montés sur une carte de base, reliés entre eux par NVLink, et disposent de plus de puissance électrique : ils sont donc plus rapides. Les cartes PCIe s'insèrent dans un emplacement standard, coûtent moins cher et sont généralement plus lentes. Un H100 SXM et un H100 PCIe sont des produits différents.
InfiniBand
IB, RoCE
Le réseau à faible latence qui relie les serveurs GPU dans les clusters d'entraînement. L'entraînement multi-nœuds en a besoin (ou d'un Ethernet RoCE rapide) ; les tâches sur un seul nœud, non.
Superchip
Grace Hopper, Grace Blackwell
Un CPU et un GPU sur un même module, reliés par une liaison rapide, comme le GH200 et le GB200. Le GPU peut utiliser la mémoire du CPU comme extension de la sienne.
Nœud
serveur, nœud de 8 GPU, HGX
Un serveur. Les GPU de data center sont généralement proposés en nœuds de 8 GPU ; certains fournisseurs ne louent que des nœuds complets. PetaPrice affiche toujours le prix par GPU.
TDP
TGP, consommation de la carte
Thermal design power (enveloppe thermique) : en gros, la puissance maximale que consomme le GPU, en watts.
MIG et fractions de GPU
Multi-Instance GPU, vGPU, fraction de GPU
Multi-Instance GPU découpe un A100, un H100 ou plus récent en partitions isolées. Ces partitions et les autres fractions de GPU (vGPU) sont moins chères mais ne sont pas des GPU complets : PetaPrice les exclut donc.

Prix et location

À la demande
paiement à l'usage
Paiement à l'heure (ou à la seconde), sans engagement, avec arrêt quand vous le souhaitez. C'est la vue par défaut de PetaPrice.
Spot / interruptible
préemptible, interruptible
De la capacité inutilisée vendue à prix réduit, que le fournisseur peut reprendre à tout moment. Adaptée à l'entraînement avec checkpoints et aux traitements par lots.
Réservé / avec engagement
engagement d'utilisation, tarif contractuel
Un tarif horaire plus bas en échange d'un engagement, généralement de 1 à 3 ans ou d'un contrat ferme.
Hébergeurs communautaires / places de marché
cloud communautaire, pair-à-pair
Des plateformes comme Vast.ai, où des hébergeurs indépendants louent leurs machines. Souvent l'option la moins chère, avec une fiabilité et une sécurité plus variables.
Heure GPU
GPU·h
Un GPU pendant une heure. Un nœud de 8 GPU pendant 2 heures représente 16 heures GPU. Un GPU qui tourne en continu représente environ 730 heures GPU par mois.
Egress (trafic sortant)
transfert de données sortant
Les données transférées hors d'un cloud. Certains fournisseurs les facturent ; les prix de PetaPrice ne les incluent pas, pas plus que le stockage et les adresses IP, sauf si le fournisseur les inclut dans son offre.