Glossaire GPU
Les termes que vous rencontrerez en comparant et en louant des GPU cloud, expliqués simplement.
Calcul
- FLOPS, TFLOPS, PFLOPS
- TeraFLOPS, PetaFLOPS, FLOP/s
- Opérations en virgule flottante par seconde : la quantité de calcul qu'une puce peut effectuer. 1 TFLOPS correspond à mille milliards d'opérations par seconde, 1 PFLOPS (PetaFLOPS) à mille TFLOPS. PetaPrice exprime toute la puissance de calcul en PFLOPS.
- FLOPS denses vs sparses
- sparsité 2:4, sparsité structurée
- Les fabricants annoncent souvent le débit tensor avec une sparsité structurée 2:4, qui double le chiffre mis en avant. Presque aucun entraînement ni aucune inférence ne l'utilise : PetaPrice affiche donc toujours les valeurs denses.
- $ par PFLOP-heure
- $/PFLOP·h, coût par PFLOP
- Le prix d'une heure GPU divisé par les PFLOPS crête denses du GPU dans la précision choisie. Il indique la quantité de calcul qu'achète un dollar, ce qui permet de comparer directement des GPU rapides et chers à des GPU lents et bon marché. Plus c'est bas, mieux c'est.
- Précision
- format numérique, type de données
- Le nombre de bits utilisés pour chaque nombre. Moins de bits signifie plus de débit et moins de mémoire, au prix d'une certaine perte d'exactitude. Un même GPU a une valeur crête différente pour chaque précision.
- FP16 et BF16
- bfloat16, demi-précision
- Des formats 16 bits, la norme pour entraîner et exécuter des LLM. Le BF16 conserve la plage de valeurs du FP32 avec moins de précision, ce qui rend l'entraînement plus stable ; il nécessite Ampere, CDNA 2 ou plus récent.
- FP8
- E4M3, E5M2, Float8
- Virgule flottante 8 bits pour l'entraînement et l'inférence, avec environ deux fois le débit du FP16. Pris en charge nativement par Hopper, Ada, Blackwell et AMD CDNA 3 et plus récents.
- FP4
- NVFP4, MXFP4
- Virgule flottante 4 bits, utilisée pour l'inférence quantifiée. Seuls Blackwell et AMD CDNA 4 l'exécutent nativement.
- TF32
- TensorFloat-32
- Le format 19 bits de NVIDIA qui exécute les calculs matriciels FP32 sur les tensor cores. PyTorch peut l'utiliser pour les multiplications matricielles FP32 à partir d'Ampere.
- INT8 et TOPS
- entier 8 bits, TOPS
- Des entiers 8 bits pour l'inférence quantifiée. Le débit se compte en TOPS (milliers de milliards d'opérations par seconde) plutôt qu'en FLOPS.
- Tensor cores / matrix cores
- matrix cores
- Des unités qui multiplient de petites matrices en une seule étape, d'où provient la quasi-totalité du débit IA d'un GPU. NVIDIA les appelle tensor cores, AMD matrix cores.
- MFU (model FLOPS utilization)
- model FLOPS utilization, taux d'utilisation du GPU
- La part des FLOPS crête qu'atteint une charge de travail réelle. Les grands entraînements atteignent généralement 30 à 60 % : les valeurs crêtes des fiches techniques servent donc à comparer les GPU, pas à prédire des temps d'exécution.
Mémoire
- VRAM
- mémoire GPU
- La mémoire propre du GPU. Les poids du modèle, les activations et le KV cache doivent y tenir (ou être répartis sur plusieurs GPU) : c'est donc souvent la VRAM qui détermine si un GPU est utilisable.
- HBM
- HBM2e, HBM3, HBM3e, High Bandwidth Memory
- High Bandwidth Memory, empilée à côté de la puce sur les GPU de data center (HBM2e, HBM3, HBM3e). Plusieurs fois plus rapide que la mémoire GDDR des cartes grand public et des stations de travail.
- Bande passante mémoire
- GB/s, TB/s
- La vitesse à laquelle le GPU lit sa mémoire, en GB/s ou TB/s. La génération de tokens d'un LLM est généralement limitée par la bande passante plutôt que par les FLOPS, c'est pourquoi PetaPrice permet de classer les GPU par bande passante par dollar.
- KV cache
- cache clé-valeur
- La mémoire qu'un LLM conserve pour chaque token de son contexte pendant l'inférence. Les contextes longs et les nombreuses requêtes en parallèle en demandent beaucoup, en plus des poids du modèle.
Matériel et interconnexion
- SXM vs PCIe
- SXM5, PCI Express, format
- Les GPU SXM sont montés sur une carte de base, reliés entre eux par NVLink, et disposent de plus de puissance électrique : ils sont donc plus rapides. Les cartes PCIe s'insèrent dans un emplacement standard, coûtent moins cher et sont généralement plus lentes. Un H100 SXM et un H100 PCIe sont des produits différents.
- NVLink et NVSwitch
- NVSwitch, NVLink-C2C, Infinity Fabric
- Les liaisons haut débit de NVIDIA entre les GPU d'un même serveur, bien plus rapides que le PCIe. Elles comptent lorsqu'un modèle est réparti sur plusieurs GPU. L'équivalent chez AMD est Infinity Fabric.
- InfiniBand
- IB, RoCE
- Le réseau à faible latence qui relie les serveurs GPU dans les clusters d'entraînement. L'entraînement multi-nœuds en a besoin (ou d'un Ethernet RoCE rapide) ; les tâches sur un seul nœud, non.
- Superchip
- Grace Hopper, Grace Blackwell
- Un CPU et un GPU sur un même module, reliés par une liaison rapide, comme le GH200 et le GB200. Le GPU peut utiliser la mémoire du CPU comme extension de la sienne.
- Nœud
- serveur, nœud de 8 GPU, HGX
- Un serveur. Les GPU de data center sont généralement proposés en nœuds de 8 GPU ; certains fournisseurs ne louent que des nœuds complets. PetaPrice affiche toujours le prix par GPU.
- TDP
- TGP, consommation de la carte
- Thermal design power (enveloppe thermique) : en gros, la puissance maximale que consomme le GPU, en watts.
- MIG et fractions de GPU
- Multi-Instance GPU, vGPU, fraction de GPU
- Multi-Instance GPU découpe un A100, un H100 ou plus récent en partitions isolées. Ces partitions et les autres fractions de GPU (vGPU) sont moins chères mais ne sont pas des GPU complets : PetaPrice les exclut donc.
Prix et location
- À la demande
- paiement à l'usage
- Paiement à l'heure (ou à la seconde), sans engagement, avec arrêt quand vous le souhaitez. C'est la vue par défaut de PetaPrice.
- Spot / interruptible
- préemptible, interruptible
- De la capacité inutilisée vendue à prix réduit, que le fournisseur peut reprendre à tout moment. Adaptée à l'entraînement avec checkpoints et aux traitements par lots.
- Réservé / avec engagement
- engagement d'utilisation, tarif contractuel
- Un tarif horaire plus bas en échange d'un engagement, généralement de 1 à 3 ans ou d'un contrat ferme.
- Hébergeurs communautaires / places de marché
- cloud communautaire, pair-à-pair
- Des plateformes comme Vast.ai, où des hébergeurs indépendants louent leurs machines. Souvent l'option la moins chère, avec une fiabilité et une sécurité plus variables.
- Heure GPU
- GPU·h
- Un GPU pendant une heure. Un nœud de 8 GPU pendant 2 heures représente 16 heures GPU. Un GPU qui tourne en continu représente environ 730 heures GPU par mois.
- Egress (trafic sortant)
- transfert de données sortant
- Les données transférées hors d'un cloud. Certains fournisseurs les facturent ; les prix de PetaPrice ne les incluent pas, pas plus que le stockage et les adresses IP, sauf si le fournisseur les inclut dans son offre.