Précision
Aussi appelé: format numérique, type de données
Le nombre de bits utilisés pour chaque nombre. Moins de bits signifie plus de débit et moins de mémoire, au prix d'une certaine perte d'exactitude. Un même GPU a une valeur crête différente pour chaque précision.
Termes associés
- FP16 et BF16Des formats 16 bits, la norme pour entraîner et exécuter des LLM. Le BF16 conserve la plage de valeurs du FP32 avec moins de précision, ce qui rend l'entraînement plus stable ; il nécessite Ampere, CDNA 2 ou plus récent.
- FP8Virgule flottante 8 bits pour l'entraînement et l'inférence, avec environ deux fois le débit du FP16. Pris en charge nativement par Hopper, Ada, Blackwell et AMD CDNA 3 et plus récents.
- FP4Virgule flottante 4 bits, utilisée pour l'inférence quantifiée. Seuls Blackwell et AMD CDNA 4 l'exécutent nativement.
- TF32Le format 19 bits de NVIDIA qui exécute les calculs matriciels FP32 sur les tensor cores. PyTorch peut l'utiliser pour les multiplications matricielles FP32 à partir d'Ampere.
- INT8 et TOPSDes entiers 8 bits pour l'inférence quantifiée. Le débit se compte en TOPS (milliers de milliards d'opérations par seconde) plutôt qu'en FLOPS.
Calcul
- FLOPS, TFLOPS, PFLOPSOpérations en virgule flottante par seconde : la quantité de calcul qu'une puce peut effectuer. 1 TFLOPS correspond à mille milliards d'opérations par seconde, 1 PFLOPS (PetaFLOPS) à mille TFLOPS. PetaPrice exprime toute la puissance de calcul en PFLOPS.
- FLOPS denses vs sparsesLes fabricants annoncent souvent le débit tensor avec une sparsité structurée 2:4, qui double le chiffre mis en avant. Presque aucun entraînement ni aucune inférence ne l'utilise : PetaPrice affiche donc toujours les valeurs denses.
- $ par PFLOP-heureLe prix d'une heure GPU divisé par les PFLOPS crête denses du GPU dans la précision choisie. Il indique la quantité de calcul qu'achète un dollar, ce qui permet de comparer directement des GPU rapides et chers à des GPU lents et bon marché. Plus c'est bas, mieux c'est.
- Tensor cores / matrix coresDes unités qui multiplient de petites matrices en une seule étape, d'où provient la quasi-totalité du débit IA d'un GPU. NVIDIA les appelle tensor cores, AMD matrix cores.
- MFU (model FLOPS utilization)La part des FLOPS crête qu'atteint une charge de travail réelle. Les grands entraînements atteignent généralement 30 à 60 % : les valeurs crêtes des fiches techniques servent donc à comparer les GPU, pas à prédire des temps d'exécution.