Blackwell Ultra
Sortie 2025La mise à jour 2025 de Blackwell par NVIDIA (B300, GB300) : plus de HBM3e par GPU et un FP4 plus rapide pour l'inférence à grande échelle.
Toutes les générations que nous suivons, de la plus récente à la plus ancienne. Chacune liste ses GPU avec le prix à la demande le plus bas du jour, les précisions que ses tensor cores exécutent nativement et la mémoire maximale par GPU.
Hopper vs Blackwell →La mémoire maximale et la consommation la plus élevée par GPU de chaque architecture, et son calcul le moins cher du moment.
| Architecture | Fabricant | Année | Mémoire max. | Consommation max. | Précisions natives | Meilleur rapport qualité-prix FP16 |
|---|---|---|---|---|---|---|
| Blackwell Ultra | NVIDIA | 2025 | 288 GB HBM3e | 1,400 W | FP4 · FP8 · FP16 / BF16 · TF32 · INT8 | $2.93/PFLOP·h (B300 SXM) |
| Blackwell | NVIDIA | 2024–2025 | 186 GB HBM3e | 1,200 W | FP4 · FP8 · FP16 / BF16 · TF32 · INT8 | $1.42/PFLOP·h (B200 SXM) |
| Hopper | NVIDIA | 2022–2024 | 141 GB HBM3e | 1,000 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.83/PFLOP·h (H100 SXM) |
| Ada Lovelace | NVIDIA | 2022–2024 | 48 GB GDDR6 | 450 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.52/PFLOP·h (RTX 4070 SUPER) |
| Ampere | NVIDIA | 2020–2022 | 80 GB HBM2e | 450 W | FP16 / BF16 · TF32 · INT8 | $1.44/PFLOP·h (RTX A5000) |
| Turing | NVIDIA | 2018 | 48 GB GDDR6 | 295 W | FP16 · INT8 | $1.95/PFLOP·h (Quadro RTX 8000) |
| Volta | NVIDIA | 2017–2019 | 32 GB HBM2 | 300 W | FP16 | $1.52/PFLOP·h (V100 SXM2 16GB) |
| Pascal | NVIDIA | 2016 | 16 GB HBM2 | 250 W | FP16 | $68.2/PFLOP·h (P100) |
| CDNA 4 | AMD | 2025 | 288 GB HBM3e | 1,400 W | FP4 · FP8 · FP16 / BF16 · INT8 | $1.03/PFLOP·h (Instinct MI355X) |
| CDNA 3 | AMD | 2023–2024 | 256 GB HBM3e | 1,000 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.42/PFLOP·h (Instinct MI300X) |
| RDNA 3 | AMD | 2022–2023 | 48 GB GDDR6 | 355 W | FP16 / BF16 · INT8 | — |
| CDNA 2 | AMD | 2021–2022 | 128 GB HBM2e | 560 W | FP16 / BF16 · INT8 | — |
| CDNA | AMD | 2020 | 32 GB HBM2 | 300 W | FP16 / BF16 · INT8 | — |
| Xe-HPC | Intel | 2023 | 128 GB HBM2e | 600 W | FP16 / BF16 · TF32 · INT8 | — |
| Gaudi | Intel | 2022–2024 | 128 GB HBM2e | 900 W | FP8 · FP16 / BF16 | $2.55/PFLOP·h (Gaudi 2) |
| TPU | 2023–2024 | 95 GB HBM2e | — | FP16 / BF16 · INT8 | $2.94/PFLOP·h (TPU v6e (Trillium)) | |
| Inferentia | AWS | 2023 | 32 GB HBM2e | — | FP8 · FP16 / BF16 · INT8 | $3.99/PFLOP·h (Inferentia2) |
| Trainium | AWS | 2022–2024 | 96 GB HBM3 | — | FP8 · FP16 / BF16 | $7.07/PFLOP·h (Trainium) |
La mise à jour 2025 de Blackwell par NVIDIA (B300, GB300) : plus de HBM3e par GPU et un FP4 plus rapide pour l'inférence à grande échelle.
La génération de NVIDIA qui succède à Hopper, des B200 et GB200 en data center aux RTX série 50 et aux cartes RTX PRO. Ajoute des tensor cores FP4 ; les modèles data center réunissent deux puces en un seul GPU.
H100, H200 et GH200. A introduit les tensor cores FP8 avec le Transformer Engine et reste le GPU de data center le plus loué.
RTX série 40, L4, L40S et RTX 6000 Ada. Tensor cores FP8 avec de la mémoire GDDR6 au lieu de HBM, ce qui rend ces cartes bon marché mais limitées par la bande passante.
A100, A10, A40 et RTX série 30. La première génération dotée de tensor cores BF16 et TF32 ; l'A100 a aussi introduit le partitionnement MIG.
T4, RTX série 20 et Quadro RTX. Tensor cores pour le FP16 et l'INT8, mais pas de BF16.
V100 : le premier GPU doté de tensor cores (FP16 uniquement).
P100 : mémoire HBM mais pas de tensor cores. Surtout utile pour du calcul FP32 et FP64 bon marché.
AMD Instinct MI350X et MI355X. Ajoute le FP4 et le FP6 aux matrix cores d'AMD, avec 288 GB de HBM3e par GPU.
AMD Instinct MI300X et MI325X. Prise en charge du FP8 et plus de mémoire par GPU que les modèles Hopper qu'ils concurrencent.
L'architecture graphique Radeon d'AMD (RX 7900 XTX, Radeon PRO W7900), louée surtout sur les places de marché communautaires.
AMD Instinct MI210 et MI250(X). Très performants en FP64 pour le HPC ; BF16 mais pas de FP8.
AMD Instinct MI100, la première architecture de data center d'AMD dédiée uniquement au calcul.
Intel Data Center GPU Max (Ponte Vecchio), conçu pour le HPC.
Les accélérateurs IA Gaudi 2 et Gaudi 3 d'Intel (issus du rachat de Habana Labs).
Les processeurs tensoriels maison de Google, disponibles à la location uniquement sur Google Cloud.
Les puces d'inférence maison d'AWS, disponibles à la location uniquement sur AWS.
Les puces d'entraînement maison d'AWS, disponibles à la location uniquement sur AWS.
CDNA 4 : le Instinct MI355X coûte $1.03 par PFLOP-heure en FP16/BF16 dense, à $2.59 par heure GPU. Le classement suit les prix, actualisés toutes les 2 heures.
FP8 : Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 4, CDNA 3, Gaudi, Inferentia, Trainium. FP4 : Blackwell Ultra, Blackwell, CDNA 4. Les architectures plus anciennes peuvent quand même exécuter des modèles FP8 ou FP4, mais sans le gain de vitesse.
Les GPU plus anciens sont souvent moins chers par FLOP et par GB de mémoire, et largement suffisants pour servir des modèles plus petits, faire du fine-tuning LoRA ou des expériences. Vérifiez que la précision dont vous avez besoin est exécutée nativement ; ensuite, c'est une question de prix.
Hopper est l'architecture GPU (H100, H200). Grace Hopper (GH200) est un superchip : le CPU Grace de NVIDIA, basé sur Arm, et un GPU Hopper sur un même module, reliés par NVLink-C2C afin que le GPU puisse aussi utiliser la mémoire du CPU.