PetaPrice

Architectures GPU

Toutes les générations que nous suivons, de la plus récente à la plus ancienne. Chacune liste ses GPU avec le prix à la demande le plus bas du jour, les précisions que ses tensor cores exécutent nativement et la mémoire maximale par GPU.

Hopper vs Blackwell →

Architecture, produit, superchip

Architecture
La conception que partage une famille de puces : tensor cores, précisions prises en charge, système mémoire. Hopper, Blackwell et CDNA 3 sont des architectures.
Produit
Un GPU basé sur une architecture, dans une taille de mémoire et un format donnés. H100 SXM, H100 PCIe et H200 sont trois produits Hopper, chacun avec son propre prix.
Superchip
Un CPU et un ou deux GPU sur un même module (GH200, GB200). PetaPrice affiche le prix par GPU ; le CPU est inclus.

Côte à côte

La mémoire maximale et la consommation la plus élevée par GPU de chaque architecture, et son calcul le moins cher du moment.

ArchitectureFabricantAnnéeMémoire max.Consommation max.Précisions nativesMeilleur rapport qualité-prix FP16
Blackwell UltraNVIDIA2025288 GB HBM3e1,400 WFP4 · FP8 · FP16 / BF16 · TF32 · INT8$2.93/PFLOP·h (B300 SXM)
BlackwellNVIDIA2024–2025186 GB HBM3e1,200 WFP4 · FP8 · FP16 / BF16 · TF32 · INT8$1.42/PFLOP·h (B200 SXM)
HopperNVIDIA2022–2024141 GB HBM3e1,000 WFP8 · FP16 / BF16 · TF32 · INT8$1.83/PFLOP·h (H100 SXM)
Ada LovelaceNVIDIA2022–202448 GB GDDR6450 WFP8 · FP16 / BF16 · TF32 · INT8$1.52/PFLOP·h (RTX 4070 SUPER)
AmpereNVIDIA2020–202280 GB HBM2e450 WFP16 / BF16 · TF32 · INT8$1.44/PFLOP·h (RTX A5000)
TuringNVIDIA201848 GB GDDR6295 WFP16 · INT8$1.95/PFLOP·h (Quadro RTX 8000)
VoltaNVIDIA2017–201932 GB HBM2300 WFP16$1.52/PFLOP·h (V100 SXM2 16GB)
PascalNVIDIA201616 GB HBM2250 WFP16$68.2/PFLOP·h (P100)
CDNA 4AMD2025288 GB HBM3e1,400 WFP4 · FP8 · FP16 / BF16 · INT8$1.03/PFLOP·h (Instinct MI355X)
CDNA 3AMD2023–2024256 GB HBM3e1,000 WFP8 · FP16 / BF16 · TF32 · INT8$1.42/PFLOP·h (Instinct MI300X)
RDNA 3AMD2022–202348 GB GDDR6355 WFP16 / BF16 · INT8—
CDNA 2AMD2021–2022128 GB HBM2e560 WFP16 / BF16 · INT8—
CDNAAMD202032 GB HBM2300 WFP16 / BF16 · INT8—
Xe-HPCIntel2023128 GB HBM2e600 WFP16 / BF16 · TF32 · INT8—
GaudiIntel2022–2024128 GB HBM2e900 WFP8 · FP16 / BF16$2.55/PFLOP·h (Gaudi 2)
TPUGoogle2023–202495 GB HBM2e—FP16 / BF16 · INT8$2.94/PFLOP·h (TPU v6e (Trillium))
InferentiaAWS202332 GB HBM2e—FP8 · FP16 / BF16 · INT8$3.99/PFLOP·h (Inferentia2)
TrainiumAWS2022–202496 GB HBM3—FP8 · FP16 / BF16$7.07/PFLOP·h (Trainium)

NVIDIA

Blackwell Ultra

Sortie 2025

La mise à jour 2025 de Blackwell par NVIDIA (B300, GB300) : plus de HBM3e par GPU et un FP4 plus rapide pour l'inférence à grande échelle.

Jusqu'à 288 GB par GPUPrécisions natives: FP4 · FP8 · FP16 / BF16 · TF32 · INT82 sur 2 disponibles à la location

Blackwell

Sortie 2024–2025

La génération de NVIDIA qui succède à Hopper, des B200 et GB200 en data center aux RTX série 50 et aux cartes RTX PRO. Ajoute des tensor cores FP4 ; les modèles data center réunissent deux puces en un seul GPU.

Jusqu'à 186 GB par GPUPrécisions natives: FP4 · FP8 · FP16 / BF16 · TF32 · INT810 sur 10 disponibles à la location

Ada Lovelace

Sortie 2022–2024

RTX série 40, L4, L40S et RTX 6000 Ada. Tensor cores FP8 avec de la mémoire GDDR6 au lieu de HBM, ce qui rend ces cartes bon marché mais limitées par la bande passante.

Jusqu'à 48 GB par GPUPrécisions natives: FP8 · FP16 / BF16 · TF32 · INT815 sur 17 disponibles à la location

Ampere

Sortie 2020–2022

A100, A10, A40 et RTX série 30. La première génération dotée de tensor cores BF16 et TF32 ; l'A100 a aussi introduit le partitionnement MIG.

Jusqu'à 80 GB par GPUPrécisions natives: FP16 / BF16 · TF32 · INT820 sur 23 disponibles à la location

Pascal

Sortie 2016

P100 : mémoire HBM mais pas de tensor cores. Surtout utile pour du calcul FP32 et FP64 bon marché.

Jusqu'à 16 GB par GPUPrécisions natives: FP161 sur 1 disponibles à la location

AMD

CDNA 4

Sortie 2025

AMD Instinct MI350X et MI355X. Ajoute le FP4 et le FP6 aux matrix cores d'AMD, avec 288 GB de HBM3e par GPU.

Jusqu'à 288 GB par GPUPrécisions natives: FP4 · FP8 · FP16 / BF16 · INT82 sur 2 disponibles à la location

CDNA 3

Sortie 2023–2024

AMD Instinct MI300X et MI325X. Prise en charge du FP8 et plus de mémoire par GPU que les modèles Hopper qu'ils concurrencent.

Jusqu'à 256 GB par GPUPrécisions natives: FP8 · FP16 / BF16 · TF32 · INT82 sur 2 disponibles à la location

RDNA 3

Sortie 2022–2023

L'architecture graphique Radeon d'AMD (RX 7900 XTX, Radeon PRO W7900), louée surtout sur les places de marché communautaires.

Jusqu'à 48 GB par GPUPrécisions natives: FP16 / BF16 · INT80 sur 2 disponibles à la location

CDNA

Sortie 2020

AMD Instinct MI100, la première architecture de data center d'AMD dédiée uniquement au calcul.

Jusqu'à 32 GB par GPUPrécisions natives: FP16 / BF16 · INT80 sur 1 disponibles à la location

Intel

Xe-HPC

Sortie 2023

Intel Data Center GPU Max (Ponte Vecchio), conçu pour le HPC.

Jusqu'à 128 GB par GPUPrécisions natives: FP16 / BF16 · TF32 · INT80 sur 1 disponibles à la location

Gaudi

Sortie 2022–2024

Les accélérateurs IA Gaudi 2 et Gaudi 3 d'Intel (issus du rachat de Habana Labs).

Jusqu'à 128 GB par GPUPrécisions natives: FP8 · FP16 / BF161 sur 2 disponibles à la location

Google

AWS

Inferentia

Sortie 2023

Les puces d'inférence maison d'AWS, disponibles à la location uniquement sur AWS.

Jusqu'à 32 GB par GPUPrécisions natives: FP8 · FP16 / BF16 · INT81 sur 1 disponibles à la location

Trainium

Sortie 2022–2024

Les puces d'entraînement maison d'AWS, disponibles à la location uniquement sur AWS.

Jusqu'à 96 GB par GPUPrécisions natives: FP8 · FP16 / BF162 sur 2 disponibles à la location

Questions sur les architectures

Quelle architecture offre le plus de calcul par dollar en ce moment ?

CDNA 4 : le Instinct MI355X coûte $1.03 par PFLOP-heure en FP16/BF16 dense, à $2.59 par heure GPU. Le classement suit les prix, actualisés toutes les 2 heures.

Quelles architectures prennent en charge le FP8 et le FP4 ?

FP8 : Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 4, CDNA 3, Gaudi, Inferentia, Trainium. FP4 : Blackwell Ultra, Blackwell, CDNA 4. Les architectures plus anciennes peuvent quand même exécuter des modèles FP8 ou FP4, mais sans le gain de vitesse.

Pourquoi louer une architecture plus ancienne ?

Les GPU plus anciens sont souvent moins chers par FLOP et par GB de mémoire, et largement suffisants pour servir des modèles plus petits, faire du fine-tuning LoRA ou des expériences. Vérifiez que la précision dont vous avez besoin est exécutée nativement ; ensuite, c'est une question de prix.

Quelle différence entre Hopper et Grace Hopper ?

Hopper est l'architecture GPU (H100, H200). Grace Hopper (GH200) est un superchip : le CPU Grace de NVIDIA, basé sur Arm, et un GPU Hopper sur un même module, reliés par NVLink-C2C afin que le GPU puisse aussi utiliser la mémoire du CPU.