Blackwell Ultra
Lancio 2025L'aggiornamento 2025 di Blackwell di NVIDIA (B300, GB300): più HBM3e per GPU e FP4 più veloce per l'inferenza su larga scala.
Tutte le generazioni che monitoriamo, dalla più recente. Per ognuna sono elencate le GPU con il prezzo on demand più basso di oggi, le precisioni che i suoi tensor core eseguono nativamente e la memoria massima per GPU.
Hopper vs Blackwell →La memoria massima e la potenza massima per GPU di ogni architettura, e la sua capacità di calcolo più conveniente in questo momento.
| Architettura | Produttore | Anno | Memoria max | Potenza max | Precisioni native | Miglior rapporto FP16 |
|---|---|---|---|---|---|---|
| Blackwell Ultra | NVIDIA | 2025 | 288 GB HBM3e | 1,400 W | FP4 · FP8 · FP16 / BF16 · TF32 · INT8 | $2.93/PFLOP·h (B300 SXM) |
| Blackwell | NVIDIA | 2024–2025 | 186 GB HBM3e | 1,200 W | FP4 · FP8 · FP16 / BF16 · TF32 · INT8 | $1.42/PFLOP·h (B200 SXM) |
| Hopper | NVIDIA | 2022–2024 | 141 GB HBM3e | 1,000 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.83/PFLOP·h (H100 SXM) |
| Ada Lovelace | NVIDIA | 2022–2024 | 48 GB GDDR6 | 450 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.52/PFLOP·h (RTX 4070 SUPER) |
| Ampere | NVIDIA | 2020–2022 | 80 GB HBM2e | 450 W | FP16 / BF16 · TF32 · INT8 | $1.44/PFLOP·h (RTX A5000) |
| Turing | NVIDIA | 2018 | 48 GB GDDR6 | 295 W | FP16 · INT8 | $1.95/PFLOP·h (Quadro RTX 8000) |
| Volta | NVIDIA | 2017–2019 | 32 GB HBM2 | 300 W | FP16 | $1.52/PFLOP·h (V100 SXM2 16GB) |
| Pascal | NVIDIA | 2016 | 16 GB HBM2 | 250 W | FP16 | $68.2/PFLOP·h (P100) |
| CDNA 4 | AMD | 2025 | 288 GB HBM3e | 1,400 W | FP4 · FP8 · FP16 / BF16 · INT8 | $1.03/PFLOP·h (Instinct MI355X) |
| CDNA 3 | AMD | 2023–2024 | 256 GB HBM3e | 1,000 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.42/PFLOP·h (Instinct MI300X) |
| RDNA 3 | AMD | 2022–2023 | 48 GB GDDR6 | 355 W | FP16 / BF16 · INT8 | — |
| CDNA 2 | AMD | 2021–2022 | 128 GB HBM2e | 560 W | FP16 / BF16 · INT8 | — |
| CDNA | AMD | 2020 | 32 GB HBM2 | 300 W | FP16 / BF16 · INT8 | — |
| Xe-HPC | Intel | 2023 | 128 GB HBM2e | 600 W | FP16 / BF16 · TF32 · INT8 | — |
| Gaudi | Intel | 2022–2024 | 128 GB HBM2e | 900 W | FP8 · FP16 / BF16 | $2.55/PFLOP·h (Gaudi 2) |
| TPU | 2023–2024 | 95 GB HBM2e | — | FP16 / BF16 · INT8 | $2.94/PFLOP·h (TPU v6e (Trillium)) | |
| Inferentia | AWS | 2023 | 32 GB HBM2e | — | FP8 · FP16 / BF16 · INT8 | $3.99/PFLOP·h (Inferentia2) |
| Trainium | AWS | 2022–2024 | 96 GB HBM3 | — | FP8 · FP16 / BF16 | $7.07/PFLOP·h (Trainium) |
L'aggiornamento 2025 di Blackwell di NVIDIA (B300, GB300): più HBM3e per GPU e FP4 più veloce per l'inferenza su larga scala.
La generazione NVIDIA successiva a Hopper, dalle B200 e GB200 nei datacenter alla serie RTX 50 e alle schede RTX PRO. Aggiunge i tensor core FP4; i modelli per datacenter uniscono due die in un'unica GPU.
H100, H200 e GH200. Ha introdotto i tensor core FP8 con il Transformer Engine ed è ancora la GPU da datacenter più noleggiata.
Serie RTX 40, L4, L40S e RTX 6000 Ada. Tensor core FP8 con memoria GDDR6 invece di HBM, il che rende queste schede economiche ma limitate dalla banda.
A100, A10, A40 e serie RTX 30. La prima generazione con tensor core BF16 e TF32; la A100 ha introdotto anche il partizionamento MIG.
T4, serie RTX 20 e Quadro RTX. Tensor core per FP16 e INT8, ma senza BF16.
V100: la prima GPU con tensor core (solo FP16).
P100: memoria HBM ma senza tensor core. Utile soprattutto per carichi FP32 e FP64 a basso costo.
AMD Instinct MI350X e MI355X. Aggiunge FP4 e FP6 ai matrix core di AMD, con 288 GB di HBM3e per GPU.
AMD Instinct MI300X e MI325X. Supporto FP8 e più memoria per GPU rispetto alle Hopper con cui competono.
L'architettura grafica Radeon di AMD (RX 7900 XTX, Radeon PRO W7900), noleggiata soprattutto sui marketplace community.
AMD Instinct MI210 e MI250(X). FP64 elevato per l'HPC; BF16 ma niente FP8.
AMD Instinct MI100, la prima architettura AMD per datacenter dedicata esclusivamente al calcolo.
Intel Data Center GPU Max (Ponte Vecchio), progettata per l'HPC.
Gli acceleratori AI Gaudi 2 e Gaudi 3 di Intel (nati dall'acquisizione di Habana Labs).
I processori tensoriali sviluppati da Google, noleggiabili solo su Google Cloud.
I chip per l'inferenza sviluppati da AWS, noleggiabili solo su AWS.
I chip per il training sviluppati da AWS, noleggiabili solo su AWS.
CDNA 4: la Instinct MI355X costa $1.03 per PFLOP-ora di FP16/BF16 denso a $2.59 per GPU-ora. La classifica segue i prezzi, che si aggiornano ogni 2 ore.
FP8: Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 4, CDNA 3, Gaudi, Inferentia, Trainium. FP4: Blackwell Ultra, Blackwell, CDNA 4. Le architetture più vecchie possono comunque eseguire modelli FP8 o FP4, ma senza l'accelerazione.
Le GPU più vecchie costano spesso meno per FLOP e per GB di memoria, e bastano per servire modelli più piccoli, per il fine-tuning LoRA o per esperimenti. Verifica che la precisione che ti serve sia supportata nativamente; a quel punto è una questione di prezzo.
Hopper è l'architettura GPU (H100, H200). Grace Hopper (GH200) è un superchip: la CPU Grace di NVIDIA basata su Arm e una GPU Hopper su un unico modulo, collegate tramite NVLink-C2C, così la GPU può usare anche la memoria della CPU.