PetaPrice

Architetture GPU

Tutte le generazioni che monitoriamo, dalla più recente. Per ognuna sono elencate le GPU con il prezzo on demand più basso di oggi, le precisioni che i suoi tensor core eseguono nativamente e la memoria massima per GPU.

Hopper vs Blackwell →

Architettura, prodotto, superchip

Architettura
Il progetto condiviso da una famiglia di chip: tensor core, precisioni supportate, sistema di memoria. Hopper, Blackwell e CDNA 3 sono architetture.
Prodotto
Una GPU basata su un'architettura, con una data quantità di memoria e un dato form factor. H100 SXM, H100 PCIe e H200 sono tre prodotti basati su Hopper, ognuno con il proprio prezzo.
Superchip
Una CPU e una o due GPU su un unico modulo (GH200, GB200). PetaPrice mostra il prezzo per GPU; la CPU è inclusa.

Fianco a fianco

La memoria massima e la potenza massima per GPU di ogni architettura, e la sua capacità di calcolo più conveniente in questo momento.

ArchitetturaProduttoreAnnoMemoria maxPotenza maxPrecisioni nativeMiglior rapporto FP16
Blackwell UltraNVIDIA2025288 GB HBM3e1,400 WFP4 · FP8 · FP16 / BF16 · TF32 · INT8$2.93/PFLOP·h (B300 SXM)
BlackwellNVIDIA2024–2025186 GB HBM3e1,200 WFP4 · FP8 · FP16 / BF16 · TF32 · INT8$1.42/PFLOP·h (B200 SXM)
HopperNVIDIA2022–2024141 GB HBM3e1,000 WFP8 · FP16 / BF16 · TF32 · INT8$1.83/PFLOP·h (H100 SXM)
Ada LovelaceNVIDIA2022–202448 GB GDDR6450 WFP8 · FP16 / BF16 · TF32 · INT8$1.52/PFLOP·h (RTX 4070 SUPER)
AmpereNVIDIA2020–202280 GB HBM2e450 WFP16 / BF16 · TF32 · INT8$1.44/PFLOP·h (RTX A5000)
TuringNVIDIA201848 GB GDDR6295 WFP16 · INT8$1.95/PFLOP·h (Quadro RTX 8000)
VoltaNVIDIA2017–201932 GB HBM2300 WFP16$1.52/PFLOP·h (V100 SXM2 16GB)
PascalNVIDIA201616 GB HBM2250 WFP16$68.2/PFLOP·h (P100)
CDNA 4AMD2025288 GB HBM3e1,400 WFP4 · FP8 · FP16 / BF16 · INT8$1.03/PFLOP·h (Instinct MI355X)
CDNA 3AMD2023–2024256 GB HBM3e1,000 WFP8 · FP16 / BF16 · TF32 · INT8$1.42/PFLOP·h (Instinct MI300X)
RDNA 3AMD2022–202348 GB GDDR6355 WFP16 / BF16 · INT8—
CDNA 2AMD2021–2022128 GB HBM2e560 WFP16 / BF16 · INT8—
CDNAAMD202032 GB HBM2300 WFP16 / BF16 · INT8—
Xe-HPCIntel2023128 GB HBM2e600 WFP16 / BF16 · TF32 · INT8—
GaudiIntel2022–2024128 GB HBM2e900 WFP8 · FP16 / BF16$2.55/PFLOP·h (Gaudi 2)
TPUGoogle2023–202495 GB HBM2e—FP16 / BF16 · INT8$2.94/PFLOP·h (TPU v6e (Trillium))
InferentiaAWS202332 GB HBM2e—FP8 · FP16 / BF16 · INT8$3.99/PFLOP·h (Inferentia2)
TrainiumAWS2022–202496 GB HBM3—FP8 · FP16 / BF16$7.07/PFLOP·h (Trainium)

NVIDIA

Blackwell Ultra

Lancio 2025

L'aggiornamento 2025 di Blackwell di NVIDIA (B300, GB300): più HBM3e per GPU e FP4 più veloce per l'inferenza su larga scala.

Fino a 288 GB per GPUPrecisioni native: FP4 · FP8 · FP16 / BF16 · TF32 · INT82 su 2 noleggiabili ora

Blackwell

Lancio 2024–2025

La generazione NVIDIA successiva a Hopper, dalle B200 e GB200 nei datacenter alla serie RTX 50 e alle schede RTX PRO. Aggiunge i tensor core FP4; i modelli per datacenter uniscono due die in un'unica GPU.

Fino a 186 GB per GPUPrecisioni native: FP4 · FP8 · FP16 / BF16 · TF32 · INT810 su 10 noleggiabili ora

Ada Lovelace

Lancio 2022–2024

Serie RTX 40, L4, L40S e RTX 6000 Ada. Tensor core FP8 con memoria GDDR6 invece di HBM, il che rende queste schede economiche ma limitate dalla banda.

Fino a 48 GB per GPUPrecisioni native: FP8 · FP16 / BF16 · TF32 · INT815 su 17 noleggiabili ora

Ampere

Lancio 2020–2022

A100, A10, A40 e serie RTX 30. La prima generazione con tensor core BF16 e TF32; la A100 ha introdotto anche il partizionamento MIG.

Fino a 80 GB per GPUPrecisioni native: FP16 / BF16 · TF32 · INT820 su 23 noleggiabili ora

Pascal

Lancio 2016

P100: memoria HBM ma senza tensor core. Utile soprattutto per carichi FP32 e FP64 a basso costo.

Fino a 16 GB per GPUPrecisioni native: FP161 su 1 noleggiabili ora

AMD

CDNA 4

Lancio 2025

AMD Instinct MI350X e MI355X. Aggiunge FP4 e FP6 ai matrix core di AMD, con 288 GB di HBM3e per GPU.

Fino a 288 GB per GPUPrecisioni native: FP4 · FP8 · FP16 / BF16 · INT82 su 2 noleggiabili ora

CDNA 3

Lancio 2023–2024

AMD Instinct MI300X e MI325X. Supporto FP8 e più memoria per GPU rispetto alle Hopper con cui competono.

Fino a 256 GB per GPUPrecisioni native: FP8 · FP16 / BF16 · TF32 · INT82 su 2 noleggiabili ora

RDNA 3

Lancio 2022–2023

L'architettura grafica Radeon di AMD (RX 7900 XTX, Radeon PRO W7900), noleggiata soprattutto sui marketplace community.

Fino a 48 GB per GPUPrecisioni native: FP16 / BF16 · INT80 su 2 noleggiabili ora

CDNA

Lancio 2020

AMD Instinct MI100, la prima architettura AMD per datacenter dedicata esclusivamente al calcolo.

Fino a 32 GB per GPUPrecisioni native: FP16 / BF16 · INT80 su 1 noleggiabili ora

Intel

Xe-HPC

Lancio 2023

Intel Data Center GPU Max (Ponte Vecchio), progettata per l'HPC.

Fino a 128 GB per GPUPrecisioni native: FP16 / BF16 · TF32 · INT80 su 1 noleggiabili ora

Gaudi

Lancio 2022–2024

Gli acceleratori AI Gaudi 2 e Gaudi 3 di Intel (nati dall'acquisizione di Habana Labs).

Fino a 128 GB per GPUPrecisioni native: FP8 · FP16 / BF161 su 2 noleggiabili ora

Google

AWS

Inferentia

Lancio 2023

I chip per l'inferenza sviluppati da AWS, noleggiabili solo su AWS.

Fino a 32 GB per GPUPrecisioni native: FP8 · FP16 / BF16 · INT81 su 1 noleggiabili ora

Domande sulle architetture

Quale architettura offre più capacità di calcolo per dollaro in questo momento?

CDNA 4: la Instinct MI355X costa $1.03 per PFLOP-ora di FP16/BF16 denso a $2.59 per GPU-ora. La classifica segue i prezzi, che si aggiornano ogni 2 ore.

Quali architetture supportano FP8 e FP4?

FP8: Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 4, CDNA 3, Gaudi, Inferentia, Trainium. FP4: Blackwell Ultra, Blackwell, CDNA 4. Le architetture più vecchie possono comunque eseguire modelli FP8 o FP4, ma senza l'accelerazione.

Perché noleggiare un'architettura più vecchia?

Le GPU più vecchie costano spesso meno per FLOP e per GB di memoria, e bastano per servire modelli più piccoli, per il fine-tuning LoRA o per esperimenti. Verifica che la precisione che ti serve sia supportata nativamente; a quel punto è una questione di prezzo.

Qual è la differenza tra Hopper e Grace Hopper?

Hopper è l'architettura GPU (H100, H200). Grace Hopper (GH200) è un superchip: la CPU Grace di NVIDIA basata su Arm e una GPU Hopper su un unico modulo, collegate tramite NVLink-C2C, così la GPU può usare anche la memoria della CPU.