PetaPrice

Glossario GPU

I termini che incontri quando confronti e noleggi GPU cloud, spiegati in modo semplice.

Calcolo

FLOPS, TFLOPS, PFLOPS
TeraFLOPS, PetaFLOPS, FLOP/s
Operazioni in virgola mobile al secondo: quanti calcoli aritmetici può eseguire un chip. 1 TFLOPS equivale a mille miliardi al secondo, 1 PFLOPS (PetaFLOPS) a mille TFLOPS. PetaPrice mostra tutta la capacità di calcolo in PFLOPS.
FLOPS densi vs. sparsi
sparsità 2:4, sparsità strutturata
I produttori citano spesso il throughput tensor con sparsità strutturata 2:4, che raddoppia il valore pubblicizzato. Quasi nessun training o inferenza la usa, quindi PetaPrice mostra sempre i valori densi.
$ per PFLOP-ora
$/PFLOP·h, costo per PFLOP
Il prezzo di una GPU-ora diviso per i PFLOPS densi di picco della GPU alla precisione scelta. Mostra quanta capacità di calcolo compra un dollaro, così GPU veloci e costose e GPU lente ed economiche si possono confrontare direttamente. Più basso è meglio.
Precisione
formato numerico, tipo di dato
Quanti bit usa ogni numero. Meno bit significano più throughput e meno memoria, al prezzo di una certa perdita di accuratezza. La stessa GPU ha un picco diverso per ogni precisione.
FP16 e BF16
bfloat16, mezza precisione
Formati a 16 bit e lo standard per il training e l'esecuzione degli LLM. BF16 mantiene l'intervallo di FP32 con meno precisione, il che rende il training più stabile; richiede Ampere, CDNA 2 o successive.
FP8
E4M3, E5M2, Float8
Virgola mobile a 8 bit per training e inferenza, con un throughput circa doppio rispetto a FP16. Nativo su Hopper, Ada, Blackwell e AMD CDNA 3 e successive.
FP4
NVFP4, MXFP4
Virgola mobile a 4 bit, usata per l'inferenza quantizzata. Solo Blackwell e AMD CDNA 4 la eseguono nativamente.
TF32
TensorFloat-32
Il formato a 19 bit di NVIDIA che esegue i calcoli matriciali FP32 sui tensor core. PyTorch può usarlo per le moltiplicazioni di matrici FP32 da Ampere in poi.
INT8 e TOPS
intero a 8 bit, TOPS
Interi a 8 bit per l'inferenza quantizzata. Il throughput si misura in TOPS (migliaia di miliardi di operazioni al secondo) anziché in FLOPS.
Tensor core / matrix core
matrix core
Unità che moltiplicano piccole matrici in un solo passaggio, da cui proviene quasi tutto il throughput AI di una GPU. NVIDIA li chiama tensor core, AMD matrix core.
MFU (model FLOPS utilization)
model FLOPS utilization, utilizzo della GPU
La quota dei FLOPS di picco che un carico di lavoro reale raggiunge. I grandi training arrivano in genere al 30–60%, quindi i picchi da scheda tecnica servono a confrontare le GPU, non a prevedere i tempi di esecuzione.

Memoria

VRAM
memoria GPU
La memoria propria della GPU. Pesi del modello, attivazioni e KV cache devono starci dentro (o essere suddivisi tra più GPU), quindi spesso è la VRAM a decidere quali GPU puoi usare.
HBM
HBM2e, HBM3, HBM3e, High Bandwidth Memory
High Bandwidth Memory, impilata accanto al chip nelle GPU da datacenter (HBM2e, HBM3, HBM3e). Molto più veloce della memoria GDDR delle schede consumer e workstation.
Banda di memoria
GB/s, TB/s
La velocità con cui la GPU legge la propria memoria, in GB/s o TB/s. La generazione di token degli LLM è di solito limitata dalla banda più che dai FLOPS, ed è per questo che PetaPrice può classificare le GPU per banda per dollaro.
KV cache
key-value cache, cache chiave-valore
La memoria che un LLM conserva per ogni token del contesto durante l'inferenza. Contesti lunghi e molte richieste in parallelo ne richiedono molta, oltre ai pesi del modello.

Hardware e interconnessione

SXM vs. PCIe
SXM5, PCI Express, form factor
Le GPU SXM sono montate su una baseboard con NVLink tra loro e ricevono più potenza, quindi sono più veloci. Le schede PCIe si inseriscono in uno slot normale, costano meno e di solito sono più lente. Una H100 SXM e una H100 PCIe sono prodotti diversi.
InfiniBand
IB, RoCE
La rete a bassa latenza usata per collegare i server GPU nei cluster di training. Il training su più nodi ne ha bisogno (o di Ethernet RoCE veloce); i job su un singolo nodo no.
Superchip
Grace Hopper, Grace Blackwell
CPU e GPU su un unico modulo con un collegamento veloce tra loro, come GH200 e GB200. La GPU può usare la memoria della CPU come estensione della propria.
Nodo
server, nodo da 8 GPU, HGX
Un server. Le GPU da datacenter sono di solito in nodi da 8 GPU; alcuni provider noleggiano solo nodi interi. PetaPrice mostra sempre il prezzo per GPU.
TDP
TGP, potenza della scheda
Thermal design power: all'incirca la potenza massima assorbita dalla GPU, in watt.
MIG e GPU frazionarie
Multi-Instance GPU, vGPU, GPU frazionaria
Multi-Instance GPU suddivide una A100, H100 o successiva in partizioni isolate. Le partizioni e le altre GPU frazionarie (vGPU) costano meno ma non sono GPU complete, quindi PetaPrice le esclude.

Prezzi e noleggio

On demand
pay-as-you-go, a consumo
Paghi a ore (o al secondo) senza vincoli e ti fermi quando vuoi. È la vista predefinita su PetaPrice.
Spot / interrompibile
preemptible, interrompibile
Capacità inutilizzata venduta a prezzo scontato, che il provider può revocare in qualsiasi momento. Adatta al training con checkpoint e ai job batch.
Riservato / con impegno
committed use, prezzi a contratto
Una tariffa oraria più bassa in cambio di un impegno, di solito da 1 a 3 anni o un contratto a termine.
Host community / marketplace
community cloud, peer-to-peer
Piattaforme come Vast.ai dove host indipendenti noleggiano le proprie macchine. Spesso l'opzione più economica, con affidabilità e sicurezza più variabili.
GPU-ora
GPU·h
Una GPU per un'ora. Un nodo da 8 GPU per 2 ore equivale a 16 GPU-ora. Una GPU in funzione 24 ore su 24 fa circa 730 GPU-ora al mese.
Traffico in uscita (egress)
trasferimento dati in uscita
I dati trasferiti fuori da un cloud. Alcuni provider lo fanno pagare; i prezzi di PetaPrice non lo includono, così come storage e indirizzi IP, salvo che il provider li includa.