Glossario GPU
I termini che incontri quando confronti e noleggi GPU cloud, spiegati in modo semplice.
Calcolo
- FLOPS, TFLOPS, PFLOPS
- TeraFLOPS, PetaFLOPS, FLOP/s
- Operazioni in virgola mobile al secondo: quanti calcoli aritmetici può eseguire un chip. 1 TFLOPS equivale a mille miliardi al secondo, 1 PFLOPS (PetaFLOPS) a mille TFLOPS. PetaPrice mostra tutta la capacità di calcolo in PFLOPS.
- FLOPS densi vs. sparsi
- sparsità 2:4, sparsità strutturata
- I produttori citano spesso il throughput tensor con sparsità strutturata 2:4, che raddoppia il valore pubblicizzato. Quasi nessun training o inferenza la usa, quindi PetaPrice mostra sempre i valori densi.
- $ per PFLOP-ora
- $/PFLOP·h, costo per PFLOP
- Il prezzo di una GPU-ora diviso per i PFLOPS densi di picco della GPU alla precisione scelta. Mostra quanta capacità di calcolo compra un dollaro, così GPU veloci e costose e GPU lente ed economiche si possono confrontare direttamente. Più basso è meglio.
- Precisione
- formato numerico, tipo di dato
- Quanti bit usa ogni numero. Meno bit significano più throughput e meno memoria, al prezzo di una certa perdita di accuratezza. La stessa GPU ha un picco diverso per ogni precisione.
- FP16 e BF16
- bfloat16, mezza precisione
- Formati a 16 bit e lo standard per il training e l'esecuzione degli LLM. BF16 mantiene l'intervallo di FP32 con meno precisione, il che rende il training più stabile; richiede Ampere, CDNA 2 o successive.
- FP8
- E4M3, E5M2, Float8
- Virgola mobile a 8 bit per training e inferenza, con un throughput circa doppio rispetto a FP16. Nativo su Hopper, Ada, Blackwell e AMD CDNA 3 e successive.
- FP4
- NVFP4, MXFP4
- Virgola mobile a 4 bit, usata per l'inferenza quantizzata. Solo Blackwell e AMD CDNA 4 la eseguono nativamente.
- TF32
- TensorFloat-32
- Il formato a 19 bit di NVIDIA che esegue i calcoli matriciali FP32 sui tensor core. PyTorch può usarlo per le moltiplicazioni di matrici FP32 da Ampere in poi.
- INT8 e TOPS
- intero a 8 bit, TOPS
- Interi a 8 bit per l'inferenza quantizzata. Il throughput si misura in TOPS (migliaia di miliardi di operazioni al secondo) anziché in FLOPS.
- Tensor core / matrix core
- matrix core
- Unità che moltiplicano piccole matrici in un solo passaggio, da cui proviene quasi tutto il throughput AI di una GPU. NVIDIA li chiama tensor core, AMD matrix core.
- MFU (model FLOPS utilization)
- model FLOPS utilization, utilizzo della GPU
- La quota dei FLOPS di picco che un carico di lavoro reale raggiunge. I grandi training arrivano in genere al 30–60%, quindi i picchi da scheda tecnica servono a confrontare le GPU, non a prevedere i tempi di esecuzione.
Memoria
- VRAM
- memoria GPU
- La memoria propria della GPU. Pesi del modello, attivazioni e KV cache devono starci dentro (o essere suddivisi tra più GPU), quindi spesso è la VRAM a decidere quali GPU puoi usare.
- HBM
- HBM2e, HBM3, HBM3e, High Bandwidth Memory
- High Bandwidth Memory, impilata accanto al chip nelle GPU da datacenter (HBM2e, HBM3, HBM3e). Molto più veloce della memoria GDDR delle schede consumer e workstation.
- Banda di memoria
- GB/s, TB/s
- La velocità con cui la GPU legge la propria memoria, in GB/s o TB/s. La generazione di token degli LLM è di solito limitata dalla banda più che dai FLOPS, ed è per questo che PetaPrice può classificare le GPU per banda per dollaro.
- KV cache
- key-value cache, cache chiave-valore
- La memoria che un LLM conserva per ogni token del contesto durante l'inferenza. Contesti lunghi e molte richieste in parallelo ne richiedono molta, oltre ai pesi del modello.
Hardware e interconnessione
- SXM vs. PCIe
- SXM5, PCI Express, form factor
- Le GPU SXM sono montate su una baseboard con NVLink tra loro e ricevono più potenza, quindi sono più veloci. Le schede PCIe si inseriscono in uno slot normale, costano meno e di solito sono più lente. Una H100 SXM e una H100 PCIe sono prodotti diversi.
- NVLink e NVSwitch
- NVSwitch, NVLink-C2C, Infinity Fabric
- I collegamenti ad alta velocità di NVIDIA tra le GPU di uno stesso server, molto più veloci di PCIe. Contano quando un modello è suddiviso tra più GPU. L'equivalente di AMD è Infinity Fabric.
- InfiniBand
- IB, RoCE
- La rete a bassa latenza usata per collegare i server GPU nei cluster di training. Il training su più nodi ne ha bisogno (o di Ethernet RoCE veloce); i job su un singolo nodo no.
- Superchip
- Grace Hopper, Grace Blackwell
- CPU e GPU su un unico modulo con un collegamento veloce tra loro, come GH200 e GB200. La GPU può usare la memoria della CPU come estensione della propria.
- Nodo
- server, nodo da 8 GPU, HGX
- Un server. Le GPU da datacenter sono di solito in nodi da 8 GPU; alcuni provider noleggiano solo nodi interi. PetaPrice mostra sempre il prezzo per GPU.
- TDP
- TGP, potenza della scheda
- Thermal design power: all'incirca la potenza massima assorbita dalla GPU, in watt.
- MIG e GPU frazionarie
- Multi-Instance GPU, vGPU, GPU frazionaria
- Multi-Instance GPU suddivide una A100, H100 o successiva in partizioni isolate. Le partizioni e le altre GPU frazionarie (vGPU) costano meno ma non sono GPU complete, quindi PetaPrice le esclude.
Prezzi e noleggio
- On demand
- pay-as-you-go, a consumo
- Paghi a ore (o al secondo) senza vincoli e ti fermi quando vuoi. È la vista predefinita su PetaPrice.
- Spot / interrompibile
- preemptible, interrompibile
- Capacità inutilizzata venduta a prezzo scontato, che il provider può revocare in qualsiasi momento. Adatta al training con checkpoint e ai job batch.
- Riservato / con impegno
- committed use, prezzi a contratto
- Una tariffa oraria più bassa in cambio di un impegno, di solito da 1 a 3 anni o un contratto a termine.
- Host community / marketplace
- community cloud, peer-to-peer
- Piattaforme come Vast.ai dove host indipendenti noleggiano le proprie macchine. Spesso l'opzione più economica, con affidabilità e sicurezza più variabili.
- GPU-ora
- GPU·h
- Una GPU per un'ora. Un nodo da 8 GPU per 2 ore equivale a 16 GPU-ora. Una GPU in funzione 24 ore su 24 fa circa 730 GPU-ora al mese.
- Traffico in uscita (egress)
- trasferimento dati in uscita
- I dati trasferiti fuori da un cloud. Alcuni provider lo fanno pagare; i prezzi di PetaPrice non lo includono, così come storage e indirizzi IP, salvo che il provider li includa.