MFU (model FLOPS utilization)
Noto anche come: model FLOPS utilization, utilizzo della GPU
La quota dei FLOPS di picco che un carico di lavoro reale raggiunge. I grandi training arrivano in genere al 30–60%, quindi i picchi da scheda tecnica servono a confrontare le GPU, non a prevedere i tempi di esecuzione.
Termini correlati
- FLOPS, TFLOPS, PFLOPSOperazioni in virgola mobile al secondo: quanti calcoli aritmetici può eseguire un chip. 1 TFLOPS equivale a mille miliardi al secondo, 1 PFLOPS (PetaFLOPS) a mille TFLOPS. PetaPrice mostra tutta la capacità di calcolo in PFLOPS.
- FLOPS densi vs. sparsiI produttori citano spesso il throughput tensor con sparsità strutturata 2:4, che raddoppia il valore pubblicizzato. Quasi nessun training o inferenza la usa, quindi PetaPrice mostra sempre i valori densi.
- Banda di memoriaLa velocità con cui la GPU legge la propria memoria, in GB/s o TB/s. La generazione di token degli LLM è di solito limitata dalla banda più che dai FLOPS, ed è per questo che PetaPrice può classificare le GPU per banda per dollaro.
Calcolo
- $ per PFLOP-oraIl prezzo di una GPU-ora diviso per i PFLOPS densi di picco della GPU alla precisione scelta. Mostra quanta capacità di calcolo compra un dollaro, così GPU veloci e costose e GPU lente ed economiche si possono confrontare direttamente. Più basso è meglio.
- PrecisioneQuanti bit usa ogni numero. Meno bit significano più throughput e meno memoria, al prezzo di una certa perdita di accuratezza. La stessa GPU ha un picco diverso per ogni precisione.
- FP16 e BF16Formati a 16 bit e lo standard per il training e l'esecuzione degli LLM. BF16 mantiene l'intervallo di FP32 con meno precisione, il che rende il training più stabile; richiede Ampere, CDNA 2 o successive.
- FP8Virgola mobile a 8 bit per training e inferenza, con un throughput circa doppio rispetto a FP16. Nativo su Hopper, Ada, Blackwell e AMD CDNA 3 e successive.
- FP4Virgola mobile a 4 bit, usata per l'inferenza quantizzata. Solo Blackwell e AMD CDNA 4 la eseguono nativamente.
- TF32Il formato a 19 bit di NVIDIA che esegue i calcoli matriciali FP32 sui tensor core. PyTorch può usarlo per le moltiplicazioni di matrici FP32 da Ampere in poi.
- INT8 e TOPSInteri a 8 bit per l'inferenza quantizzata. Il throughput si misura in TOPS (migliaia di miliardi di operazioni al secondo) anziché in FLOPS.
- Tensor core / matrix coreUnità che moltiplicano piccole matrici in un solo passaggio, da cui proviene quasi tutto il throughput AI di una GPU. NVIDIA li chiama tensor core, AMD matrix core.