MFU (Model FLOPS Utilization)
Auch bekannt als: Model FLOPS Utilization, GPU-Auslastung
Der Anteil der Spitzen-FLOPS, den eine reale Last tatsächlich erreicht. Große Trainingsläufe kommen meist auf 30–60 %, daher dienen Datenblatt-Spitzenwerte zum Vergleich von GPUs, nicht zur Vorhersage der Laufzeit.
Verwandte Begriffe
- FLOPS, TFLOPS, PFLOPSGleitkommaoperationen pro Sekunde: wie viel Rechenarbeit ein Chip leisten kann. 1 TFLOPS sind eine Billion pro Sekunde, 1 PFLOPS (PetaFLOPS) sind tausend TFLOPS. PetaPrice gibt alle Rechenleistung in PFLOPS an.
- Dense vs. sparse FLOPSHersteller geben den Tensor-Durchsatz oft mit 2:4-Structured-Sparsity an, was den beworbenen Wert verdoppelt. Training und Inferenz nutzen das so gut wie nie, daher zeigt PetaPrice immer dichte Werte.
- SpeicherbandbreiteWie schnell die GPU ihren Speicher liest, in GB/s oder TB/s. Die Token-Generierung von LLMs ist meist durch die Bandbreite begrenzt statt durch die FLOPS; deshalb kann PetaPrice GPUs nach Bandbreite pro Dollar sortieren.
Rechenleistung
- $ pro PFLOP-StundeDer Preis einer GPU-Stunde geteilt durch die dichten Spitzen-PFLOPS der GPU bei der gewählten Präzision. Er zeigt, wie viel Rechenleistung ein Dollar kauft, sodass sich schnelle teure und langsame günstige GPUs direkt vergleichen lassen. Niedriger ist besser.
- PräzisionWie viele Bits jede Zahl belegt. Weniger Bits bedeuten mehr Durchsatz und weniger Speicherbedarf, kosten aber etwas Genauigkeit. Dieselbe GPU hat für jede Präzision einen anderen Spitzenwert.
- FP16 und BF1616-Bit-Formate und der Standard für Training und Betrieb von LLMs. BF16 behält den Wertebereich von FP32 bei geringerer Genauigkeit, was das Training stabiler macht; es setzt Ampere, CDNA 2 oder neuer voraus.
- FP88-Bit-Gleitkomma für Training und Inferenz, mit etwa doppeltem Durchsatz gegenüber FP16. Nativ auf Hopper, Ada, Blackwell sowie AMD CDNA 3 und neuer.
- FP44-Bit-Gleitkomma für quantisierte Inferenz. Nur Blackwell und AMD CDNA 4 führen es nativ aus.
- TF32NVIDIAs 19-Bit-Format, mit dem FP32-Matrixrechnungen auf Tensor Cores laufen. PyTorch kann es ab Ampere für FP32-Matrixmultiplikationen nutzen.
- INT8 und TOPS8-Bit-Ganzzahlen für quantisierte Inferenz. Der Durchsatz wird in TOPS (Billionen Operationen pro Sekunde) statt in FLOPS gemessen.
- Tensor Cores / Matrix CoresRecheneinheiten, die kleine Matrizen in einem Schritt multiplizieren; aus ihnen stammt fast der gesamte KI-Durchsatz einer GPU. NVIDIA nennt sie Tensor Cores, AMD Matrix Cores.