GPU-Glossar
Die Begriffe, die Ihnen beim Vergleichen und Mieten von Cloud-GPUs begegnen, verständlich erklärt.
Rechenleistung
- FLOPS, TFLOPS, PFLOPS
- TeraFLOPS, PetaFLOPS, FLOP/s
- Gleitkommaoperationen pro Sekunde: wie viel Rechenarbeit ein Chip leisten kann. 1 TFLOPS sind eine Billion pro Sekunde, 1 PFLOPS (PetaFLOPS) sind tausend TFLOPS. PetaPrice gibt alle Rechenleistung in PFLOPS an.
- Dense vs. sparse FLOPS
- 2:4-Sparsity, Structured Sparsity
- Hersteller geben den Tensor-Durchsatz oft mit 2:4-Structured-Sparsity an, was den beworbenen Wert verdoppelt. Training und Inferenz nutzen das so gut wie nie, daher zeigt PetaPrice immer dichte Werte.
- $ pro PFLOP-Stunde
- $/PFLOP·h, Kosten pro PFLOP
- Der Preis einer GPU-Stunde geteilt durch die dichten Spitzen-PFLOPS der GPU bei der gewählten Präzision. Er zeigt, wie viel Rechenleistung ein Dollar kauft, sodass sich schnelle teure und langsame günstige GPUs direkt vergleichen lassen. Niedriger ist besser.
- Präzision
- Zahlenformat, Datentyp
- Wie viele Bits jede Zahl belegt. Weniger Bits bedeuten mehr Durchsatz und weniger Speicherbedarf, kosten aber etwas Genauigkeit. Dieselbe GPU hat für jede Präzision einen anderen Spitzenwert.
- FP16 und BF16
- bfloat16, halbe Genauigkeit
- 16-Bit-Formate und der Standard für Training und Betrieb von LLMs. BF16 behält den Wertebereich von FP32 bei geringerer Genauigkeit, was das Training stabiler macht; es setzt Ampere, CDNA 2 oder neuer voraus.
- FP8
- E4M3, E5M2, Float8
- 8-Bit-Gleitkomma für Training und Inferenz, mit etwa doppeltem Durchsatz gegenüber FP16. Nativ auf Hopper, Ada, Blackwell sowie AMD CDNA 3 und neuer.
- FP4
- NVFP4, MXFP4
- 4-Bit-Gleitkomma für quantisierte Inferenz. Nur Blackwell und AMD CDNA 4 führen es nativ aus.
- TF32
- TensorFloat-32
- NVIDIAs 19-Bit-Format, mit dem FP32-Matrixrechnungen auf Tensor Cores laufen. PyTorch kann es ab Ampere für FP32-Matrixmultiplikationen nutzen.
- INT8 und TOPS
- 8-Bit-Ganzzahl, TOPS
- 8-Bit-Ganzzahlen für quantisierte Inferenz. Der Durchsatz wird in TOPS (Billionen Operationen pro Sekunde) statt in FLOPS gemessen.
- Tensor Cores / Matrix Cores
- Matrix Cores
- Recheneinheiten, die kleine Matrizen in einem Schritt multiplizieren; aus ihnen stammt fast der gesamte KI-Durchsatz einer GPU. NVIDIA nennt sie Tensor Cores, AMD Matrix Cores.
- MFU (Model FLOPS Utilization)
- Model FLOPS Utilization, GPU-Auslastung
- Der Anteil der Spitzen-FLOPS, den eine reale Last tatsächlich erreicht. Große Trainingsläufe kommen meist auf 30–60 %, daher dienen Datenblatt-Spitzenwerte zum Vergleich von GPUs, nicht zur Vorhersage der Laufzeit.
Speicher
- VRAM
- GPU-Speicher
- Der eigene Speicher der GPU. Modellgewichte, Aktivierungen und KV-Cache müssen hineinpassen (oder auf mehrere GPUs verteilt werden), daher entscheidet der VRAM oft, welche GPU überhaupt infrage kommt.
- HBM
- HBM2e, HBM3, HBM3e, High Bandwidth Memory
- High Bandwidth Memory, bei Rechenzentrums-GPUs direkt neben dem Chip gestapelt (HBM2e, HBM3, HBM3e). Um ein Mehrfaches schneller als der GDDR-Speicher auf Consumer- und Workstation-Karten.
- Speicherbandbreite
- GB/s, TB/s
- Wie schnell die GPU ihren Speicher liest, in GB/s oder TB/s. Die Token-Generierung von LLMs ist meist durch die Bandbreite begrenzt statt durch die FLOPS; deshalb kann PetaPrice GPUs nach Bandbreite pro Dollar sortieren.
- KV-Cache
- Key-Value-Cache
- Speicher, den ein LLM während der Inferenz für jedes Token in seinem Kontext belegt. Lange Kontexte und viele parallele Anfragen brauchen viel davon, zusätzlich zu den Modellgewichten.
Hardware und Vernetzung
- SXM vs. PCIe
- SXM5, PCI Express, Formfaktor
- SXM-GPUs sitzen auf einem Baseboard, sind untereinander per NVLink verbunden und bekommen mehr Strom, daher laufen sie schneller. PCIe-Karten stecken in einem normalen Steckplatz, kosten weniger und sind meist langsamer. Eine H100 SXM und eine H100 PCIe sind unterschiedliche Produkte.
- NVLink und NVSwitch
- NVSwitch, NVLink-C2C, Infinity Fabric
- NVIDIAs schnelle Verbindungen zwischen den GPUs eines Servers, weit schneller als PCIe. Sie sind wichtig, wenn ein Modell auf mehrere GPUs verteilt wird. Das Gegenstück bei AMD heißt Infinity Fabric.
- InfiniBand
- IB, RoCE
- Das Netzwerk mit niedriger Latenz, das GPU-Server in Trainingsclustern verbindet. Training über mehrere Nodes braucht es (oder schnelles RoCE-Ethernet), Jobs auf einem einzelnen Node nicht.
- Superchip
- Grace Hopper, Grace Blackwell
- CPU und GPU auf einem Modul mit einer schnellen Verbindung dazwischen, etwa GH200 und GB200. Die GPU kann den Speicher der CPU als Erweiterung ihres eigenen nutzen.
- Node
- Server, 8-GPU-Node, HGX
- Ein Server. Rechenzentrums-GPUs gibt es meist als Nodes mit 8 GPUs; manche Anbieter vermieten nur ganze Nodes. PetaPrice zeigt immer den Preis pro GPU.
- MIG und GPU-Bruchteile
- Multi-Instance GPU, vGPU, GPU-Bruchteil
- Multi-Instance GPU teilt eine A100, H100 oder neuere GPU in isolierte Slices auf. Slices und andere GPU-Bruchteile (vGPUs) sind günstiger, aber keine vollständigen GPUs, daher lässt PetaPrice sie weg.
Preise und Mieten
- On-Demand
- Pay-as-you-go
- Abrechnung pro Stunde (oder Sekunde) ohne Bindung; Sie können jederzeit aufhören. Die Standardansicht auf PetaPrice.
- Spot / unterbrechbar
- Preemptible, unterbrechbar
- Freie Kapazität, die mit Rabatt verkauft wird und die der Anbieter jederzeit zurückholen kann. Gut geeignet für Training mit Checkpoints und Batch-Jobs.
- Reserviert / mit Laufzeit
- Committed Use, Vertragspreise
- Ein niedrigerer Stundenpreis gegen eine Bindung, meist 1 bis 3 Jahre oder ein fester Vertrag.
- Community- / Marktplatz-Hosts
- Community Cloud, Peer-to-Peer
- Plattformen wie Vast.ai, auf denen unabhängige Hosts ihre Rechner vermieten. Oft die günstigste Option, mit größeren Unterschieden bei Zuverlässigkeit und Sicherheit.
- GPU-Stunde
- GPU·h
- Eine GPU für eine Stunde. Ein Node mit 8 GPUs für 2 Stunden sind 16 GPU-Stunden. Eine GPU im Dauerbetrieb kommt auf etwa 730 GPU-Stunden im Monat.
- Egress
- ausgehender Datenverkehr
- Daten, die aus einer Cloud heraus übertragen werden. Manche Anbieter berechnen sie; die Preise auf PetaPrice enthalten sie nicht, ebenso wenig Speicher und IP-Adressen, sofern der Anbieter diese nicht einschließt.