PetaPrice

GPU-Glossar

Die Begriffe, die Ihnen beim Vergleichen und Mieten von Cloud-GPUs begegnen, verständlich erklärt.

Rechenleistung

FLOPS, TFLOPS, PFLOPS
TeraFLOPS, PetaFLOPS, FLOP/s
Gleitkommaoperationen pro Sekunde: wie viel Rechenarbeit ein Chip leisten kann. 1 TFLOPS sind eine Billion pro Sekunde, 1 PFLOPS (PetaFLOPS) sind tausend TFLOPS. PetaPrice gibt alle Rechenleistung in PFLOPS an.
Dense vs. sparse FLOPS
2:4-Sparsity, Structured Sparsity
Hersteller geben den Tensor-Durchsatz oft mit 2:4-Structured-Sparsity an, was den beworbenen Wert verdoppelt. Training und Inferenz nutzen das so gut wie nie, daher zeigt PetaPrice immer dichte Werte.
$ pro PFLOP-Stunde
$/PFLOP·h, Kosten pro PFLOP
Der Preis einer GPU-Stunde geteilt durch die dichten Spitzen-PFLOPS der GPU bei der gewählten Präzision. Er zeigt, wie viel Rechenleistung ein Dollar kauft, sodass sich schnelle teure und langsame günstige GPUs direkt vergleichen lassen. Niedriger ist besser.
Präzision
Zahlenformat, Datentyp
Wie viele Bits jede Zahl belegt. Weniger Bits bedeuten mehr Durchsatz und weniger Speicherbedarf, kosten aber etwas Genauigkeit. Dieselbe GPU hat für jede Präzision einen anderen Spitzenwert.
FP16 und BF16
bfloat16, halbe Genauigkeit
16-Bit-Formate und der Standard für Training und Betrieb von LLMs. BF16 behält den Wertebereich von FP32 bei geringerer Genauigkeit, was das Training stabiler macht; es setzt Ampere, CDNA 2 oder neuer voraus.
FP8
E4M3, E5M2, Float8
8-Bit-Gleitkomma für Training und Inferenz, mit etwa doppeltem Durchsatz gegenüber FP16. Nativ auf Hopper, Ada, Blackwell sowie AMD CDNA 3 und neuer.
FP4
NVFP4, MXFP4
4-Bit-Gleitkomma für quantisierte Inferenz. Nur Blackwell und AMD CDNA 4 führen es nativ aus.
TF32
TensorFloat-32
NVIDIAs 19-Bit-Format, mit dem FP32-Matrixrechnungen auf Tensor Cores laufen. PyTorch kann es ab Ampere für FP32-Matrixmultiplikationen nutzen.
INT8 und TOPS
8-Bit-Ganzzahl, TOPS
8-Bit-Ganzzahlen für quantisierte Inferenz. Der Durchsatz wird in TOPS (Billionen Operationen pro Sekunde) statt in FLOPS gemessen.
Tensor Cores / Matrix Cores
Matrix Cores
Recheneinheiten, die kleine Matrizen in einem Schritt multiplizieren; aus ihnen stammt fast der gesamte KI-Durchsatz einer GPU. NVIDIA nennt sie Tensor Cores, AMD Matrix Cores.
MFU (Model FLOPS Utilization)
Model FLOPS Utilization, GPU-Auslastung
Der Anteil der Spitzen-FLOPS, den eine reale Last tatsächlich erreicht. Große Trainingsläufe kommen meist auf 30–60 %, daher dienen Datenblatt-Spitzenwerte zum Vergleich von GPUs, nicht zur Vorhersage der Laufzeit.

Speicher

VRAM
GPU-Speicher
Der eigene Speicher der GPU. Modellgewichte, Aktivierungen und KV-Cache müssen hineinpassen (oder auf mehrere GPUs verteilt werden), daher entscheidet der VRAM oft, welche GPU überhaupt infrage kommt.
HBM
HBM2e, HBM3, HBM3e, High Bandwidth Memory
High Bandwidth Memory, bei Rechenzentrums-GPUs direkt neben dem Chip gestapelt (HBM2e, HBM3, HBM3e). Um ein Mehrfaches schneller als der GDDR-Speicher auf Consumer- und Workstation-Karten.
Speicherbandbreite
GB/s, TB/s
Wie schnell die GPU ihren Speicher liest, in GB/s oder TB/s. Die Token-Generierung von LLMs ist meist durch die Bandbreite begrenzt statt durch die FLOPS; deshalb kann PetaPrice GPUs nach Bandbreite pro Dollar sortieren.
KV-Cache
Key-Value-Cache
Speicher, den ein LLM während der Inferenz für jedes Token in seinem Kontext belegt. Lange Kontexte und viele parallele Anfragen brauchen viel davon, zusätzlich zu den Modellgewichten.

Hardware und Vernetzung

SXM vs. PCIe
SXM5, PCI Express, Formfaktor
SXM-GPUs sitzen auf einem Baseboard, sind untereinander per NVLink verbunden und bekommen mehr Strom, daher laufen sie schneller. PCIe-Karten stecken in einem normalen Steckplatz, kosten weniger und sind meist langsamer. Eine H100 SXM und eine H100 PCIe sind unterschiedliche Produkte.
InfiniBand
IB, RoCE
Das Netzwerk mit niedriger Latenz, das GPU-Server in Trainingsclustern verbindet. Training über mehrere Nodes braucht es (oder schnelles RoCE-Ethernet), Jobs auf einem einzelnen Node nicht.
Superchip
Grace Hopper, Grace Blackwell
CPU und GPU auf einem Modul mit einer schnellen Verbindung dazwischen, etwa GH200 und GB200. Die GPU kann den Speicher der CPU als Erweiterung ihres eigenen nutzen.
Node
Server, 8-GPU-Node, HGX
Ein Server. Rechenzentrums-GPUs gibt es meist als Nodes mit 8 GPUs; manche Anbieter vermieten nur ganze Nodes. PetaPrice zeigt immer den Preis pro GPU.
TDP
TGP, Board Power
Thermal Design Power: ungefähr die maximale Leistungsaufnahme der GPU in Watt.
MIG und GPU-Bruchteile
Multi-Instance GPU, vGPU, GPU-Bruchteil
Multi-Instance GPU teilt eine A100, H100 oder neuere GPU in isolierte Slices auf. Slices und andere GPU-Bruchteile (vGPUs) sind günstiger, aber keine vollständigen GPUs, daher lässt PetaPrice sie weg.

Preise und Mieten

On-Demand
Pay-as-you-go
Abrechnung pro Stunde (oder Sekunde) ohne Bindung; Sie können jederzeit aufhören. Die Standardansicht auf PetaPrice.
Spot / unterbrechbar
Preemptible, unterbrechbar
Freie Kapazität, die mit Rabatt verkauft wird und die der Anbieter jederzeit zurückholen kann. Gut geeignet für Training mit Checkpoints und Batch-Jobs.
Reserviert / mit Laufzeit
Committed Use, Vertragspreise
Ein niedrigerer Stundenpreis gegen eine Bindung, meist 1 bis 3 Jahre oder ein fester Vertrag.
Community- / Marktplatz-Hosts
Community Cloud, Peer-to-Peer
Plattformen wie Vast.ai, auf denen unabhängige Hosts ihre Rechner vermieten. Oft die günstigste Option, mit größeren Unterschieden bei Zuverlässigkeit und Sicherheit.
GPU-Stunde
GPU·h
Eine GPU für eine Stunde. Ein Node mit 8 GPUs für 2 Stunden sind 16 GPU-Stunden. Eine GPU im Dauerbetrieb kommt auf etwa 730 GPU-Stunden im Monat.
Egress
ausgehender Datenverkehr
Daten, die aus einer Cloud heraus übertragen werden. Manche Anbieter berechnen sie; die Preise auf PetaPrice enthalten sie nicht, ebenso wenig Speicher und IP-Adressen, sofern der Anbieter diese nicht einschließt.