So nutzen Sie PetaPrice
In wenigen Schritten die günstigste GPU für Ihre Workload finden, und worauf Sie bei der Auswahl achten sollten.
PetaPrice Schritt für Schritt
Optimierungsziel wählen
Wählen Sie auf der Startseite FLOPS für Training und rechenintensive Aufgaben, VRAM für das größte Modell pro Dollar oder Bandbreite für die Token-Generierung von LLMs. Bei FLOPS wählen Sie außerdem die Präzision, in der Sie rechnen, meist FP16/BF16.
Auf passende GPUs filtern
Legen Sie einen Mindest-VRAM fest, damit Ihr Modell hineinpasst, dazu die Zahl der GPUs pro Instanz und On-Demand-, Spot- oder reservierte Preise. Außerdem können Sie nach Hersteller, Sitz des Anbieters (nur EU) und Managed Cloud vs. Community-Hosts filtern.
Die Rangliste lesen
Die Rangliste sortiert GPUs nach Preis-Leistungs-Verhältnis beim jeweils günstigsten passenden Angebot. Die Beschriftung zeigt, wie viel mehr jede GPU pro Einheit kostet als die beste. Das Sweet-Spot-Diagramm stellt Preis gegen Leistung dar: Oben links ist besser.
Eine GPU öffnen
Die Seite einer GPU listet jeden Anbieter, der sie vermietet, jede Konfiguration mit Preis, einen täglichen Preisverlauf und die Kosten bei jeder Präzision. Tippen Sie auf einen Anbieter, um seine Konfigurationen und den Link zum Mieten zu sehen.
GPUs direkt vergleichen
Wählen Sie im Vergleich bis zu vier GPUs aus, um Preise, Rechenleistung pro Dollar, Speicher, Bandbreite und Anbieter nebeneinander zu sehen.
Preis prüfen und mieten
Die Preise sind unverbindliche Listenpreise, die etwa alle 2 Stunden aktualisiert werden. Folgen Sie dem Link „Mieten“ und bestätigen Sie den Preis auf der Website des Anbieters, bevor Sie buchen.
Die passende GPU für Ihre Workload
Worauf es bei jeder Art von Job ankommt und welche GPUs dafür derzeit das beste Preis-Leistungs-Verhältnis bieten.
LLM-Inferenz
Worauf es ankommt: Genug Speicher für Gewichte und KV-Cache, danach die Speicherbandbreite: Die Token-Generierung ist durch die Bandbreite begrenzt.
Aktuell bestes Preis-Leistungs-Verhältnis · Beste Bandbreite pro Dollar mit 80 GB oder mehr
- 1Instinct MI355X$2.59/h$0.32/TB/s·h
- 2Instinct MI325X$2.00/h$0.33/TB/s·h
- 3Instinct MI300X$1.85/h$0.35/TB/s·h
Training und Fine-Tuning
Worauf es ankommt: Dichte BF16- oder FP8-Rechenleistung, Speicher für Gewichte, Gradienten und Optimizer-Zustand sowie NVLink zwischen den GPUs.
Aktuell bestes Preis-Leistungs-Verhältnis · Beste FP8-Rechenleistung pro Dollar, Rechenzentrums-GPUs
- 1Instinct MI355X$2.59/h$0.51/PFLOP·h
- 2Instinct MI300X$1.85/h$0.71/PFLOP·h
- 3B200 SXM$3.20/h$0.71/PFLOP·h
Experimente und kleine Modelle
Worauf es ankommt: Ein niedriger Stundenpreis und mindestens 24 GB. Consumer- und Workstation-Karten sind oft der günstigste Einstieg.
Aktuell bestes Preis-Leistungs-Verhältnis · Günstigste GPU-Stunde mit 24 GB oder mehr
Diese Ansicht öffnen →Wissenschaftliches Rechnen (FP64)
Worauf es ankommt: Durchsatz in doppelter Genauigkeit. Viele KI-GPUs, darunter Blackwell und alle Consumer-Karten, bieten davon wenig.
Aktuell bestes Preis-Leistungs-Verhältnis · Beste FP64-Rechenleistung pro Dollar
- 1Instinct MI300X$1.85/h$11.3/PFLOP·h
- 2Instinct MI325X$2.00/h$12.2/PFLOP·h
- 3V100 SXM2 16GB$0.19/h$24.4/PFLOP·h
Welche Präzision?
Geringere Präzision ist schneller und braucht weniger Speicher, sofern Ihre GPU sie nativ ausführt und Ihr Modell sie verträgt.
| Format | Bits | Verwendet für | Nativ auf |
|---|---|---|---|
| FP64 | 64 | Wissenschaftliche Simulation | Alle |
| FP32 | 32 | Rechnen ohne Tensor Cores, numerisch empfindlicher Code | Alle |
| TF32 | 19 | FP32-Training auf Tensor Cores | Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 3, Xe-HPC, Ampere |
| FP16 / BF16 | 16 | Der Standard für Training und Betrieb von LLMs | Blackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, Gaudi, TPU, Trainium, RDNA 3, Xe-HPC, Inferentia, Ampere, CDNA 2, CDNA |
| FP8 | 8 | Schnelleres Training und schnellere Inferenz auf neueren GPUs | Blackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, Gaudi, Trainium, Inferentia |
| INT8 | 8 | Quantisierte Inferenz | Blackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, TPU, RDNA 3, Xe-HPC, Inferentia, Ampere, CDNA 2, CDNA, Turing |
| FP4 | 4 | Quantisierte Inferenz großer Modelle | Blackwell Ultra, Blackwell, CDNA 4 |
Bevor Sie mieten
- Das Modell passt in den VRAM, einschließlich KV-Cache bzw. Optimizer-Zustand.
- Die GPU führt Ihre Präzision nativ aus (FP8 und FP4 nur auf neueren Generationen).
- Jobs auf mehreren GPUs: SXM mit NVLink, über mehrere Server hinweg zusätzlich InfiniBand.
- Das Preismodell passt zum Job: Spot nur, wenn Sie Checkpoints schreiben.
- Speicher, Egress sowie CPU und RAM, die zur Instanz gehören.
- Der endgültige Preis auf der Website des Anbieters.
Tipps
- Filter werden in der URL gespeichert, sodass Sie jede Ansicht als Lesezeichen speichern oder teilen können.
- Spot-Kapazität kostet oft die Hälfte oder weniger, kann aber jederzeit gestoppt werden. Nutzen Sie sie für Jobs mit Checkpoints.
- Vergleichen Sie dense FLOPS in der Präzision, die Sie tatsächlich nutzen: FP8- und FP4-Werte helfen nur, wenn Ihre Software sie verwendet.
- Die Seite jedes Anbieters zeigt alle GPUs, die er vermietet, und wie seine Preise im Vergleich zum günstigsten Anbieter abschneiden.