PetaPrice

GPU-Architekturen

Alle Generationen, die wir erfassen, die neueste zuerst. Zu jeder stehen ihre GPUs mit dem heute niedrigsten On-Demand-Preis, die Präzisionen, die ihre Tensor Cores nativ ausführen, und der größte Speicher pro GPU.

Hopper vs. Blackwell →

Architektur, Produkt, Superchip

Architektur
Das Design, das eine Chipfamilie gemeinsam hat: Tensor Cores, unterstützte Präzisionen, Speichersystem. Hopper, Blackwell und CDNA 3 sind Architekturen.
Produkt
Eine GPU auf Basis einer Architektur, in einer Speichergröße und einem Formfaktor. H100 SXM, H100 PCIe und H200 sind drei Produkte auf Hopper-Basis, jedes mit eigenem Preis.
Superchip
Eine CPU und eine oder zwei GPUs auf einem Modul (GH200, GB200). PetaPrice zeigt den Preis pro GPU; die CPU ist inbegriffen.

Im direkten Vergleich

Größter Speicher und höchste Leistungsaufnahme pro GPU in jeder Architektur sowie ihre aktuell günstigste Rechenleistung.

ArchitekturHerstellerJahrMax. SpeicherMax. LeistungsaufnahmeNative PräzisionenBeste FP16-Preis-Leistung
Blackwell UltraNVIDIA2025288 GB HBM3e1,400 WFP4 · FP8 · FP16 / BF16 · TF32 · INT8$2.93/PFLOP·h (B300 SXM)
BlackwellNVIDIA2024–2025186 GB HBM3e1,200 WFP4 · FP8 · FP16 / BF16 · TF32 · INT8$1.42/PFLOP·h (B200 SXM)
HopperNVIDIA2022–2024141 GB HBM3e1,000 WFP8 · FP16 / BF16 · TF32 · INT8$1.83/PFLOP·h (H100 SXM)
Ada LovelaceNVIDIA2022–202448 GB GDDR6450 WFP8 · FP16 / BF16 · TF32 · INT8$1.52/PFLOP·h (RTX 4070 SUPER)
AmpereNVIDIA2020–202280 GB HBM2e450 WFP16 / BF16 · TF32 · INT8$1.44/PFLOP·h (RTX A5000)
TuringNVIDIA201848 GB GDDR6295 WFP16 · INT8$1.95/PFLOP·h (Quadro RTX 8000)
VoltaNVIDIA2017–201932 GB HBM2300 WFP16$1.52/PFLOP·h (V100 SXM2 16GB)
PascalNVIDIA201616 GB HBM2250 WFP16$68.2/PFLOP·h (P100)
CDNA 4AMD2025288 GB HBM3e1,400 WFP4 · FP8 · FP16 / BF16 · INT8$1.03/PFLOP·h (Instinct MI355X)
CDNA 3AMD2023–2024256 GB HBM3e1,000 WFP8 · FP16 / BF16 · TF32 · INT8$1.42/PFLOP·h (Instinct MI300X)
RDNA 3AMD2022–202348 GB GDDR6355 WFP16 / BF16 · INT8—
CDNA 2AMD2021–2022128 GB HBM2e560 WFP16 / BF16 · INT8—
CDNAAMD202032 GB HBM2300 WFP16 / BF16 · INT8—
Xe-HPCIntel2023128 GB HBM2e600 WFP16 / BF16 · TF32 · INT8—
GaudiIntel2022–2024128 GB HBM2e900 WFP8 · FP16 / BF16$2.55/PFLOP·h (Gaudi 2)
TPUGoogle2023–202495 GB HBM2e—FP16 / BF16 · INT8$2.94/PFLOP·h (TPU v6e (Trillium))
InferentiaAWS202332 GB HBM2e—FP8 · FP16 / BF16 · INT8$3.99/PFLOP·h (Inferentia2)
TrainiumAWS2022–202496 GB HBM3—FP8 · FP16 / BF16$7.07/PFLOP·h (Trainium)

NVIDIA

Blackwell Ultra

Erschienen 2025

NVIDIAs Blackwell-Refresh von 2025 (B300, GB300): mehr HBM3e pro GPU und schnelleres FP4 für Inferenz in großem Maßstab.

Bis zu 288 GB pro GPUNative Präzisionen: FP4 · FP8 · FP16 / BF16 · TF32 · INT82 von 2 aktuell mietbar

Blackwell

Erschienen 2024–2025

NVIDIAs Generation nach Hopper, von B200 und GB200 im Rechenzentrum bis zur RTX-50-Serie und den RTX-PRO-Karten. Bringt FP4-Tensor-Cores; bei den Rechenzentrumsmodellen werden zwei Dies zu einer GPU verbunden.

Bis zu 186 GB pro GPUNative Präzisionen: FP4 · FP8 · FP16 / BF16 · TF32 · INT810 von 10 aktuell mietbar

Ada Lovelace

Erschienen 2022–2024

RTX-40-Serie, L4, L40S und RTX 6000 Ada. FP8-Tensor-Cores mit GDDR6-Speicher statt HBM, was diese Karten günstig, aber bandbreitenbegrenzt macht.

Bis zu 48 GB pro GPUNative Präzisionen: FP8 · FP16 / BF16 · TF32 · INT815 von 17 aktuell mietbar

Ampere

Erschienen 2020–2022

A100, A10, A40 und RTX-30-Serie. Die erste Generation mit BF16- und TF32-Tensor-Cores; die A100 brachte außerdem MIG-Partitionierung.

Bis zu 80 GB pro GPUNative Präzisionen: FP16 / BF16 · TF32 · INT820 von 23 aktuell mietbar

Pascal

Erschienen 2016

P100: HBM-Speicher, aber keine Tensor Cores. Vor allem für günstige FP32- und FP64-Aufgaben nützlich.

Bis zu 16 GB pro GPUNative Präzisionen: FP161 von 1 aktuell mietbar

AMD

CDNA 4

Erschienen 2025

AMD Instinct MI350X und MI355X. Ergänzt AMDs Matrix Cores um FP4 und FP6, mit 288 GB HBM3e pro GPU.

Bis zu 288 GB pro GPUNative Präzisionen: FP4 · FP8 · FP16 / BF16 · INT82 von 2 aktuell mietbar

CDNA 3

Erschienen 2023–2024

AMD Instinct MI300X und MI325X. FP8-Unterstützung und mehr Speicher pro GPU als die Hopper-Modelle, mit denen sie konkurrieren.

Bis zu 256 GB pro GPUNative Präzisionen: FP8 · FP16 / BF16 · TF32 · INT82 von 2 aktuell mietbar

CDNA

Erschienen 2020

AMD Instinct MI100, AMDs erste reine Compute-Architektur fürs Rechenzentrum.

Bis zu 32 GB pro GPUNative Präzisionen: FP16 / BF16 · INT80 von 1 aktuell mietbar

Intel

Xe-HPC

Erschienen 2023

Intel Data Center GPU Max (Ponte Vecchio), für HPC entwickelt.

Bis zu 128 GB pro GPUNative Präzisionen: FP16 / BF16 · TF32 · INT80 von 1 aktuell mietbar

Gaudi

Erschienen 2022–2024

Intels KI-Beschleuniger Gaudi 2 und Gaudi 3 (aus der Übernahme von Habana Labs).

Bis zu 128 GB pro GPUNative Präzisionen: FP8 · FP16 / BF161 von 2 aktuell mietbar

Google

AWS

Inferentia

Erschienen 2023

Die eigenen Inferenzchips von AWS, nur bei AWS mietbar.

Bis zu 32 GB pro GPUNative Präzisionen: FP8 · FP16 / BF16 · INT81 von 1 aktuell mietbar

Fragen zu Architekturen

Welche Architektur bietet derzeit die meiste Rechenleistung pro Dollar?

CDNA 4: Die Instinct MI355X kostet $1.03 pro PFLOP-Stunde dense FP16/BF16 bei $2.59 pro GPU-Stunde. Die Rangfolge folgt den Preisen, die alle 2 Stunden aktualisiert werden.

Welche Architekturen unterstützen FP8 und FP4?

FP8: Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 4, CDNA 3, Gaudi, Inferentia, Trainium. FP4: Blackwell Ultra, Blackwell, CDNA 4. Ältere Architekturen können FP8- oder FP4-Modelle trotzdem ausführen, aber ohne den Geschwindigkeitsgewinn.

Warum eine ältere Architektur mieten?

Ältere GPUs sind pro FLOP und pro GB Speicher oft günstiger und reichen für kleinere Modelle, LoRA-Fine-Tuning oder Experimente völlig aus. Prüfen Sie, ob die benötigte Präzision nativ läuft; danach ist es eine Frage des Preises.

Was ist der Unterschied zwischen Hopper und Grace Hopper?

Hopper ist die GPU-Architektur (H100, H200). Grace Hopper (GH200) ist ein Superchip: NVIDIAs Arm-basierte Grace-CPU und eine Hopper-GPU auf einem Modul, verbunden über NVLink-C2C, sodass die GPU auch den Speicher der CPU nutzen kann.