Blackwell Ultra
Erschienen 2025NVIDIAs Blackwell-Refresh von 2025 (B300, GB300): mehr HBM3e pro GPU und schnelleres FP4 für Inferenz in großem Maßstab.
Alle Generationen, die wir erfassen, die neueste zuerst. Zu jeder stehen ihre GPUs mit dem heute niedrigsten On-Demand-Preis, die Präzisionen, die ihre Tensor Cores nativ ausführen, und der größte Speicher pro GPU.
Hopper vs. Blackwell →Größter Speicher und höchste Leistungsaufnahme pro GPU in jeder Architektur sowie ihre aktuell günstigste Rechenleistung.
| Architektur | Hersteller | Jahr | Max. Speicher | Max. Leistungsaufnahme | Native Präzisionen | Beste FP16-Preis-Leistung |
|---|---|---|---|---|---|---|
| Blackwell Ultra | NVIDIA | 2025 | 288 GB HBM3e | 1,400 W | FP4 · FP8 · FP16 / BF16 · TF32 · INT8 | $2.93/PFLOP·h (B300 SXM) |
| Blackwell | NVIDIA | 2024–2025 | 186 GB HBM3e | 1,200 W | FP4 · FP8 · FP16 / BF16 · TF32 · INT8 | $1.42/PFLOP·h (B200 SXM) |
| Hopper | NVIDIA | 2022–2024 | 141 GB HBM3e | 1,000 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.83/PFLOP·h (H100 SXM) |
| Ada Lovelace | NVIDIA | 2022–2024 | 48 GB GDDR6 | 450 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.52/PFLOP·h (RTX 4070 SUPER) |
| Ampere | NVIDIA | 2020–2022 | 80 GB HBM2e | 450 W | FP16 / BF16 · TF32 · INT8 | $1.44/PFLOP·h (RTX A5000) |
| Turing | NVIDIA | 2018 | 48 GB GDDR6 | 295 W | FP16 · INT8 | $1.95/PFLOP·h (Quadro RTX 8000) |
| Volta | NVIDIA | 2017–2019 | 32 GB HBM2 | 300 W | FP16 | $1.52/PFLOP·h (V100 SXM2 16GB) |
| Pascal | NVIDIA | 2016 | 16 GB HBM2 | 250 W | FP16 | $68.2/PFLOP·h (P100) |
| CDNA 4 | AMD | 2025 | 288 GB HBM3e | 1,400 W | FP4 · FP8 · FP16 / BF16 · INT8 | $1.03/PFLOP·h (Instinct MI355X) |
| CDNA 3 | AMD | 2023–2024 | 256 GB HBM3e | 1,000 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.42/PFLOP·h (Instinct MI300X) |
| RDNA 3 | AMD | 2022–2023 | 48 GB GDDR6 | 355 W | FP16 / BF16 · INT8 | — |
| CDNA 2 | AMD | 2021–2022 | 128 GB HBM2e | 560 W | FP16 / BF16 · INT8 | — |
| CDNA | AMD | 2020 | 32 GB HBM2 | 300 W | FP16 / BF16 · INT8 | — |
| Xe-HPC | Intel | 2023 | 128 GB HBM2e | 600 W | FP16 / BF16 · TF32 · INT8 | — |
| Gaudi | Intel | 2022–2024 | 128 GB HBM2e | 900 W | FP8 · FP16 / BF16 | $2.55/PFLOP·h (Gaudi 2) |
| TPU | 2023–2024 | 95 GB HBM2e | — | FP16 / BF16 · INT8 | $2.94/PFLOP·h (TPU v6e (Trillium)) | |
| Inferentia | AWS | 2023 | 32 GB HBM2e | — | FP8 · FP16 / BF16 · INT8 | $3.99/PFLOP·h (Inferentia2) |
| Trainium | AWS | 2022–2024 | 96 GB HBM3 | — | FP8 · FP16 / BF16 | $7.07/PFLOP·h (Trainium) |
NVIDIAs Blackwell-Refresh von 2025 (B300, GB300): mehr HBM3e pro GPU und schnelleres FP4 für Inferenz in großem Maßstab.
NVIDIAs Generation nach Hopper, von B200 und GB200 im Rechenzentrum bis zur RTX-50-Serie und den RTX-PRO-Karten. Bringt FP4-Tensor-Cores; bei den Rechenzentrumsmodellen werden zwei Dies zu einer GPU verbunden.
H100, H200 und GH200. Führte FP8-Tensor-Cores mit der Transformer Engine ein und ist weiterhin die am häufigsten gemietete Rechenzentrums-GPU.
RTX-40-Serie, L4, L40S und RTX 6000 Ada. FP8-Tensor-Cores mit GDDR6-Speicher statt HBM, was diese Karten günstig, aber bandbreitenbegrenzt macht.
A100, A10, A40 und RTX-30-Serie. Die erste Generation mit BF16- und TF32-Tensor-Cores; die A100 brachte außerdem MIG-Partitionierung.
T4, RTX-20-Serie und Quadro RTX. Tensor Cores für FP16 und INT8, aber kein BF16.
V100: die erste GPU mit Tensor Cores (nur FP16).
P100: HBM-Speicher, aber keine Tensor Cores. Vor allem für günstige FP32- und FP64-Aufgaben nützlich.
AMD Instinct MI350X und MI355X. Ergänzt AMDs Matrix Cores um FP4 und FP6, mit 288 GB HBM3e pro GPU.
AMD Instinct MI300X und MI325X. FP8-Unterstützung und mehr Speicher pro GPU als die Hopper-Modelle, mit denen sie konkurrieren.
AMDs Radeon-Grafikarchitektur (RX 7900 XTX, Radeon PRO W7900), meist über Community-Marktplätze gemietet.
AMD Instinct MI210 und MI250(X). Starke FP64-Leistung für HPC; BF16, aber kein FP8.
AMD Instinct MI100, AMDs erste reine Compute-Architektur fürs Rechenzentrum.
Intel Data Center GPU Max (Ponte Vecchio), für HPC entwickelt.
Intels KI-Beschleuniger Gaudi 2 und Gaudi 3 (aus der Übernahme von Habana Labs).
Googles eigene Tensor-Prozessoren, nur in Google Cloud mietbar.
Die eigenen Inferenzchips von AWS, nur bei AWS mietbar.
Die eigenen Trainingschips von AWS, nur bei AWS mietbar.
CDNA 4: Die Instinct MI355X kostet $1.03 pro PFLOP-Stunde dense FP16/BF16 bei $2.59 pro GPU-Stunde. Die Rangfolge folgt den Preisen, die alle 2 Stunden aktualisiert werden.
FP8: Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 4, CDNA 3, Gaudi, Inferentia, Trainium. FP4: Blackwell Ultra, Blackwell, CDNA 4. Ältere Architekturen können FP8- oder FP4-Modelle trotzdem ausführen, aber ohne den Geschwindigkeitsgewinn.
Ältere GPUs sind pro FLOP und pro GB Speicher oft günstiger und reichen für kleinere Modelle, LoRA-Fine-Tuning oder Experimente völlig aus. Prüfen Sie, ob die benötigte Präzision nativ läuft; danach ist es eine Frage des Preises.
Hopper ist die GPU-Architektur (H100, H200). Grace Hopper (GH200) ist ein Superchip: NVIDIAs Arm-basierte Grace-CPU und eine Hopper-GPU auf einem Modul, verbunden über NVLink-C2C, sodass die GPU auch den Speicher der CPU nutzen kann.