Blackwell Ultra
Lanzamiento 2025La renovación de Blackwell que NVIDIA lanzó en 2025 (B300, GB300): más HBM3e por GPU y FP4 más rápido para inferencia a gran escala.
Todas las generaciones que seguimos, de la más reciente a la más antigua. Cada una muestra sus GPU con el precio bajo demanda más bajo de hoy, las precisiones que sus tensor cores ejecutan de forma nativa y la máxima memoria por GPU.
Hopper vs Blackwell →La máxima memoria y el mayor consumo por GPU de cada arquitectura, y su cómputo más barato ahora mismo.
| Arquitectura | Fabricante | Año | Memoria máx. | Consumo máx. | Precisiones nativas | Mejor relación FP16 |
|---|---|---|---|---|---|---|
| Blackwell Ultra | NVIDIA | 2025 | 288 GB HBM3e | 1,400 W | FP4 · FP8 · FP16 / BF16 · TF32 · INT8 | $2.93/PFLOP·h (B300 SXM) |
| Blackwell | NVIDIA | 2024–2025 | 186 GB HBM3e | 1,200 W | FP4 · FP8 · FP16 / BF16 · TF32 · INT8 | $1.42/PFLOP·h (B200 SXM) |
| Hopper | NVIDIA | 2022–2024 | 141 GB HBM3e | 1,000 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.83/PFLOP·h (H100 SXM) |
| Ada Lovelace | NVIDIA | 2022–2024 | 48 GB GDDR6 | 450 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.52/PFLOP·h (RTX 4070 SUPER) |
| Ampere | NVIDIA | 2020–2022 | 80 GB HBM2e | 450 W | FP16 / BF16 · TF32 · INT8 | $1.44/PFLOP·h (RTX A5000) |
| Turing | NVIDIA | 2018 | 48 GB GDDR6 | 295 W | FP16 · INT8 | $1.95/PFLOP·h (Quadro RTX 8000) |
| Volta | NVIDIA | 2017–2019 | 32 GB HBM2 | 300 W | FP16 | $1.52/PFLOP·h (V100 SXM2 16GB) |
| Pascal | NVIDIA | 2016 | 16 GB HBM2 | 250 W | FP16 | $68.2/PFLOP·h (P100) |
| CDNA 4 | AMD | 2025 | 288 GB HBM3e | 1,400 W | FP4 · FP8 · FP16 / BF16 · INT8 | $1.03/PFLOP·h (Instinct MI355X) |
| CDNA 3 | AMD | 2023–2024 | 256 GB HBM3e | 1,000 W | FP8 · FP16 / BF16 · TF32 · INT8 | $1.42/PFLOP·h (Instinct MI300X) |
| RDNA 3 | AMD | 2022–2023 | 48 GB GDDR6 | 355 W | FP16 / BF16 · INT8 | — |
| CDNA 2 | AMD | 2021–2022 | 128 GB HBM2e | 560 W | FP16 / BF16 · INT8 | — |
| CDNA | AMD | 2020 | 32 GB HBM2 | 300 W | FP16 / BF16 · INT8 | — |
| Xe-HPC | Intel | 2023 | 128 GB HBM2e | 600 W | FP16 / BF16 · TF32 · INT8 | — |
| Gaudi | Intel | 2022–2024 | 128 GB HBM2e | 900 W | FP8 · FP16 / BF16 | $2.55/PFLOP·h (Gaudi 2) |
| TPU | 2023–2024 | 95 GB HBM2e | — | FP16 / BF16 · INT8 | $2.94/PFLOP·h (TPU v6e (Trillium)) | |
| Inferentia | AWS | 2023 | 32 GB HBM2e | — | FP8 · FP16 / BF16 · INT8 | $3.99/PFLOP·h (Inferentia2) |
| Trainium | AWS | 2022–2024 | 96 GB HBM3 | — | FP8 · FP16 / BF16 | $7.07/PFLOP·h (Trainium) |
La renovación de Blackwell que NVIDIA lanzó en 2025 (B300, GB300): más HBM3e por GPU y FP4 más rápido para inferencia a gran escala.
La generación de NVIDIA posterior a Hopper, desde la B200 y la GB200 en centros de datos hasta la serie RTX 50 y las tarjetas RTX PRO. Añade tensor cores FP4; los modelos para centros de datos unen dos chips en una sola GPU.
H100, H200 y GH200. Introdujo los tensor cores FP8 con el Transformer Engine y sigue siendo la GPU de centro de datos más alquilada.
Serie RTX 40, L4, L40S y RTX 6000 Ada. Tensor cores FP8 con memoria GDDR6 en lugar de HBM, lo que hace que estas tarjetas sean baratas pero tengan el ancho de banda limitado.
A100, A10, A40 y serie RTX 30. La primera generación con tensor cores BF16 y TF32; la A100 añadió además la partición MIG.
T4, serie RTX 20 y Quadro RTX. Tensor cores para FP16 e INT8, pero sin BF16.
V100: la primera GPU con tensor cores (solo FP16).
P100: memoria HBM pero sin tensor cores. Útil sobre todo para trabajo FP32 y FP64 barato.
AMD Instinct MI350X y MI355X. Añade FP4 y FP6 a los matrix cores de AMD, con 288 GB de HBM3e por GPU.
AMD Instinct MI300X y MI325X. Compatibilidad con FP8 y más memoria por GPU que los modelos Hopper con los que compiten.
La arquitectura gráfica Radeon de AMD (RX 7900 XTX, Radeon PRO W7900), que se alquila sobre todo en marketplaces comunitarios.
AMD Instinct MI210 y MI250(X). Gran rendimiento FP64 para HPC; BF16 pero sin FP8.
AMD Instinct MI100, la primera arquitectura de AMD para centros de datos dedicada exclusivamente al cómputo.
Intel Data Center GPU Max (Ponte Vecchio), diseñada para HPC.
Los aceleradores de IA Gaudi 2 y Gaudi 3 de Intel (procedentes de su adquisición de Habana Labs).
Los procesadores tensoriales propios de Google, que solo se alquilan en Google Cloud.
Los chips de inferencia propios de AWS, que solo se alquilan en AWS.
Los chips de entrenamiento propios de AWS, que solo se alquilan en AWS.
CDNA 4: la Instinct MI355X cuesta $1.03 por PFLOP-hora de FP16/BF16 denso a $2.59 por hora de GPU. La clasificación sigue a los precios, que se actualizan cada 2 horas.
FP8: Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 4, CDNA 3, Gaudi, Inferentia, Trainium. FP4: Blackwell Ultra, Blackwell, CDNA 4. Las arquitecturas más antiguas también pueden ejecutar modelos FP8 o FP4, pero sin la aceleración.
Las GPU más antiguas suelen ser más baratas por FLOP y por GB de memoria, y bastan de sobra para servir modelos pequeños, hacer fine-tuning con LoRA o experimentar. Comprueba que la precisión que necesitas se ejecuta de forma nativa; a partir de ahí, es cuestión de precio.
Hopper es la arquitectura de GPU (H100, H200). Grace Hopper (GH200) es un superchip: la CPU Grace de NVIDIA, basada en Arm, y una GPU Hopper en un mismo módulo, unidas por NVLink-C2C para que la GPU también pueda usar la memoria de la CPU.