PetaPrice

Arquitecturas de GPU

Todas las generaciones que seguimos, de la más reciente a la más antigua. Cada una muestra sus GPU con el precio bajo demanda más bajo de hoy, las precisiones que sus tensor cores ejecutan de forma nativa y la máxima memoria por GPU.

Hopper vs Blackwell →

Arquitectura, producto, superchip

Arquitectura
El diseño que comparte una familia de chips: tensor cores, precisiones admitidas, sistema de memoria. Hopper, Blackwell y CDNA 3 son arquitecturas.
Producto
Una GPU basada en una arquitectura, con un tamaño de memoria y un formato concretos. La H100 SXM, la H100 PCIe y la H200 son tres productos de Hopper, cada uno con su propio precio.
Superchip
Una CPU y una o dos GPU en un mismo módulo (GH200, GB200). PetaPrice muestra el precio por GPU; la CPU va incluida.

Lado a lado

La máxima memoria y el mayor consumo por GPU de cada arquitectura, y su cómputo más barato ahora mismo.

ArquitecturaFabricanteAñoMemoria máx.Consumo máx.Precisiones nativasMejor relación FP16
Blackwell UltraNVIDIA2025288 GB HBM3e1,400 WFP4 · FP8 · FP16 / BF16 · TF32 · INT8$2.93/PFLOP·h (B300 SXM)
BlackwellNVIDIA2024–2025186 GB HBM3e1,200 WFP4 · FP8 · FP16 / BF16 · TF32 · INT8$1.42/PFLOP·h (B200 SXM)
HopperNVIDIA2022–2024141 GB HBM3e1,000 WFP8 · FP16 / BF16 · TF32 · INT8$1.83/PFLOP·h (H100 SXM)
Ada LovelaceNVIDIA2022–202448 GB GDDR6450 WFP8 · FP16 / BF16 · TF32 · INT8$1.52/PFLOP·h (RTX 4070 SUPER)
AmpereNVIDIA2020–202280 GB HBM2e450 WFP16 / BF16 · TF32 · INT8$1.44/PFLOP·h (RTX A5000)
TuringNVIDIA201848 GB GDDR6295 WFP16 · INT8$1.95/PFLOP·h (Quadro RTX 8000)
VoltaNVIDIA2017–201932 GB HBM2300 WFP16$1.52/PFLOP·h (V100 SXM2 16GB)
PascalNVIDIA201616 GB HBM2250 WFP16$68.2/PFLOP·h (P100)
CDNA 4AMD2025288 GB HBM3e1,400 WFP4 · FP8 · FP16 / BF16 · INT8$1.03/PFLOP·h (Instinct MI355X)
CDNA 3AMD2023–2024256 GB HBM3e1,000 WFP8 · FP16 / BF16 · TF32 · INT8$1.42/PFLOP·h (Instinct MI300X)
RDNA 3AMD2022–202348 GB GDDR6355 WFP16 / BF16 · INT8—
CDNA 2AMD2021–2022128 GB HBM2e560 WFP16 / BF16 · INT8—
CDNAAMD202032 GB HBM2300 WFP16 / BF16 · INT8—
Xe-HPCIntel2023128 GB HBM2e600 WFP16 / BF16 · TF32 · INT8—
GaudiIntel2022–2024128 GB HBM2e900 WFP8 · FP16 / BF16$2.55/PFLOP·h (Gaudi 2)
TPUGoogle2023–202495 GB HBM2e—FP16 / BF16 · INT8$2.94/PFLOP·h (TPU v6e (Trillium))
InferentiaAWS202332 GB HBM2e—FP8 · FP16 / BF16 · INT8$3.99/PFLOP·h (Inferentia2)
TrainiumAWS2022–202496 GB HBM3—FP8 · FP16 / BF16$7.07/PFLOP·h (Trainium)

NVIDIA

Blackwell Ultra

Lanzamiento 2025

La renovación de Blackwell que NVIDIA lanzó en 2025 (B300, GB300): más HBM3e por GPU y FP4 más rápido para inferencia a gran escala.

Hasta 288 GB por GPUPrecisiones nativas: FP4 · FP8 · FP16 / BF16 · TF32 · INT82 de 2 alquilables ahora

Blackwell

Lanzamiento 2024–2025

La generación de NVIDIA posterior a Hopper, desde la B200 y la GB200 en centros de datos hasta la serie RTX 50 y las tarjetas RTX PRO. Añade tensor cores FP4; los modelos para centros de datos unen dos chips en una sola GPU.

Hasta 186 GB por GPUPrecisiones nativas: FP4 · FP8 · FP16 / BF16 · TF32 · INT810 de 10 alquilables ahora

Ada Lovelace

Lanzamiento 2022–2024

Serie RTX 40, L4, L40S y RTX 6000 Ada. Tensor cores FP8 con memoria GDDR6 en lugar de HBM, lo que hace que estas tarjetas sean baratas pero tengan el ancho de banda limitado.

Hasta 48 GB por GPUPrecisiones nativas: FP8 · FP16 / BF16 · TF32 · INT815 de 17 alquilables ahora

Ampere

Lanzamiento 2020–2022

A100, A10, A40 y serie RTX 30. La primera generación con tensor cores BF16 y TF32; la A100 añadió además la partición MIG.

Hasta 80 GB por GPUPrecisiones nativas: FP16 / BF16 · TF32 · INT820 de 23 alquilables ahora

Pascal

Lanzamiento 2016

P100: memoria HBM pero sin tensor cores. Útil sobre todo para trabajo FP32 y FP64 barato.

Hasta 16 GB por GPUPrecisiones nativas: FP161 de 1 alquilables ahora

AMD

CDNA 3

Lanzamiento 2023–2024

AMD Instinct MI300X y MI325X. Compatibilidad con FP8 y más memoria por GPU que los modelos Hopper con los que compiten.

Hasta 256 GB por GPUPrecisiones nativas: FP8 · FP16 / BF16 · TF32 · INT82 de 2 alquilables ahora

RDNA 3

Lanzamiento 2022–2023

La arquitectura gráfica Radeon de AMD (RX 7900 XTX, Radeon PRO W7900), que se alquila sobre todo en marketplaces comunitarios.

Hasta 48 GB por GPUPrecisiones nativas: FP16 / BF16 · INT80 de 2 alquilables ahora

CDNA

Lanzamiento 2020

AMD Instinct MI100, la primera arquitectura de AMD para centros de datos dedicada exclusivamente al cómputo.

Hasta 32 GB por GPUPrecisiones nativas: FP16 / BF16 · INT80 de 1 alquilables ahora

Intel

Xe-HPC

Lanzamiento 2023

Intel Data Center GPU Max (Ponte Vecchio), diseñada para HPC.

Hasta 128 GB por GPUPrecisiones nativas: FP16 / BF16 · TF32 · INT80 de 1 alquilables ahora

Gaudi

Lanzamiento 2022–2024

Los aceleradores de IA Gaudi 2 y Gaudi 3 de Intel (procedentes de su adquisición de Habana Labs).

Hasta 128 GB por GPUPrecisiones nativas: FP8 · FP16 / BF161 de 2 alquilables ahora

Google

AWS

Inferentia

Lanzamiento 2023

Los chips de inferencia propios de AWS, que solo se alquilan en AWS.

Hasta 32 GB por GPUPrecisiones nativas: FP8 · FP16 / BF16 · INT81 de 1 alquilables ahora

Preguntas sobre arquitecturas

¿Qué arquitectura ofrece más cómputo por dólar ahora mismo?

CDNA 4: la Instinct MI355X cuesta $1.03 por PFLOP-hora de FP16/BF16 denso a $2.59 por hora de GPU. La clasificación sigue a los precios, que se actualizan cada 2 horas.

¿Qué arquitecturas admiten FP8 y FP4?

FP8: Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 4, CDNA 3, Gaudi, Inferentia, Trainium. FP4: Blackwell Ultra, Blackwell, CDNA 4. Las arquitecturas más antiguas también pueden ejecutar modelos FP8 o FP4, pero sin la aceleración.

¿Por qué alquilar una arquitectura más antigua?

Las GPU más antiguas suelen ser más baratas por FLOP y por GB de memoria, y bastan de sobra para servir modelos pequeños, hacer fine-tuning con LoRA o experimentar. Comprueba que la precisión que necesitas se ejecuta de forma nativa; a partir de ahí, es cuestión de precio.

¿Qué diferencia hay entre Hopper y Grace Hopper?

Hopper es la arquitectura de GPU (H100, H200). Grace Hopper (GH200) es un superchip: la CPU Grace de NVIDIA, basada en Arm, y una GPU Hopper en un mismo módulo, unidas por NVLink-C2C para que la GPU también pueda usar la memoria de la CPU.