Cómo usar PetaPrice
Encuentra la GPU más barata para tu carga de trabajo en unos pocos pasos, y qué tener en cuenta al elegirla.
Cómo usar PetaPrice paso a paso
Elige por qué optimizar
En la página de inicio, elige FLOPS para entrenamiento y trabajos limitados por cómputo, VRAM para cargar el modelo más grande por dólar o Ancho de banda para la generación de tokens de LLM. Con FLOPS, elige también la precisión que usas, normalmente FP16/BF16.
Filtra las GPU que te sirven
Fija una VRAM mínima para que quepa tu modelo, el número de GPU por instancia y la tarificación bajo demanda, spot o reservada. También puedes filtrar por fabricante, sede del proveedor (solo UE) y nube gestionada frente a hosts comunitarios.
Interpreta la clasificación
La clasificación ordena las GPU por relación calidad-precio según su oferta coincidente más barata. La etiqueta muestra cuánto más cuesta cada GPU por unidad respecto a la mejor. El gráfico del punto óptimo representa el precio frente al rendimiento: arriba y a la izquierda es mejor.
Abre una GPU
La página de una GPU muestra todos los proveedores que la alquilan, cada configuración con su precio, un historial de precios diario y el coste en cada precisión. Toca un proveedor para ver sus configuraciones y el enlace para alquilarla.
Compara GPU lado a lado
Elige hasta cuatro GPU en Comparar para ver lado a lado precios, cómputo por dólar, memoria, ancho de banda y proveedores.
Comprueba el precio y alquila
Los precios son precios de lista orientativos que se actualizan aproximadamente cada 2 horas. Sigue el enlace Alquilar y confirma el precio en la web del proveedor antes de contratar.
Cómo elegir una GPU para tu carga de trabajo
Qué importa en cada tipo de trabajo y qué GPU ofrecen la mejor relación calidad-precio para él ahora mismo.
Inferencia de LLM
Qué importa: Memoria suficiente para los pesos y la KV cache y, después, ancho de banda de memoria: la generación de tokens está limitada por el ancho de banda.
Mejor relación calidad-precio ahora mismo · Mejor ancho de banda por dólar con 80 GB o más
- 1Instinct MI355X$2.59/h$0.32/TB/s·h
- 2Instinct MI325X$2.00/h$0.33/TB/s·h
- 3Instinct MI300X$1.85/h$0.35/TB/s·h
Entrenamiento y fine-tuning
Qué importa: Cómputo BF16 o FP8 denso, memoria para los pesos, los gradientes y el estado del optimizador, y NVLink entre las GPU.
Mejor relación calidad-precio ahora mismo · Mejor cómputo FP8 por dólar, GPU de centro de datos
- 1Instinct MI355X$2.59/h$0.51/PFLOP·h
- 2Instinct MI300X$1.85/h$0.71/PFLOP·h
- 3B200 SXM$3.20/h$0.71/PFLOP·h
Experimentos y modelos pequeños
Qué importa: Un precio por hora bajo y al menos 24 GB. Las tarjetas de consumo y de estación de trabajo suelen ser la forma más barata de empezar.
Mejor relación calidad-precio ahora mismo · Hora de GPU más barata con 24 GB o más
Abrir esta vista →Computación científica (FP64)
Qué importa: Rendimiento en doble precisión. Muchas GPU para IA, incluidas Blackwell y todas las tarjetas de consumo, tienen muy poco.
Mejor relación calidad-precio ahora mismo · Mejor cómputo FP64 por dólar
- 1Instinct MI300X$1.85/h$11.3/PFLOP·h
- 2Instinct MI325X$2.00/h$12.2/PFLOP·h
- 3V100 SXM2 16GB$0.19/h$24.4/PFLOP·h
¿Qué precisión?
Una precisión menor es más rápida y necesita menos memoria, siempre que tu GPU la ejecute de forma nativa y tu modelo la tolere.
| Formato | Bits | Uso | Nativo en |
|---|---|---|---|
| FP64 | 64 | Simulación científica | Cualquiera |
| FP32 | 32 | Trabajo sin tensor cores, código sensible numéricamente | Cualquiera |
| TF32 | 19 | Entrenamiento FP32 en tensor cores | Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 3, Xe-HPC, Ampere |
| FP16 / BF16 | 16 | El estándar para entrenar y servir LLM | Blackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, Gaudi, TPU, Trainium, RDNA 3, Xe-HPC, Inferentia, Ampere, CDNA 2, CDNA |
| FP8 | 8 | Entrenamiento e inferencia más rápidos en GPU recientes | Blackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, Gaudi, Trainium, Inferentia |
| INT8 | 8 | Inferencia cuantizada | Blackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, TPU, RDNA 3, Xe-HPC, Inferentia, Ampere, CDNA 2, CDNA, Turing |
| FP4 | 4 | Inferencia cuantizada de modelos grandes | Blackwell Ultra, Blackwell, CDNA 4 |
Antes de alquilar
- El modelo cabe en la VRAM, incluida la KV cache o el estado del optimizador.
- La GPU ejecuta tu precisión de forma nativa (FP8 y FP4 solo en las generaciones recientes).
- Trabajos con varias GPU: SXM con NVLink, e InfiniBand entre servidores.
- El tipo de precio se ajusta al trabajo: spot solo si guardas checkpoints.
- El almacenamiento, el tráfico de salida y la CPU y la RAM que incluye la instancia.
- El precio final en la web del proveedor.
Consejos
- Los filtros se guardan en la URL, así que puedes guardar en marcadores o compartir cualquier vista.
- La capacidad spot suele costar la mitad o menos, pero puede detenerse en cualquier momento. Úsala para trabajos que guarden checkpoints.
- Compara los FLOPS densos en la precisión que realmente usas: las cifras de FP8 y FP4 solo sirven si tu software las aprovecha.
- La página de cada proveedor muestra todas las GPU que alquila y cómo se comparan sus precios con los del proveedor más barato.