PetaPrice

Glosario de GPU

Los términos que aparecen al comparar y alquilar GPU en la nube, explicados de forma sencilla.

Cómputo

FLOPS, TFLOPS, PFLOPS
TeraFLOPS, PetaFLOPS, FLOP/s
Operaciones de coma flotante por segundo: cuánta aritmética puede hacer un chip. 1 TFLOPS equivale a un billón por segundo y 1 PFLOPS (PetaFLOPS), a mil TFLOPS. PetaPrice muestra todo el cómputo en PFLOPS.
FLOPS densos vs. dispersos
dispersión 2:4, dispersión estructurada
Los fabricantes suelen indicar el rendimiento tensorial con dispersión estructurada 2:4, que duplica la cifra destacada. Casi ningún entrenamiento ni inferencia la usa, así que PetaPrice muestra siempre cifras densas.
$ por PFLOP-hora
$/PFLOP·h, coste por PFLOP
El precio de una hora de GPU dividido entre los PFLOPS pico densos de la GPU en la precisión elegida. Indica cuánto cómputo se obtiene por cada dólar, de modo que las GPU rápidas y caras pueden compararse directamente con las lentas y baratas. Cuanto menor, mejor.
Precisión
formato numérico, tipo de datos
Cuántos bits usa cada número. Menos bits suponen más rendimiento y menos memoria, a costa de algo de exactitud. Una misma GPU tiene un pico distinto en cada precisión.
FP16 y BF16
bfloat16, media precisión
Formatos de 16 bits y el estándar para entrenar y ejecutar LLM. BF16 conserva el rango de FP32 con menos precisión, lo que hace el entrenamiento más estable; requiere Ampere, CDNA 2 o posterior.
FP8
E4M3, E5M2, Float8
Coma flotante de 8 bits para entrenamiento e inferencia, con aproximadamente el doble de rendimiento que FP16. Nativo en Hopper, Ada, Blackwell y AMD CDNA 3 y posteriores.
FP4
NVFP4, MXFP4
Coma flotante de 4 bits, usada para inferencia cuantizada. Solo Blackwell y AMD CDNA 4 lo ejecutan de forma nativa.
TF32
TensorFloat-32
Formato de 19 bits de NVIDIA que ejecuta operaciones matriciales FP32 en tensor cores. PyTorch puede usarlo para las multiplicaciones de matrices FP32 en Ampere y posteriores.
INT8 y TOPS
entero de 8 bits, TOPS
Enteros de 8 bits para inferencia cuantizada. El rendimiento se mide en TOPS (billones de operaciones por segundo) en lugar de FLOPS.
Tensor cores / matrix cores
matrix cores
Unidades que multiplican matrices pequeñas en un solo paso y de las que procede casi todo el rendimiento de IA de una GPU. NVIDIA las llama tensor cores y AMD, matrix cores.
MFU (utilización de FLOPS del modelo)
utilización de FLOPS del modelo, utilización de GPU
La proporción de los FLOPS pico que alcanza una carga de trabajo real. Los grandes entrenamientos suelen llegar al 30–60%, así que los picos de ficha técnica sirven para comparar GPU, no para predecir tiempos de ejecución.

Memoria

VRAM
memoria de GPU
La memoria propia de la GPU. Los pesos del modelo, las activaciones y la KV cache tienen que caber en ella (o repartirse entre varias GPU), así que a menudo es la VRAM la que decide qué GPU se pueden usar siquiera.
HBM
HBM2e, HBM3, HBM3e, High Bandwidth Memory
High Bandwidth Memory (memoria de alto ancho de banda), apilada junto al chip en las GPU de centro de datos (HBM2e, HBM3, HBM3e). Es varias veces más rápida que la memoria GDDR de las tarjetas de consumo y de estación de trabajo.
Ancho de banda de memoria
GB/s, TB/s
La velocidad a la que la GPU lee su memoria, en GB/s o TB/s. La generación de tokens de un LLM suele estar limitada por el ancho de banda más que por los FLOPS; por eso PetaPrice permite ordenar las GPU por ancho de banda por dólar.
KV cache
caché clave-valor
Memoria que un LLM conserva para cada token de su contexto durante la inferencia. Los contextos largos y las muchas solicitudes en paralelo necesitan mucha, además de los pesos del modelo.

Hardware e interconexión

SXM vs. PCIe
SXM5, PCI Express, factor de forma
Las GPU SXM van montadas en una placa base con NVLink entre ellas y reciben más potencia, así que rinden más. Las tarjetas PCIe se conectan a una ranura normal, cuestan menos y suelen ser más lentas. Una H100 SXM y una H100 PCIe son productos distintos.
InfiniBand
IB, RoCE
La red de baja latencia que conecta los servidores de GPU en los clústeres de entrenamiento. El entrenamiento en varios nodos la necesita (o Ethernet RoCE rápida); los trabajos en un solo nodo, no.
Superchip
Grace Hopper, Grace Blackwell
Una CPU y una GPU en un mismo módulo con un enlace rápido entre ellas, como la GH200 y la GB200. La GPU puede usar la memoria de la CPU como extensión de la suya.
Nodo
servidor, nodo de 8 GPU, HGX
Un servidor. Las GPU de centro de datos suelen venir en nodos de 8 GPU; algunos proveedores solo alquilan nodos completos. PetaPrice muestra siempre el precio por GPU.
TDP
TGP, potencia de la placa
Thermal design power (potencia de diseño térmico): aproximadamente la potencia máxima que consume la GPU, en vatios.
MIG y fracciones de GPU
Multi-Instance GPU, vGPU, fracción de GPU
Multi-Instance GPU divide una A100, H100 o posterior en particiones aisladas. Las particiones y otras fracciones de GPU (vGPU) son más baratas, pero no son GPU completas, así que PetaPrice las excluye.

Precios y alquiler

Bajo demanda
pago por uso
Pago por horas (o por segundos) sin compromiso, y puedes parar cuando quieras. Es la vista predeterminada de PetaPrice.
Spot / interrumpible
preemptible, interrumpible
Capacidad sobrante vendida con descuento que el proveedor puede reclamar en cualquier momento. Adecuada para entrenamientos con checkpoints y trabajos por lotes.
Reservado / comprometido
uso comprometido, precio por contrato
Una tarifa por hora más baja a cambio de un compromiso, normalmente de 1 a 3 años o un contrato fijo.
Hosts comunitarios / marketplaces
nube comunitaria, P2P
Plataformas como Vast.ai en las que hosts independientes alquilan sus máquinas. Suelen ser la opción más barata, con más variación en fiabilidad y seguridad.
Hora de GPU
GPU·h
Una GPU durante una hora. Un nodo de 8 GPU durante 2 horas son 16 horas de GPU. Una GPU funcionando las 24 horas suma unas 730 horas de GPU al mes.
Tráfico de salida (egress)
transferencia de datos de salida
Datos transferidos fuera de una nube. Algunos proveedores lo cobran; los precios de PetaPrice no lo incluyen, como tampoco el almacenamiento ni las direcciones IP, salvo que el proveedor los incluya.