Glosario de GPU
Los términos que aparecen al comparar y alquilar GPU en la nube, explicados de forma sencilla.
Cómputo
- FLOPS, TFLOPS, PFLOPS
- TeraFLOPS, PetaFLOPS, FLOP/s
- Operaciones de coma flotante por segundo: cuánta aritmética puede hacer un chip. 1 TFLOPS equivale a un billón por segundo y 1 PFLOPS (PetaFLOPS), a mil TFLOPS. PetaPrice muestra todo el cómputo en PFLOPS.
- FLOPS densos vs. dispersos
- dispersión 2:4, dispersión estructurada
- Los fabricantes suelen indicar el rendimiento tensorial con dispersión estructurada 2:4, que duplica la cifra destacada. Casi ningún entrenamiento ni inferencia la usa, así que PetaPrice muestra siempre cifras densas.
- $ por PFLOP-hora
- $/PFLOP·h, coste por PFLOP
- El precio de una hora de GPU dividido entre los PFLOPS pico densos de la GPU en la precisión elegida. Indica cuánto cómputo se obtiene por cada dólar, de modo que las GPU rápidas y caras pueden compararse directamente con las lentas y baratas. Cuanto menor, mejor.
- Precisión
- formato numérico, tipo de datos
- Cuántos bits usa cada número. Menos bits suponen más rendimiento y menos memoria, a costa de algo de exactitud. Una misma GPU tiene un pico distinto en cada precisión.
- FP16 y BF16
- bfloat16, media precisión
- Formatos de 16 bits y el estándar para entrenar y ejecutar LLM. BF16 conserva el rango de FP32 con menos precisión, lo que hace el entrenamiento más estable; requiere Ampere, CDNA 2 o posterior.
- FP8
- E4M3, E5M2, Float8
- Coma flotante de 8 bits para entrenamiento e inferencia, con aproximadamente el doble de rendimiento que FP16. Nativo en Hopper, Ada, Blackwell y AMD CDNA 3 y posteriores.
- FP4
- NVFP4, MXFP4
- Coma flotante de 4 bits, usada para inferencia cuantizada. Solo Blackwell y AMD CDNA 4 lo ejecutan de forma nativa.
- TF32
- TensorFloat-32
- Formato de 19 bits de NVIDIA que ejecuta operaciones matriciales FP32 en tensor cores. PyTorch puede usarlo para las multiplicaciones de matrices FP32 en Ampere y posteriores.
- INT8 y TOPS
- entero de 8 bits, TOPS
- Enteros de 8 bits para inferencia cuantizada. El rendimiento se mide en TOPS (billones de operaciones por segundo) en lugar de FLOPS.
- Tensor cores / matrix cores
- matrix cores
- Unidades que multiplican matrices pequeñas en un solo paso y de las que procede casi todo el rendimiento de IA de una GPU. NVIDIA las llama tensor cores y AMD, matrix cores.
- MFU (utilización de FLOPS del modelo)
- utilización de FLOPS del modelo, utilización de GPU
- La proporción de los FLOPS pico que alcanza una carga de trabajo real. Los grandes entrenamientos suelen llegar al 30–60%, así que los picos de ficha técnica sirven para comparar GPU, no para predecir tiempos de ejecución.
Memoria
- VRAM
- memoria de GPU
- La memoria propia de la GPU. Los pesos del modelo, las activaciones y la KV cache tienen que caber en ella (o repartirse entre varias GPU), así que a menudo es la VRAM la que decide qué GPU se pueden usar siquiera.
- HBM
- HBM2e, HBM3, HBM3e, High Bandwidth Memory
- High Bandwidth Memory (memoria de alto ancho de banda), apilada junto al chip en las GPU de centro de datos (HBM2e, HBM3, HBM3e). Es varias veces más rápida que la memoria GDDR de las tarjetas de consumo y de estación de trabajo.
- Ancho de banda de memoria
- GB/s, TB/s
- La velocidad a la que la GPU lee su memoria, en GB/s o TB/s. La generación de tokens de un LLM suele estar limitada por el ancho de banda más que por los FLOPS; por eso PetaPrice permite ordenar las GPU por ancho de banda por dólar.
- KV cache
- caché clave-valor
- Memoria que un LLM conserva para cada token de su contexto durante la inferencia. Los contextos largos y las muchas solicitudes en paralelo necesitan mucha, además de los pesos del modelo.
Hardware e interconexión
- SXM vs. PCIe
- SXM5, PCI Express, factor de forma
- Las GPU SXM van montadas en una placa base con NVLink entre ellas y reciben más potencia, así que rinden más. Las tarjetas PCIe se conectan a una ranura normal, cuestan menos y suelen ser más lentas. Una H100 SXM y una H100 PCIe son productos distintos.
- NVLink y NVSwitch
- NVSwitch, NVLink-C2C, Infinity Fabric
- Los enlaces de alta velocidad de NVIDIA entre las GPU de un mismo servidor, mucho más rápidos que PCIe. Importan cuando un modelo se reparte entre varias GPU. El equivalente de AMD es Infinity Fabric.
- InfiniBand
- IB, RoCE
- La red de baja latencia que conecta los servidores de GPU en los clústeres de entrenamiento. El entrenamiento en varios nodos la necesita (o Ethernet RoCE rápida); los trabajos en un solo nodo, no.
- Superchip
- Grace Hopper, Grace Blackwell
- Una CPU y una GPU en un mismo módulo con un enlace rápido entre ellas, como la GH200 y la GB200. La GPU puede usar la memoria de la CPU como extensión de la suya.
- Nodo
- servidor, nodo de 8 GPU, HGX
- Un servidor. Las GPU de centro de datos suelen venir en nodos de 8 GPU; algunos proveedores solo alquilan nodos completos. PetaPrice muestra siempre el precio por GPU.
- TDP
- TGP, potencia de la placa
- Thermal design power (potencia de diseño térmico): aproximadamente la potencia máxima que consume la GPU, en vatios.
- MIG y fracciones de GPU
- Multi-Instance GPU, vGPU, fracción de GPU
- Multi-Instance GPU divide una A100, H100 o posterior en particiones aisladas. Las particiones y otras fracciones de GPU (vGPU) son más baratas, pero no son GPU completas, así que PetaPrice las excluye.
Precios y alquiler
- Bajo demanda
- pago por uso
- Pago por horas (o por segundos) sin compromiso, y puedes parar cuando quieras. Es la vista predeterminada de PetaPrice.
- Spot / interrumpible
- preemptible, interrumpible
- Capacidad sobrante vendida con descuento que el proveedor puede reclamar en cualquier momento. Adecuada para entrenamientos con checkpoints y trabajos por lotes.
- Reservado / comprometido
- uso comprometido, precio por contrato
- Una tarifa por hora más baja a cambio de un compromiso, normalmente de 1 a 3 años o un contrato fijo.
- Hosts comunitarios / marketplaces
- nube comunitaria, P2P
- Plataformas como Vast.ai en las que hosts independientes alquilan sus máquinas. Suelen ser la opción más barata, con más variación en fiabilidad y seguridad.
- Hora de GPU
- GPU·h
- Una GPU durante una hora. Un nodo de 8 GPU durante 2 horas son 16 horas de GPU. Una GPU funcionando las 24 horas suma unas 730 horas de GPU al mes.
- Tráfico de salida (egress)
- transferencia de datos de salida
- Datos transferidos fuera de una nube. Algunos proveedores lo cobran; los precios de PetaPrice no lo incluyen, como tampoco el almacenamiento ni las direcciones IP, salvo que el proveedor los incluya.