Precisión
También conocido como: formato numérico, tipo de datos
Cuántos bits usa cada número. Menos bits suponen más rendimiento y menos memoria, a costa de algo de exactitud. Una misma GPU tiene un pico distinto en cada precisión.
Términos relacionados
- FP16 y BF16Formatos de 16 bits y el estándar para entrenar y ejecutar LLM. BF16 conserva el rango de FP32 con menos precisión, lo que hace el entrenamiento más estable; requiere Ampere, CDNA 2 o posterior.
- FP8Coma flotante de 8 bits para entrenamiento e inferencia, con aproximadamente el doble de rendimiento que FP16. Nativo en Hopper, Ada, Blackwell y AMD CDNA 3 y posteriores.
- FP4Coma flotante de 4 bits, usada para inferencia cuantizada. Solo Blackwell y AMD CDNA 4 lo ejecutan de forma nativa.
- TF32Formato de 19 bits de NVIDIA que ejecuta operaciones matriciales FP32 en tensor cores. PyTorch puede usarlo para las multiplicaciones de matrices FP32 en Ampere y posteriores.
- INT8 y TOPSEnteros de 8 bits para inferencia cuantizada. El rendimiento se mide en TOPS (billones de operaciones por segundo) en lugar de FLOPS.
Cómputo
- FLOPS, TFLOPS, PFLOPSOperaciones de coma flotante por segundo: cuánta aritmética puede hacer un chip. 1 TFLOPS equivale a un billón por segundo y 1 PFLOPS (PetaFLOPS), a mil TFLOPS. PetaPrice muestra todo el cómputo en PFLOPS.
- FLOPS densos vs. dispersosLos fabricantes suelen indicar el rendimiento tensorial con dispersión estructurada 2:4, que duplica la cifra destacada. Casi ningún entrenamiento ni inferencia la usa, así que PetaPrice muestra siempre cifras densas.
- $ por PFLOP-horaEl precio de una hora de GPU dividido entre los PFLOPS pico densos de la GPU en la precisión elegida. Indica cuánto cómputo se obtiene por cada dólar, de modo que las GPU rápidas y caras pueden compararse directamente con las lentas y baratas. Cuanto menor, mejor.
- Tensor cores / matrix coresUnidades que multiplican matrices pequeñas en un solo paso y de las que procede casi todo el rendimiento de IA de una GPU. NVIDIA las llama tensor cores y AMD, matrix cores.
- MFU (utilización de FLOPS del modelo)La proporción de los FLOPS pico que alcanza una carga de trabajo real. Los grandes entrenamientos suelen llegar al 30–60%, así que los picos de ficha técnica sirven para comparar GPU, no para predecir tiempos de ejecución.