MIG et fractions de GPU
Aussi appelé: Multi-Instance GPU, vGPU, fraction de GPU
Multi-Instance GPU découpe un A100, un H100 ou plus récent en partitions isolées. Ces partitions et les autres fractions de GPU (vGPU) sont moins chères mais ne sont pas des GPU complets : PetaPrice les exclut donc.
Termes associés
- VRAMLa mémoire propre du GPU. Les poids du modèle, les activations et le KV cache doivent y tenir (ou être répartis sur plusieurs GPU) : c'est donc souvent la VRAM qui détermine si un GPU est utilisable.
- À la demandePaiement à l'heure (ou à la seconde), sans engagement, avec arrêt quand vous le souhaitez. C'est la vue par défaut de PetaPrice.
Matériel et interconnexion
- SXM vs PCIeLes GPU SXM sont montés sur une carte de base, reliés entre eux par NVLink, et disposent de plus de puissance électrique : ils sont donc plus rapides. Les cartes PCIe s'insèrent dans un emplacement standard, coûtent moins cher et sont généralement plus lentes. Un H100 SXM et un H100 PCIe sont des produits différents.
- NVLink et NVSwitchLes liaisons haut débit de NVIDIA entre les GPU d'un même serveur, bien plus rapides que le PCIe. Elles comptent lorsqu'un modèle est réparti sur plusieurs GPU. L'équivalent chez AMD est Infinity Fabric.
- InfiniBandLe réseau à faible latence qui relie les serveurs GPU dans les clusters d'entraînement. L'entraînement multi-nœuds en a besoin (ou d'un Ethernet RoCE rapide) ; les tâches sur un seul nœud, non.
- SuperchipUn CPU et un GPU sur un même module, reliés par une liaison rapide, comme le GH200 et le GB200. Le GPU peut utiliser la mémoire du CPU comme extension de la sienne.
- NœudUn serveur. Les GPU de data center sont généralement proposés en nœuds de 8 GPU ; certains fournisseurs ne louent que des nœuds complets. PetaPrice affiche toujours le prix par GPU.
- TDPThermal design power (enveloppe thermique) : en gros, la puissance maximale que consomme le GPU, en watts.