Comment utiliser PetaPrice
Trouvez en quelques étapes le GPU le moins cher pour votre charge de travail, et ce qu'il faut regarder pour le choisir.
Utiliser PetaPrice pas à pas
Choisissez quoi optimiser
Sur la page d'accueil, choisissez FLOPS pour l'entraînement et les charges limitées par le calcul, VRAM pour faire tenir le plus grand modèle par dollar, ou Bande passante pour la génération de tokens des LLM. Pour FLOPS, choisissez aussi la précision que vous utilisez, généralement FP16/BF16.
Filtrez les GPU adaptés
Définissez une VRAM minimale pour que votre modèle tienne, le nombre de GPU par instance et la tarification à la demande, spot ou réservée. Vous pouvez aussi filtrer par fabricant, par siège du fournisseur (UE uniquement) et par cloud géré ou hébergeurs communautaires.
Lisez le classement
Le classement trie les GPU par rapport qualité-prix selon leur offre correspondante la moins chère. L'étiquette indique combien chaque GPU coûte de plus par unité que le meilleur. Le graphique du meilleur compromis représente le prix en fonction des performances : plus c'est en haut à gauche, mieux c'est.
Ouvrez un GPU
La page d'un GPU liste tous les fournisseurs qui le louent, chaque configuration avec son prix, un historique quotidien des prix et le coût dans chaque précision. Touchez un fournisseur pour voir ses configurations et le lien de location.
Comparez des GPU côte à côte
Choisissez jusqu'à quatre GPU dans Comparer pour voir côte à côte les prix, le calcul par dollar, la mémoire, la bande passante et les fournisseurs.
Vérifiez le prix et louez
Les prix sont des prix catalogue indicatifs, actualisés environ toutes les 2 heures. Suivez le lien Louer et confirmez le prix sur le site du fournisseur avant de réserver.
Choisir un GPU pour votre charge de travail
Ce qui compte pour chaque type de tâche, et les GPU les plus avantageux pour chacune en ce moment.
Inférence de LLM
Ce qui compte: Assez de mémoire pour les poids et le KV cache, puis la bande passante mémoire : la génération de tokens est limitée par la bande passante.
Meilleur rapport qualité-prix du moment · Meilleure bande passante par dollar avec 80 GB ou plus
- 1Instinct MI355X$2.59/h$0.32/TB/s·h
- 2Instinct MI325X$2.00/h$0.33/TB/s·h
- 3Instinct MI300X$1.85/h$0.35/TB/s·h
Entraînement et fine-tuning
Ce qui compte: Du calcul BF16 ou FP8 dense, de la mémoire pour les poids, les gradients et l'état de l'optimiseur, et NVLink entre les GPU.
Meilleur rapport qualité-prix du moment · Meilleur calcul FP8 par dollar, GPU de data center
- 1Instinct MI355X$2.59/h$0.51/PFLOP·h
- 2Instinct MI300X$1.85/h$0.71/PFLOP·h
- 3B200 SXM$3.20/h$0.71/PFLOP·h
Expériences et petits modèles
Ce qui compte: Un prix horaire bas et au moins 24 GB. Les cartes grand public et pour stations de travail sont souvent le moyen le moins cher de commencer.
Meilleur rapport qualité-prix du moment · Heure GPU la moins chère avec 24 GB ou plus
Ouvrir cette vue →Calcul scientifique (FP64)
Ce qui compte: Le débit en double précision. De nombreux GPU pour l'IA, dont Blackwell et toutes les cartes grand public, en offrent peu.
Meilleur rapport qualité-prix du moment · Meilleur calcul FP64 par dollar
- 1Instinct MI300X$1.85/h$11.3/PFLOP·h
- 2Instinct MI325X$2.00/h$12.2/PFLOP·h
- 3V100 SXM2 16GB$0.19/h$24.4/PFLOP·h
Quelle précision ?
Une précision plus faible est plus rapide et demande moins de mémoire, à condition que votre GPU l'exécute nativement et que votre modèle la tolère.
| Format | Bits | Usage | Natif sur |
|---|---|---|---|
| FP64 | 64 | Simulation scientifique | Tous |
| FP32 | 32 | Calculs hors tensor cores, code sensible à la précision numérique | Tous |
| TF32 | 19 | Entraînement FP32 sur tensor cores | Blackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 3, Xe-HPC, Ampere |
| FP16 / BF16 | 16 | La norme pour entraîner et servir des LLM | Blackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, Gaudi, TPU, Trainium, RDNA 3, Xe-HPC, Inferentia, Ampere, CDNA 2, CDNA |
| FP8 | 8 | Entraînement et inférence plus rapides sur les GPU récents | Blackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, Gaudi, Trainium, Inferentia |
| INT8 | 8 | Inférence quantifiée | Blackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, TPU, RDNA 3, Xe-HPC, Inferentia, Ampere, CDNA 2, CDNA, Turing |
| FP4 | 4 | Inférence quantifiée de grands modèles | Blackwell Ultra, Blackwell, CDNA 4 |
Avant de louer
- Le modèle tient dans la VRAM, KV cache ou état de l'optimiseur compris.
- Le GPU exécute nativement votre précision (FP8 et FP4 uniquement sur les générations récentes).
- Tâches multi-GPU : SXM avec NVLink, et InfiniBand entre serveurs.
- Le type de prix convient à la tâche : spot uniquement si vous enregistrez des checkpoints.
- Le stockage, le trafic sortant, ainsi que le CPU et la RAM fournis avec l'instance.
- Le prix final sur le site du fournisseur.
Astuces
- Les filtres sont enregistrés dans l'URL : vous pouvez donc mettre n'importe quelle vue en favori ou la partager.
- La capacité spot coûte souvent moitié moins cher, voire moins, mais peut être arrêtée à tout moment. Utilisez-la pour des tâches avec checkpoints.
- Comparez les FLOPS denses dans la précision que vous utilisez réellement : les chiffres FP8 et FP4 ne servent que si votre logiciel les exploite.
- La page de chaque fournisseur affiche tous les GPU qu'il loue et la comparaison de ses prix avec ceux du fournisseur le moins cher.