PetaPrice

Comment utiliser PetaPrice

Trouvez en quelques étapes le GPU le moins cher pour votre charge de travail, et ce qu'il faut regarder pour le choisir.

Utiliser PetaPrice pas à pas

  1. Choisissez quoi optimiser

    Sur la page d'accueil, choisissez FLOPS pour l'entraînement et les charges limitées par le calcul, VRAM pour faire tenir le plus grand modèle par dollar, ou Bande passante pour la génération de tokens des LLM. Pour FLOPS, choisissez aussi la précision que vous utilisez, généralement FP16/BF16.

  2. Filtrez les GPU adaptés

    Définissez une VRAM minimale pour que votre modèle tienne, le nombre de GPU par instance et la tarification à la demande, spot ou réservée. Vous pouvez aussi filtrer par fabricant, par siège du fournisseur (UE uniquement) et par cloud géré ou hébergeurs communautaires.

  3. Lisez le classement

    Le classement trie les GPU par rapport qualité-prix selon leur offre correspondante la moins chère. L'étiquette indique combien chaque GPU coûte de plus par unité que le meilleur. Le graphique du meilleur compromis représente le prix en fonction des performances : plus c'est en haut à gauche, mieux c'est.

  4. Ouvrez un GPU

    La page d'un GPU liste tous les fournisseurs qui le louent, chaque configuration avec son prix, un historique quotidien des prix et le coût dans chaque précision. Touchez un fournisseur pour voir ses configurations et le lien de location.

  5. Comparez des GPU côte à côte

    Choisissez jusqu'à quatre GPU dans Comparer pour voir côte à côte les prix, le calcul par dollar, la mémoire, la bande passante et les fournisseurs.

  6. Vérifiez le prix et louez

    Les prix sont des prix catalogue indicatifs, actualisés environ toutes les 2 heures. Suivez le lien Louer et confirmez le prix sur le site du fournisseur avant de réserver.

Choisir un GPU pour votre charge de travail

Ce qui compte pour chaque type de tâche, et les GPU les plus avantageux pour chacune en ce moment.

Inférence de LLM

Ce qui compte: Assez de mémoire pour les poids et le KV cache, puis la bande passante mémoire : la génération de tokens est limitée par la bande passante.

Meilleur rapport qualité-prix du moment · Meilleure bande passante par dollar avec 80 GB ou plus

  1. 1Instinct MI355X$2.59/h$0.32/TB/s·h
  2. 2Instinct MI325X$2.00/h$0.33/TB/s·h
  3. 3Instinct MI300X$1.85/h$0.35/TB/s·h
Ouvrir cette vue →

Entraînement et fine-tuning

Ce qui compte: Du calcul BF16 ou FP8 dense, de la mémoire pour les poids, les gradients et l'état de l'optimiseur, et NVLink entre les GPU.

Meilleur rapport qualité-prix du moment · Meilleur calcul FP8 par dollar, GPU de data center

  1. 1Instinct MI355X$2.59/h$0.51/PFLOP·h
  2. 2Instinct MI300X$1.85/h$0.71/PFLOP·h
  3. 3B200 SXM$3.20/h$0.71/PFLOP·h
Ouvrir cette vue →

Expériences et petits modèles

Ce qui compte: Un prix horaire bas et au moins 24 GB. Les cartes grand public et pour stations de travail sont souvent le moyen le moins cher de commencer.

Meilleur rapport qualité-prix du moment · Heure GPU la moins chère avec 24 GB ou plus

  1. 1RTX A5000$0.16/h
  2. 2Titan RTX$0.20/h
  3. 3RTX PRO 4000 Blackwell$0.20/h
Ouvrir cette vue →

Calcul scientifique (FP64)

Ce qui compte: Le débit en double précision. De nombreux GPU pour l'IA, dont Blackwell et toutes les cartes grand public, en offrent peu.

Meilleur rapport qualité-prix du moment · Meilleur calcul FP64 par dollar

  1. 1Instinct MI300X$1.85/h$11.3/PFLOP·h
  2. 2Instinct MI325X$2.00/h$12.2/PFLOP·h
  3. 3V100 SXM2 16GB$0.19/h$24.4/PFLOP·h
Ouvrir cette vue →

Quelle précision ?

Une précision plus faible est plus rapide et demande moins de mémoire, à condition que votre GPU l'exécute nativement et que votre modèle la tolère.

FormatBitsUsageNatif sur
FP6464Simulation scientifiqueTous
FP3232Calculs hors tensor cores, code sensible à la précision numériqueTous
TF3219Entraînement FP32 sur tensor coresBlackwell Ultra, Blackwell, Hopper, Ada Lovelace, CDNA 3, Xe-HPC, Ampere
FP16 / BF1616La norme pour entraîner et servir des LLMBlackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, Gaudi, TPU, Trainium, RDNA 3, Xe-HPC, Inferentia, Ampere, CDNA 2, CDNA
FP88Entraînement et inférence plus rapides sur les GPU récentsBlackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, Gaudi, Trainium, Inferentia
INT88Inférence quantifiéeBlackwell Ultra, Blackwell, CDNA 4, Hopper, Ada Lovelace, CDNA 3, TPU, RDNA 3, Xe-HPC, Inferentia, Ampere, CDNA 2, CDNA, Turing
FP44Inférence quantifiée de grands modèlesBlackwell Ultra, Blackwell, CDNA 4

Avant de louer

  • Le modèle tient dans la VRAM, KV cache ou état de l'optimiseur compris.
  • Le GPU exécute nativement votre précision (FP8 et FP4 uniquement sur les générations récentes).
  • Tâches multi-GPU : SXM avec NVLink, et InfiniBand entre serveurs.
  • Le type de prix convient à la tâche : spot uniquement si vous enregistrez des checkpoints.
  • Le stockage, le trafic sortant, ainsi que le CPU et la RAM fournis avec l'instance.
  • Le prix final sur le site du fournisseur.

Astuces

  • Les filtres sont enregistrés dans l'URL : vous pouvez donc mettre n'importe quelle vue en favori ou la partager.
  • La capacité spot coûte souvent moitié moins cher, voire moins, mais peut être arrêtée à tout moment. Utilisez-la pour des tâches avec checkpoints.
  • Comparez les FLOPS denses dans la précision que vous utilisez réellement : les chiffres FP8 et FP4 ne servent que si votre logiciel les exploite.
  • La page de chaque fournisseur affiche tous les GPU qu'il loue et la comparaison de ses prix avec ceux du fournisseur le moins cher.
Commencer à comparer →