Domande frequenti
Come funziona PetaPrice, da dove provengono i numeri e come scegliere una GPU.
Prezzi e numeri
Che cos'è il $ per PFLOP-ora?
È il prezzo di noleggio di una GPU per un'ora diviso per la sua potenza di calcolo di picco in PetaFLOPS alla precisione scelta. Mostra quanta capacità di calcolo compra ogni dollaro, così una GPU economica e lenta e una costosa e veloce si possono confrontare direttamente. Più basso è meglio.
Quale GPU offre più capacità di calcolo per dollaro in questo momento?
In FP16/BF16 denso, la RTX 4070 SUPER è attualmente in testa con $0.97 per PFLOP-ora ($0.07 per GPU-ora su Vast.ai). Le classifiche cambiano con i prezzi; la tabella qui sopra si aggiorna ogni 2 ore.
Quanto costa una H100 all'ora?
I prezzi on demand della H100 SXM partono attualmente da $1.82 per GPU-ora, con una mediana di $3.52 su 22 provider. La capacità spot parte da $1.22.
Perché FLOPS densi invece dei valori delle schede tecniche NVIDIA?
I valori tensor pubblicizzati spesso presuppongono la sparsità strutturata 2:4, che li raddoppia ma è raramente usata nella pratica. PetaPrice usa sempre il throughput denso, così GPU e produttori sono confrontati in modo equo.
Da dove provengono i dati sui prezzi?
Direttamente dai provider ovunque pubblichino i prezzi (API pubbliche, listini ufficiali e pagine dei prezzi), con l'API multi-cloud di Shadeform e i cataloghi di SkyPilot a colmare le lacune: 941 offerte da 32 provider, aggiornate circa ogni 2 ore. I prezzi sono prezzi di listino indicativi; verifica con il provider prima di prenotare.
Qual è la differenza tra on demand, spot e riservato?
L'on demand è fatturato a ore senza vincoli. La capacità spot (interrompibile) costa meno ma può essere revocata in qualsiasi momento. I prezzi riservati richiedono un impegno, in genere da 1 a 3 anni. PetaPrice non li mescola mai; la vista predefinita è on demand.
Scegliere una GPU
Quale GPU dovrei noleggiare per l'inferenza di LLM?
Prima assicurati che il modello ci stia: pesi più KV cache devono entrare nella VRAM (un modello da 70B in FP16 richiede circa 140 GB solo per i pesi). Poi confronta la banda di memoria, perché la generazione di token è di solito limitata dalla banda; imposta «Ottimizza per» su Banda nella home page. Per il training e il prefill di prompt lunghi, confronta invece i FLOPS.
Qual è la GPU migliore per il training?
Confronta il $ per PFLOP-ora alla precisione in cui fai training (di solito BF16, o FP8 su Hopper e successive). Per il training su più GPU, preferisci GPU SXM con NVLink; su più server serve anche InfiniBand. La capacità spot costa molto meno se il tuo job salva checkpoint regolarmente.
I dati
Perché il sito di un provider mostra un prezzo diverso?
I prezzi cambiano, variano per regione e alcuni provider fatturano CPU, RAM o storage a parte. PetaPrice si aggiorna circa ogni 2 ore e mostra la regione più economica; al momento della prenotazione fa fede il sito del provider. Se un prezzo è sistematicamente sbagliato, segnalacelo.
Perché non vedo partizioni MIG o GPU frazionarie?
Una frazione di GPU non è confrontabile con una GPU intera, quindi partizioni MIG, vGPU e GPU in time-sharing sono escluse ovunque. Ogni prezzo su PetaPrice si riferisce a una GPU completa.
Cosa significa «community»?
Gli host community noleggiano macchine tramite marketplace peer-to-peer come Vast.ai o RunPod Community Cloud. Spesso sono i più economici, ma affidabilità e sicurezza variano da host a host. Usa il filtro Host per mostrare solo i cloud gestiti.
Cosa mostra il filtro UE?
I provider con sede in uno stato membro dell'UE. Il filtro si basa su dove ha sede l'azienda, non su dove girano le sue GPU, quindi controlla le regioni del provider se la residenza dei dati è importante.
Esiste un'API?
Sì. /api/offers restituisce tutte le offerte normalizzate più la scheda tecnica delle GPU in JSON, con CORS abilitato. /llms.txt riassume il sito per gli assistenti AI.
Ho trovato un prezzo sbagliato. Come lo segnalo?
Inviaci la GPU, il provider e un link alla sua pagina dei prezzi. La pagina Correzioni spiega come fare ed elenca ciò che abbiamo corretto finora.