Ogni GPU alle tue ore e conta
Costo mensile per le ore e il numero di GPU sopra indicati: on demand e spot affiancati.
| GPU | VRAM | Su richiesta $/h | Spot $/h | Mensile (il tuo livello) |
|---|
Una GPU noleggiata fattura ogni ora di accensione
La cosa che sorprende i team che passano dalle API alle proprie GPU è che il misuratore non si ferma mai. Un'API per token non costa nulla quando il traffico è tranquillo; un H100 noleggiato costa lo stesso sia che sia saturo o con un utilizzo del 2%, perché stai pagando l'ora, non il lavoro. Ecco perché l'elemento più importante sul tuo conto non è la GPU che scegli, ma quante ore continua a farlo funzionare. Un H100 che ti serve solo otto ore al giorno costa un terzo di uno lasciato acceso 24 ore su 24. Questo calcolatore lo rende esplicito: imposta le ore reali, non il massimo teorico, e osserva il movimento del numero mensile. Il menu a discesa di impostazione rapida copre i modelli comuni: inferenza sempre attiva, una casella di formazione per la giornata lavorativa, esecuzioni batch nel fine settimana.
Il livello è la seconda leva. La capacità on-demand è garantita per tutto il tempo in cui la mantieni e ha un prezzo maggiorato; Le istanze spot, comunitarie e interrompibili sono capacità inutilizzate vendute a un prezzo inferiore del 20-50%, con il vantaggio che il fornitore può riprenderle. Per la formazione con checkpoint o per lavori batch tolleranti agli errori, lo spot è vicino al denaro gratuito; per un endpoint di inferenza che non può battere ciglio, il premio on-demand ti offre stabilità. La tabella mostra entrambe le tariffe per ogni carta, quindi il compromesso è davanti a te. Una volta ottenuto il numero di noleggio, la vera domanda è se possedere ore di GPU effettivamente batte il pagamento per token: risolvilo con Calcolatore LLM e API self-hosted, quindi valuta la larghezza di banda servita dal tuo modello con calcolatore dell'uscita dalle nuvole e gli stessi endpoint dell'inferenza con il calcolatore dei costi delle funzioni serverless.
Come usarlo
1. Scegli la tua GPU: le tipiche tariffe on-demand e spot vengono caricate automaticamente.
2. Scegli on-demand o spot e imposta il numero di GPU in esecuzione.
3. Imposta le ore mensili o utilizza il menu a discesa di impostazione rapida per un ciclo di lavoro comune.
4. Leggi il costo mensile e il risparmio immediato e confronta ogni GPU nella tabella.
Errori comuni
Supponendo che sia sempre attivo. 730 ore sono il massimo, non il tuo utilizzo: la maggior parte dei carichi di lavoro ne richiede molto meno. Dimenticare le bollette dei tempi di inattività. Una GPU lasciata in funzione tra un lavoro e l'altro costa ancora la tariffa intera; spegnilo o usa la scalabilità automatica. Scegliere la carta più grande. Un L4 o 4090 spesso serve un modello piccolo a una frazione del costo di un H100: abbina la GPU al modello. Ignorando l'archiviazione e l'uscita. Volumi, snapshot e trasferimento dati sono voci separate; aggiungi spazio di archiviazione sopra e prezzo in uscita separatamente.
Domande frequenti
Di quale GPU ho bisogno per il mio modello?
Approssimativamente: i modelli 7–13B si adattano a L4, RTX 4090 o A100 da 40 GB; I modelli di classe 70B necessitano di una scheda A100/H100 da 80 GB o più schede. Una scheda più grande non è più economica se una scheda più piccola gestisce il carico: abbina la VRAM al modello e alle dimensioni del batch.
Per quante ore è "sempre attivo"?
Circa 730: ovvero 24 × 365 ÷ 12. Qualsiasi cosa inferiore all'uso continuo dovrebbe impostare le ore effettive, poiché il costo scala linearmente con esse.
Perché i prezzi differiscono così tanto tra i fornitori?
I cloud specializzati (RunPod, Vast.ai, Lambda) e i mercati community/spot sono significativamente inferiori agli hyperscaler per lo stesso silicio. Le tariffe qui sono una miscela di fascia media: il prezzo in tempo reale del tuo fornitore è quello che conta.
Ciò include il costo dell'API del modello stesso?
No, si tratta del noleggio di GPU grezza. Per confrontare il noleggio e l'hosting autonomo con un'API per token, utilizza il file calcolatore self-hosted e API.
Solo stima. Le tariffe delle GPU cambiano costantemente e variano in base al fornitore e alla regione: verifica i prezzi in tempo reale prima di fare affidamento su di essi.