Come funziona questa calcolatrice
IL Calcolatore dei costi di inferenza GPU converte tre input: il tuo Prezzo GPU all'ora, modello throughput in token al secondo, e a percentuale di utilizzo realistica – nel vero costo per milione di token per un modello self-hosted. L'idea di base è semplice: un'ora di utilizzo della GPU consente di acquistare un numero fisso di token, quindi dividendo il costo orario per i token effettivamente prodotti si ottiene il prezzo per token. Il throughput imposta il numero di token generati dall'hardware ogni secondo, mentre l'utilizzo sconta tale cifra per riflettere i tempi di inattività, le lacune di batching e il traffico che raramente mantiene la GPU completamente carica.
Il compromesso chiave è utilizzo. Il throughput di riferimento presuppone una GPU costantemente occupata, ma i carichi di lavoro reali rimangono inattivi tra una richiesta e l'altra, quindi una GPU noleggiata fatturata su base oraria può costare molto di più per token rispetto a quanto suggerisce il numero del titolo. Prima di impegnarti nell'hosting autonomo, stima il tuo VERO utilizzare onestamente e confrontare il risultato con i prezzi API per token: il traffico basso e intenso spesso favorisce un'API, mentre un volume elevato e costante premia il possesso dell'hardware.
Domande frequenti
Come posso calcolare il costo per token sulla mia GPU?
Prendi il prezzo orario della GPU e dividi per il numero di token effettivamente serviti all'ora. Questo corrisponde al throughput (token/sec) moltiplicato per 3600, scalato in base al tuo utilizzo reale. Una GPU fatturata in modo continuo ma semiinattiva serve la metà dei token, quindi il suo costo per token raddoppia rispetto alla velocità effettiva della scheda dati.
Perché il costo del servizio self-hosted è superiore al previsto?
Quasi sempre utilizzo e batching. La velocità effettiva di riferimento presuppone un carico completo e in batch; il traffico reale è intenso, quindi la GPU rimane inattiva tra le richieste mentre il contatore è in funzione. Il batching continuo, il corretto dimensionamento della GPU e il consolidamento del traffico su un numero inferiore di GPU più trafficate sono i modi principali per ridurre il costo per token.