—rispetto a quello su richiesta
—effettivo $/1 milione
—capacità utilizzata
Prezzo effettivo all'aumentare del volume
Il costo di prenotazione è fisso, quindi ogni token aggiuntivo riduce il prezzo effettivo per milione, fino a raggiungere il limite di capacità e le fatture in eccesso alla tariffa on-demand.
| Volume mensile | Costo a richiesta | Riservato con effetto $/1 milione | Più economico |
|---|
Capacità di riserva solo al di sopra del pareggio
Il throughput assegnato (PTU su Azure OpenAI, throughput assegnato su AWS Bedrock) scambia una fattura per token con una prenotazione mensile fissa di capacità dedicata. Acquista una latenza prevedibile e un costo fisso, ma fa risparmiare denaro solo una volta che il volume costante dei token supera il pareggio: il costo di prenotazione diviso per il prezzo on-demand per token. Al di sotto di questo stai pagando per le unità inattive; al di sopra di esso, il costo fisso si distribuisce su più token e il prezzo effettivo per milione continua a diminuire, fino al limite massimo di capacità di unità × token al minuto × minuti nel mese. Superare il massimale e le bollette in eccesso a pieno tasso su richiesta, erodendo silenziosamente lo sconto. Dimensiona la prenotazione in base al volume che sei sicuro utilizzerai ogni mese e prevedi la crescita sul volume Calcolatore della previsione dei costi APIe confrontare un impegno di spesa su calcolatore dello sconto sulla spesa impegnata.
Calcolatore dei costi di valutazione LLMCalcolatore dei costi di generazione dei dati sinteticiLicenza AI Seat e calcolatore dei costi APICalcolatore dei tempi e dei costi di elaborazione batchCalcolatore del costo AI per utente
Come funziona questa calcolatrice
Calcolatore gratuito del throughput assegnato: nel caso in cui dovessi prenotare capacità LLM dedicata (Azure OpenAI PTU, throughput assegnato Bedrock) o rimanere con il modello con pagamento in base al consumo...
Domande frequenti
Cos'è il throughput assegnato e quando ne vale la pena?
Throughput assegnato: Azure OpenAI lo chiama PTU, AWS Bedrock lo chiama throughput assegnato: significa noleggiare la capacità del modello dedicato per una tariffa mensile fissa invece di pagare per token. Prenoti un numero di unità, ciascuna capace di un determinato numero di token al minuto, e paghi lo stesso importo indipendentemente dal fatto che la utilizzi completamente o meno. Vince solo quando il volume costante dei tuoi token è sufficientemente elevato da far sì che la fattura a consumo equivalente superi la prenotazione. Al di sotto di tale pareggio si paga per la capacità inutilizzata; al di sopra di esso ogni token extra è effettivamente gratuito finché non si raggiunge il limite di throughput.
Come posso trovare il pareggio per una prenotazione PTU?
Dividere il costo totale della prenotazione mensile per il prezzo on-demand per token. Ciò fornisce il numero di gettoni a cui il pagamento in base al consumo costerebbe esattamente lo stesso della prenotazione. Elabora meno token e on-demand è più economico; elabora di più e la prenotazione vince, fino al limite di capacità, ovvero le unità per i gettoni al minuto per i minuti in un mese. Questo calcolatore mostra sia il volume dei token di pareggio che l'utilizzo della capacità in modo da poter vedere se stai sottoutilizzando la prenotazione o se stai per esaurire il margine.
Cosa succede se supero la capacità assegnata?
Le richieste oltre i token al minuto riservati vengono limitate o, sulla maggior parte delle piattaforme, si riversano in prezzi a consumo per l'eccesso. Di solito questo va bene per periodi brevi, ma se la tua domanda media supera regolarmente la capacità, pagherai l'intera tariffa on-demand sull'overflow oltre alla prenotazione fissa, che cancella lo sconto. Il calcolatore segnala quando il volume mensile è superiore alla capacità riservata, in modo da sapere se aggiungere unità o lasciare lo spillover su richiesta deliberatamente anziché per sbaglio.