costo mensile misto reale
stima forfettaria ingenua
esposizione a sovrapprezzi nascosti
risparmio se le richieste lunghe vengono ridotte
Esposizione a sovrapprezzo

Ripartizione dei costi in base al carico di lavoro

Prezzo delle richieste brevi normalmente alla tariffa base; le richieste lunghe costano la loro INTERA chiamata - input e output - al tasso di cliff più alto. La riga ingenua mostra cosa presupporrebbe una stima forfettaria e la riga tagliata mostra lo scenario in cui le richieste lunghe vengono compresse appena sotto la soglia.

RigaRichiesteCosto/richiestaTotale parziale

Costo misto per quota di richieste lunghe

Tutto il resto si è mantenuto sui valori sopra indicati, spazzato via dalla quota di richieste che superano la soglia. La riga evidenziata è quella più vicina all'impostazione corrente.

Quota oltre sogliaCosto effettivoStima ingenuaSupplemento

Come si collega ad altri strumenti

Questo calcolatore prezza una meccanica specifica: una soglia di lunghezza rigida in cui il suo superamento riprezza un'intera richiesta, non solo i token oltre la linea. Questo è diverso dal nostro calcolatore dei costi della finestra di contesto, che modella un costo per token uniforme e fisso in base alle dimensioni del contesto e non ha alcuna logica di cliff o soglia: utilizza questo strumento se il modello a cui stai fissando il prezzo applica la stessa tariffa indipendentemente dalla lunghezza della richiesta. È anche diverso da Calcolatore dei prezzi per livelli LLM E Calcolatore del livello di servizio LLM, quali livelli di servizio Batch/Flex/Priority basati sulla latenza sono una scelta che fai per richiesta sulla velocità con cui hai bisogno di una risposta, non una conseguenza della durata della tua richiesta. Se desideri prezzi Gemini generali per tutte le dimensioni dei modelli senza escludere la meccanica del dirupo, consulta il Calcolatore dei costi API Gemini. Questa pagina esiste perché una visualizzazione fissa per token della tariffa principale di $ 1,25 di Gemini 2.5 Pro non comprende completamente il costo reale una volta che qualsiasi quota di un carico di lavoro supera i 200.000 token di input.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS