I token pensanti vengono fatturati alla tariffa di output e nascosti dalla risposta. Una chiamata p50 (tipica) e una chiamata p99 (difficile) sullo stesso modello eseguono lo stesso codice ma arrivano molto distanti sulla bolletta. Il divario – non la media – è ciò che distrugge un budget mensile.

tassa sul ragionamento (quota del pensiero nascosto)
costo/chiamata (tipico)
mensile (tipico p50)
mensile (coda p99)

Stima ingenua vs tipica vs coda

La riga "ingenua" è ciò che ti dice un semplice calcolatore di token: ignora completamente il pensiero nascosto. Il divario rispetto alla riga tipica è il premio pensante che pagherai effettivamente; il divario rispetto all’ultima fila è il rischio di bilancio.

ScenarioGettoni pensantiCosto/chiamataCosto/mesevs ingenuo

Fascia di bilancio per gravità della coda

Quanto può variare la tua fattura mensile a seconda di quanto pesante diventa la coda del prompt. Scegli il multiplo della coda che corrisponde alla variabilità reale dei tuoi suggerimenti.

Coda multiplap99 gettoni pensantiCosto/chiamataCosto/mese
⚠️ Reference model, July 2026. Thinking (reasoning) tokens are billed at each provider's produzione token rate e non vengono restituiti nella risposta. Il conteggio dei pensieri p50 e il multiplo della coda sono le tue stime: estrai numeri reali dal dashboard di utilizzo del tuo provider, che riporta i token di ragionamento separatamente. I prezzi indicati sono tariffe di riferimento modificabili; conferma le tariffe in tempo reale sulla pagina dei prezzi del fornitore. · Segnala prezzo obsoleto →

Why a single cost-per-call number lies about reasoning models

Un modello non ragionante è vicino al determinismo sui costi: invii N token di input, ricevi M token di output, moltiplichi per le tariffe e il gioco è fatto. I modelli di ragionamento lo smentiscono. Tra il suggerimento e la risposta il modello gestisce una catena di pensiero privata: il gettoni pensanti - e ti verranno addebitati tutti alla tariffa di output anche se non compaiono mai nella risposta. Fondamentalmente, il conteggio è dipendente dai dati: una classificazione semplice potrebbe costare qualche centinaio, una prova complessa in più passaggi o un turno di pianificazione degli strumenti agenti potrebbero spendere decine di migliaia. Quindi il vero costo per chiamata non è un numero, è una distribuzione, e citare solo la sua mediana (p50) nasconde la parte della distribuzione che effettivamente fa saltare i budget: la coda.

Lo spread p50/p99 e la tassa ragionata

Il costo per chiamata è input×input_prezzo + (output_visibile + pensiero)×output_prezzo. Tieni tutto fisso tranne il pensiero e tutto ruota su quell'unica variabile. Al conteggio del pensiero tipico ottieni il tuo costo di p50; moltiplica il pensiero per un fattore di coda per il caso difficile e ottieni p99. Con un ragionamento pesante i due possono trovarsi a 3-5 volte di distanza, il che significa che lo stesso volume mensile può fatturare ovunque su quella fascia a seconda solo di quanto siano stati difficili gli stimoli del mese. IL tassa di ragionamento - la frazione della bolletta che deriva dal pensiero piuttosto che dall'input inviato o dalla risposta ricevuta - di solito cancella il 70-80% dei carichi di lavoro pesanti. Stai pagando principalmente per il lavoro da zero. Vedere quella condivisione è solitamente il momento in cui le squadre aggiungono un limite di riflessione.

Come restringere la fascia

Tre leve lo muovono. Limita lo sforzo di ragionamento o i token di pensiero massimo in modo che la coda non possa fisicamente scappare: questo scambia una piccola qualità di risposta alle richieste più difficili con un tetto rigido sui costi. Percorso per difficoltà: invia la maggioranza facile a un modello economico e non ragionante e riserva il modello di ragionamento per i suggerimenti che ne hanno veramente bisogno. E monitorare il p99, non la media, perché una serie di suggerimenti forti alza la coda molto prima che sposti la media. Notare che memorizzazione nella cache tempestiva taglia il lato degli input ma non quello del pensiero, quindi nel traffico intenso del ragionamento il limite del pensiero è la leva che conta: abbinalo al calcolatore di token di ragionamento piatto per la stima puntuale e il calcolatore del budget del loop dell'agente per il caso a più fasi.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Costo del gettone ragionamentoBudget del ciclo dell'agenteCosto del token LLMConfronta i prezzi dei modelli AI

Strumenti e hosting

📈TradingView🔒NordVPN💳 RivoluzioneHostingerIA intricata

Come funziona questa calcolatrice

Valuta una chiamata di ragionamento come input×input_price + (visible_output + thinking)×output_price per milione di token, calcolando tre punti: una stima ingenua che ignora il pensiero, una tipica chiamata (p50) al tuo tipico conteggio di pensiero e una coda (p99) chiamata a p50 pensando × il tuo multiplo di coda. Riporta l'imposta di ragionamento (la quota di pensiero della fattura p50), i totali mensili tipici e di coda in base al volume delle chiamate e una tabella di sensibilità tra i multipli di coda in modo da poter vedere l'intera fascia di budget.

Domande frequenti

Perché i modelli di ragionamento sono così imprevedibili rispetto al budget?

Emettono gettoni di pensiero nascosti fatturati come output e il conteggio oscilla da poche centinaia con un prompt facile a decine di migliaia con uno difficile. Ridimensiona il budget per una chiamata tipica e la coda può fatturare 3-5 volte di più per chiamata.

Come calcolo il costo dei token di ragionamento?

Costo per chiamata = input×prezzo_input + (output_visibile + pensiero)×prezzo_output, per milione di token. Il pensiero viene fatturato al tasso di output ed è invisibile e variabile: stima un valore tipico e un multiplo di coda e valuta entrambi.

Qual è la tassa di ragionamento?

La parte della bolletta che è nascosta nel pensiero piuttosto che nell'input o nella risposta. Nelle chiamate con ragionamenti pesanti supera normalmente il 70-80%: paghi di più per il lavoro di base che per la conversazione visibile.

Impara e confronta
Cos'è un token →Confronta 387 modelli →Prezzo per modello →