I token pensanti vengono fatturati alla tariffa di output e nascosti dalla risposta. Una chiamata p50 (tipica) e una chiamata p99 (difficile) sullo stesso modello eseguono lo stesso codice ma arrivano molto distanti sulla bolletta. Il divario – non la media – è ciò che distrugge un budget mensile.
Stima ingenua vs tipica vs coda
La riga "ingenua" è ciò che ti dice un semplice calcolatore di token: ignora completamente il pensiero nascosto. Il divario rispetto alla riga tipica è il premio pensante che pagherai effettivamente; il divario rispetto all’ultima fila è il rischio di bilancio.
| Scenario | Gettoni pensanti | Costo/chiamata | Costo/mese | vs ingenuo |
|---|
Fascia di bilancio per gravità della coda
Quanto può variare la tua fattura mensile a seconda di quanto pesante diventa la coda del prompt. Scegli il multiplo della coda che corrisponde alla variabilità reale dei tuoi suggerimenti.
| Coda multipla | p99 gettoni pensanti | Costo/chiamata | Costo/mese |
|---|
Why a single cost-per-call number lies about reasoning models
Un modello non ragionante è vicino al determinismo sui costi: invii N token di input, ricevi M token di output, moltiplichi per le tariffe e il gioco è fatto. I modelli di ragionamento lo smentiscono. Tra il suggerimento e la risposta il modello gestisce una catena di pensiero privata: il gettoni pensanti - e ti verranno addebitati tutti alla tariffa di output anche se non compaiono mai nella risposta. Fondamentalmente, il conteggio è dipendente dai dati: una classificazione semplice potrebbe costare qualche centinaio, una prova complessa in più passaggi o un turno di pianificazione degli strumenti agenti potrebbero spendere decine di migliaia. Quindi il vero costo per chiamata non è un numero, è una distribuzione, e citare solo la sua mediana (p50) nasconde la parte della distribuzione che effettivamente fa saltare i budget: la coda.
Lo spread p50/p99 e la tassa ragionata
Il costo per chiamata è input×input_prezzo + (output_visibile + pensiero)×output_prezzo. Tieni tutto fisso tranne il pensiero e tutto ruota su quell'unica variabile. Al conteggio del pensiero tipico ottieni il tuo costo di p50; moltiplica il pensiero per un fattore di coda per il caso difficile e ottieni p99. Con un ragionamento pesante i due possono trovarsi a 3-5 volte di distanza, il che significa che lo stesso volume mensile può fatturare ovunque su quella fascia a seconda solo di quanto siano stati difficili gli stimoli del mese. IL tassa di ragionamento - la frazione della bolletta che deriva dal pensiero piuttosto che dall'input inviato o dalla risposta ricevuta - di solito cancella il 70-80% dei carichi di lavoro pesanti. Stai pagando principalmente per il lavoro da zero. Vedere quella condivisione è solitamente il momento in cui le squadre aggiungono un limite di riflessione.
Come restringere la fascia
Tre leve lo muovono. Limita lo sforzo di ragionamento o i token di pensiero massimo in modo che la coda non possa fisicamente scappare: questo scambia una piccola qualità di risposta alle richieste più difficili con un tetto rigido sui costi. Percorso per difficoltà: invia la maggioranza facile a un modello economico e non ragionante e riserva il modello di ragionamento per i suggerimenti che ne hanno veramente bisogno. E monitorare il p99, non la media, perché una serie di suggerimenti forti alza la coda molto prima che sposti la media. Notare che memorizzazione nella cache tempestiva taglia il lato degli input ma non quello del pensiero, quindi nel traffico intenso del ragionamento il limite del pensiero è la leva che conta: abbinalo al calcolatore di token di ragionamento piatto per la stima puntuale e il calcolatore del budget del loop dell'agente per il caso a più fasi.
Strumenti e hosting
Come funziona questa calcolatrice
Valuta una chiamata di ragionamento come input×input_price + (visible_output + thinking)×output_price per milione di token, calcolando tre punti: una stima ingenua che ignora il pensiero, una tipica chiamata (p50) al tuo tipico conteggio di pensiero e una coda (p99) chiamata a p50 pensando × il tuo multiplo di coda. Riporta l'imposta di ragionamento (la quota di pensiero della fattura p50), i totali mensili tipici e di coda in base al volume delle chiamate e una tabella di sensibilità tra i multipli di coda in modo da poter vedere l'intera fascia di budget.
Domande frequenti
Perché i modelli di ragionamento sono così imprevedibili rispetto al budget?
Emettono gettoni di pensiero nascosti fatturati come output e il conteggio oscilla da poche centinaia con un prompt facile a decine di migliaia con uno difficile. Ridimensiona il budget per una chiamata tipica e la coda può fatturare 3-5 volte di più per chiamata.
Come calcolo il costo dei token di ragionamento?
Costo per chiamata = input×prezzo_input + (output_visibile + pensiero)×prezzo_output, per milione di token. Il pensiero viene fatturato al tasso di output ed è invisibile e variabile: stima un valore tipico e un multiplo di coda e valuta entrambi.
Qual è la tassa di ragionamento?
La parte della bolletta che è nascosta nel pensiero piuttosto che nell'input o nella risposta. Nelle chiamate con ragionamenti pesanti supera normalmente il 70-80%: paghi di più per il lavoro di base che per la conversazione visibile.
📚 Nuovo qui? Scopri come funzionano i prezzi dell'API LLM →