Pubblicato il 30 luglio 2026 · prezzi di riferimento, da verificare prima della stesura del budget
Apri il listino prezzi e o3 e GPT-4.1 sembrano identici: entrambi $ 2,00 in ingresso, $ 8,00 in uscita per milione di token. Quindi ho eseguito lo stesso lavoro di estrazione su entrambi, aspettandomi la stessa fattura. o3 è tornato 4,3 volte più costoso. Stesso input, stessa risposta visibile, stessa tariffa per token. Il divario è un elemento pubblicitario che la maggior parte delle persone non vede mai nella pagina dei prezzi: i token di ragionamento.
I modelli di ragionamento (o1, o3, o4-mini di OpenAI e le modalità di ragionamento di GPT-5) non passano direttamente a una risposta. Generano prima una catena di pensiero privata, poi una breve risposta visibile. Non vedi mai la catena, ma ne paghi ogni pezzetto produzione valutare. In un compito in cui il modello restituisce 400 gettoni visibili, può tranquillamente bruciare altri 2.000 gettoni ragionamento dietro le quinte. La tua fattura viene calcolata su 2.400 token di output, non 400.
Questo è il trucco. Il prezzo dell'adesivo è onesto; descrive semplicemente il prezzo dei token e i modelli di ragionamento emettono molto di più di quelli costosi.
| Modello | Ingresso | Produzione | Tipo |
|---|---|---|---|
| GPT-4.1 | $2.00 | $8.00 | Standard |
| o3 | $2.00 | $8.00 | Ragionamento |
| o4-mini più economico | $1.10 | $4.40 | Ragionamento |
| o1 | $15.00 | $60.00 | Ragionamento |
| GPT-5 | $1.25 | $10.00 | Ibrido |
Prendi un carico di lavoro reale: 1.000 richieste/giorno, ciascuno 800 token di input e 400 token di output visibili. Eseguilo per un mese (30.000 richieste, 24 milioni di token di input, 12 milioni di token di output visibili). Ora aggiungi la parte nascosta. Nelle mie serie O, si presenta un compito moderatamente difficile 1.500–2.500 gettoni ragionamento; Ne userò 2.000 qui, che aggiunge 60 milioni di token di output fatturati oltre ai 12 milioni visibili.
| Modello | Gettoni/obbligatori ragionamento | Costo/mese |
|---|---|---|
| GPT-4.1 (nessun ragionamento) | 0 | $144 |
| o4-mini | ~2.000 | $343 |
| o3 | ~2.000 | $624 |
GPT-4.1 e o3 condividono un listino prezzi, ma o3 fattura $ 624 contro $ 144 - perché 72 milioni di token di output (12 milioni visibili + 60 milioni di ragionamento) attraversano il contatore da $ 8 invece di 12 milioni. o4-mini è la via di mezzo sana: più economico per token, paga comunque la tassa di ragionamento, quindi arriva a $ 343 - più del doppio di un modello non ragionante che fa lo stesso lavoro visibile.
OpenAI espone a reasoning_effort parametro (minimo/basso/medio/alto). È la manopola più importante di questa fattura e la maggior parte del codice la lascia al valore predefinito. Riduci o3 da ~2.000 token ragionamento a ~400 e passa lo stesso mese $ 624 a $ 240. Stesso modello, stesso compito, un parametro: un taglio del 62%. Per tutto ciò che non è veramente un problema difficile in più fasi, uno sforzo basso o minimo di solito supera la valutazione ed elimina silenziosamente la maggior parte delle tasse.
1. Non ricorrere ad un modello di ragionamento riflesso. Estrazione, classificazione, etichettatura, instradamento e brevi riassunti non necessitano di catene di pensiero. Un modello standard allo stesso prezzo del cartellino costa un quarto perché non emette gettoni ragionamento.
2. Se ho bisogno di ragionare, mi metto reasoning_effort esplicitamente e inizia da basso, aumentando solo quando una valutazione dimostra che la qualità della risposta diminuisce.
3. Ho letto il completion_tokens_details campo. La risposta API si divide reasoning_tokens separatamente: è lì che il denaro fuoriesce ed è invisibile nel modello mentale "ha restituito 400 token" per richiesta.
4. Io percorso. Compito economico → modello piccolo standard. Compito difficile → modello di ragionamento a sforzo misurato. Un semplice router si ripaga in pochi giorni; vedere i numeri in Calcolatore del risparmio in cascata LLM.
Vuoi il numero esatto per il tuo mix di token? Metti il tuo input, output visibile E una stima realistica del token di ragionamento nel Calcolatore dei costi API AI →o confronta i fornitori testa a testa nel calcolatore dei costi del chatbot. Nuovo ai prezzi dei token? Inizia alle Scopri: come funzionano i prezzi API.
Stime di riferimento, luglio 2026. I conteggi dei token di ragionamento dipendono dal carico di lavoro e sono presi dalle nostre esecuzioni, non dai dati del fornitore: misura i tuoi. Non affiliato con OpenAI.