Pubblicato il 10-08-2026 · numeri di riferimento, verificare prima di definire il budget
Esegui lo stesso carico di lavoro della catena di pensiero tramite o1 di OpenAI e costa 27 volte quanto costa DeepSeek R1. Eseguilo invece tramite o3 - stesso fornitore, stesso livello di ragionamento, stesso comportamento "pensare prima di rispondere" - e il divario scende a 3,6 volte. Non si tratta di una differenza di arrotondamento. Significa che la domanda "quanto costa un modello di ragionamento rispetto a uno a peso aperto" non ha una risposta. Ha una risposta diversa per ogni modello di nave OpenAI, perché la linea di ragionamento di OpenAI copre un intervallo 7,5x prima ancora di guardare fuori dal loro catalogo.
Estratto direttamente dalla nostra tabella dei prezzi (387 modelli tracciati, ultimo aggiornamento rispetto ai documenti del fornitore): i quattro SKU attuali di ragionamento di OpenAI, più R1 di DeepSeek e le sue varianti distillate, per 1 milione di token.
| Modello | Fornitore | Ingresso /1M | Uscita/1M | rispetto a DeepSeek R1 (misto) |
|---|---|---|---|---|
| o1 | OpenAI | $15.00 | $60.00 | 27.4× |
| o3 | OpenAI | $2.00 | $8.00 | 3.7× |
| o4-mini / o3-mini / o1-mini | OpenAI | $1.10 | $4.40 | 2.0× |
| Grok 4 Ragionamento | xAI | $3.00 | $15.00 | 6.2× |
| DeepSeek R1 | DeepSeek | $0.55 | $2.19 | 1.0× |
| DeepSeek R1 Distilla lama 70B | DeepSeek | $0.23 | $0.69 | 0.35× |
| DeepSeek R1 Distilla Qwen 32B | DeepSeek | $0.18 | $0.18 | 0.11× |
| Prezzi di riferimento dalla nostra tabella monitorata, 387 modelli. "vs DeepSeek R1" utilizza un rapporto token input:output misto di 3:8 corrispondente all'esempio riportato di seguito. Esegui il tuo rapporto su calcolatore dei costi dei gettoni di ragionamento. | ||||
Notate la forma di quella curva. Non è una linea retta dal costoso all'economico: da solo o1 a o3 si ottiene una riduzione del prezzo di uscita dell'87% all'interno del catalogo di OpenAI, senza il coinvolgimento di alcun concorrente. Le varianti distillate di DeepSeek riducono quindi anche l'R1 completo di altre 3-5 volte, a un costo di capacità reale su cui i benchmark sono onesti. Quattro punti su un unico tavolo, quattro storie completamente diverse su cosa significhi "tassa ragionata".
Un agente di valutazione del supporto che ragiona prima di rispondere: 1.500 token di contesto di input per ticket, 4.000 token di output una volta contati i token nascosti della catena di pensiero fatturati come output. 10.000 ticket al mese equivalgono a 15 milioni di token di input e 40 milioni di token di output, confrontati con ciascun modello:
| Modello | Costo di ingresso | Costo di produzione | Totale mensile |
|---|---|---|---|
| o1 | $225.00 | $2,400.00 | $2,625.00 |
| Grok 4 Ragionamento | $45.00 | $600.00 | $645.00 |
| o3 | $30.00 | $320.00 | $350.00 |
| o4-mini | $16.50 | $176.00 | $192.50 |
| DeepSeek R1 | $8.25 | $87.60 | $95.85 |
| 10.000 ticket/mese × 1.500 token in entrata/4.000 in uscita. Carico di lavoro illustrativo: valuta il tuo mix su calcolatore dei costi dei gettoni di ragionamento. | |||
$ 2.625 al mese su o1 contro $ 95,85 su DeepSeek R1 per un carico di lavoro che, sulla carta, richiede la stessa cosa a entrambi i modelli. Scambiando invece o1 con o3, il conto di OpenAI da solo scende dell'87%, da $ 2.625 a $ 350, prima che DeepSeek entri nel confronto. La maggior parte delle storie dell'orrore sul "ragionamento fiscale" che circolano in questo momento sono in realtà i prezzi o1 riportati da quando era l'unica opzione di ragionamento di frontiera. Non lo è più, nemmeno all'interno della formazione di OpenAI.
o1 aveva un prezzo quando l'inferenza del ragionamento era scarsa e per lo più non dimostrata: veniva distribuito in cima all'intero catalogo di OpenAI, ragionamento o meno. o3 e o4-mini sono arrivati dopo che la concorrenza (DeepSeek R1 lanciato a gennaio, seguito dai livelli di ragionamento di Grok e Gemini) ha costretto i laboratori di frontiera a difendere i prezzi di ragionamento nello stesso modo in cui erano già stati costretti a difendere i prezzi di chat di punta. I modelli di ragionamento di livello mini, in particolare, ora si avvicinano abbastanza ai prezzi di livello intermedio non ragionanti che "dovrei utilizzare un modello di ragionamento" ha smesso di essere principalmente una questione di costi per molti carichi di lavoro: è invece una domanda di latenza e catena di pensiero-gettone-budget.
Ciò che non è convergente è la qualità per dollaro ai massimi livelli. o1 e o3 non sono intercambiabili: o3 è il modello più recente, generalmente più potente, a una frazione del prezzo, il che rappresenta un semplice aggiornamento. DeepSeek R1 è un compromesso diverso: pesi aperti, auto-ospitabile e prezzo simile, ma confrontato in modo significativo dietro o3 su compiti di ragionamento difficili nella maggior parte delle valutazioni di terze parti che abbiamo visto citato. Il numero 27x contro o1 è reale e vale la pena conoscerlo. Non è la stessa affermazione di "R1 sostituisce o3 per 27x in meno": il confronto è più vicino a 3,7x ed è un compromesso di capacità, non un aggiornamento gratuito.
Non ancorarti al prezzo di o1: è lo SKU più costoso sul mercato con un ampio margine e sempre più spesso non quello contro cui i team dovrebbero fissare i prezzi. Ancorati su o3 o o4-mini come linea di base realistica di OpenAI, quindi decidi se lo sconto rimanente di 2-4 volte di DeepSeek R1 vale il sovraccarico di self-hosting o di inferenza di terze parti e se il calo di capacità delle varianti distillate è accettabile per il tuo compito. Dai un prezzo al tuo attuale mix di token: i carichi di lavoro di ragionamento distorcono l'output in un modo in cui i carichi di lavoro di chat non lo fanno, quindi il rapporto misto conta più qui che in qualsiasi altro posto nello stack dei costi API. Esegui i numeri su calcolatore dei costi dei gettoni di ragionamento o il calcolatore del superamento del token di ragionamento se i token nascosti della catena di pensiero sono la parte che non puoi prevedere e vedere la tassa simbolica per il confronto tra o3 e GPT-4.1 non ragionante sullo stesso prompt.
Metodologia: prezzi dalla nostra tabella dei prezzi monitorati (387 modelli) ad agosto 2026, corrispondenti alle tariffe per token da 1 milione pubblicate da ciascun fornitore. L'esempio pratico utilizza un rapporto token costruito di 1.500 ingressi/4.000 uscite per illustrare il ridimensionamento, non la telemetria da un sistema di produzione: conferma il mix di token del tuo carico di lavoro e la tariffa attuale di ciascun fornitore prima di definire il budget.