Pubblicato il 2 agosto 2026 · prezzi di riferimento dal nostro registro dei modelli 387, verifica prima di stabilire il budget
"Usa solo il modello piccolo" è il consiglio sui costi standard. Alla fine gli ho valutato correttamente il prezzo in tutto il nostro registro dei modelli e il consiglio si è rivelato quasi privo di significato da solo. Il downgrade di un livello all'interno della formazione di Anthropic ti salva 40%. La stessa identica mossa all'interno della formazione di Google salva 96%. Stessa decisione, stessa quantità di lavoro ingegneristico, profitto completamente diverso, perché il divario tra il fiore all'occhiello di un fornitore e il suo livello economico non è una costante. Si va da 1,7× a 24×.
Un mese, Token di input da 200 milioni e token di output da 40 milioni. Si tratta di circa 250.000 richieste con 800 token in entrata e 160 in uscita: un prodotto dalla forma reale che fa classificazione, riepiloghi e brevi risposte alle chat. Nessuna memorizzazione nella cache, nessuno sconto per lotto, quindi i numeri rimangono comparabili. Tutti i prezzi riportati di seguito provengono dal nostro registro monitorato (387 modelli, prezzi di riferimento per luglio-agosto 2026).
| Famiglia | Livello | $/1 milione di dollari | $/1 milione in uscita | Mese |
|---|---|---|---|---|
| OpenAI | GPT-5.5 | $5.00 | $30.00 | $2,200 |
| GPT-5 | $1.25 | $10.00 | $650 | |
| GPT-5mini | $0.40 | $1.60 | $144 | |
| GPT-5nano più economico | $0.10 | $0.40 | $36 | |
| Antropico | Claude Opus 4.8 | $5.00 | $25.00 | $2,000 |
| Claude Sonetto 4.6 | $3.00 | $15.00 | $1,200 | |
| ClaudeHaiku4.5 | $1.00 | $5.00 | $400 | |
| Gemelli 3.1 Pro | $2.00 | $12.00 | $880 | |
| Gemelli 3.1Flash | $0.10 | $0.40 | $36 | |
| Gemini 3.1 Flash Lite | $0.05 | $0.20 | $18 | |
| xAI | Grok 4 | $3.00 | $15.00 | $1,200 |
| Grok 4 mini | $0.50 | $2.50 | $200 | |
| DeepSeek | DeepSeek V4 | $0.27 | $1.10 | $98 |
| DeepSeek V4Flash | $0.14 | $0.28 | $39 | |
| Maestrale | Mistral Grande | $2.00 | $6.00 | $640 |
| Mistral Piccolo | $0.10 | $0.30 | $32 |
Elimina tutto tranne la mossa che la maggior parte delle squadre considera effettivamente: puntare al livello immediatamente inferiore:
| Mossa | Prima → dopo | Salvato |
|---|---|---|
| Opera 4.8 → Sonetto 4.6 | $ 2.000 → $ 1.200 | 40% |
| DeepSeek V4 → V4 Flash | $98 → $39 | 60% |
| GPT-5.5 → GPT-5 | $ 2.200 → $ 650 | 70% |
| Grok 4 → Grok 4 mini | $ 1.200 → $ 200 | 83% |
| Mistral Grande → Piccolo | $ 640 → $ 32 | 95% |
| Gemini 3.1 Pro→Flash | $880 → $36 | 96% |
Quaranta per cento contro novantasei per cento. Entrambi sono "usa il modello più piccolo". Uno di questi vale uno sprint di lavoro di valutazione e un livello di routing; l'altro vale al massimo un pomeriggio, perché passerai più ore di ingegnere a dimostrare che Sonnet è abbastanza buono degli 800 dollari risparmiati.
Questo non significa che Anthropic sia avaro di sconti. È il contrario: la loro ammiraglia è diventata notevolmente più economica. Claude Opus 4.1 si trova nel nostro registro all'indirizzo $15/$75. Opus 4.5, 4.6 e 4.8 si trovano tutti a $5/$25 - un taglio 3× in cima alla scaletta senza modifiche al prezzo del Sonetto o dell'Haiku. Nel mio mese di token da 240 milioni, Opus è passato da $ 6.000 a $ 2.000.
L'effetto collaterale: il divario tra Opus e Sonnet è crollato da 5× a 1,67×. La tassa di frontiera presso Anthropic ha quasi smesso di esistere. OpenAI ha fatto la stessa cosa su un asse diverso: o1 a $ 15/$ 60 è stato sostituito da GPT-5 a $ 1,25/$ 10, quindi l'elemento pubblicitario del modello di frontiera costoso che le persone avevano preventivato nel 2025 è ora un ordine di grandezza diverso.
Google è andato dall'altra parte. Hanno mantenuto il prezzo Pro ragionevole a $2/$12 e hanno spinto Flash-Lite a $0,05/$0,20, quindi il loro spread interno è ora il più ampio di qualsiasi grande famiglia. Niente di tutto ciò è casuale: è una presentazione di routing.
Gemini 3.1 Costi Flash $36 su questo carico di lavoro. DeepSeek V4, che mentalmente avevo classificato come "l'opzione economica", costa $98 – quasi 3 volte di più. E GPT-5.5 a $ 2.200 lo è 122 volte il prezzo di Gemini 3.1 Flash-Lite a $ 18 per spostare lo stesso volume di token.
Avevo con me una classifica mentale dei prezzi vecchia di due anni. Era sbagliato in entrambe le direzioni. La reputazione dei venditori a buon mercato è in ritardo di circa un anno rispetto ai prezzi effettivi e i numeri si muovono più velocemente del folklore.
1. Controllo il divario di livello prima di costruire il router. Se da flagship a mini è inferiore a 2×, una cascata non vale la complessità o il budget di valutazione: prendo invece l'ammiraglia e dedico gli sforzi al caching immediato, che riduce di più.
2. Se il divario è 20×, sposto in modo aggressivo. Il livello economico gestisce la classificazione, l'estrazione, il tagging e il routing. L'ammiraglia vede solo ciò che non supera un controllo di affidabilità. Sullo spread di Google che trasforma 880 dollari in qualcosa di vicino a 60 dollari con un tasso di incremento del 10% – l’aritmetica è nel Calcolatore del risparmio in cascata LLM e il calcolatore del risparmio di routing del modello.
3. Rivaluto l'intera gamma ogni trimestre. La rivalutazione di Opus ha cambiato le ottimizzazioni che valeva la pena fare e l'ho scoperto con settimane di ritardo. Questo è ciò che tracker del cambiamento di prezzo è per ora.
4. Non faccio mai confronti solo in base al prezzo dei fattori produttivi. L'output esegue un input 4× in media sui 97 modelli di chat proprietari che ho controllato e 6× su GPT-5.5 e Gemini 3.1 Pro. Un modello loquace con un tasso di input basso perde contro uno conciso con un tasso costoso più spesso di quanto le persone si aspettino. Se la tua app cambia modello, anche il costo di migrazione è importante: consulta il calcolatore dei costi di migrazione del modello.
Metti il tuo token diviso nel Calcolatore dei costi API AI →o modellare un prodotto completo in Stima dei costi delle app AI e il calcolatore dei costi del chatbot. Nuovo ai prezzi dei token? Inizia alle Scopri: come funzionano i prezzi API.
Stime di riferimento, agosto 2026, tratte dal nostro registro dei modelli tracciati. I prezzi cambiano senza preavviso ed escludono la memorizzazione nella cache, sconti batch e volume: verifica con il fornitore prima di impegnare un budget. Non affiliato con OpenAI, Anthropic, Google, xAI, DeepSeek o Mistral.