HomeBlog › La tassa di frontiera

La tassa di frontiera: l'eliminazione di un livello di modello consente di risparmiare il 40% o il 96% a seconda del fornitore

Pubblicato il 2 agosto 2026 · prezzi di riferimento dal nostro registro dei modelli 387, verifica prima di stabilire il budget

"Usa solo il modello piccolo" è il consiglio sui costi standard. Alla fine gli ho valutato correttamente il prezzo in tutto il nostro registro dei modelli e il consiglio si è rivelato quasi privo di significato da solo. Il downgrade di un livello all'interno della formazione di Anthropic ti salva 40%. La stessa identica mossa all'interno della formazione di Google salva 96%. Stessa decisione, stessa quantità di lavoro ingegneristico, profitto completamente diverso, perché il divario tra il fiore all'occhiello di un fornitore e il suo livello economico non è una costante. Si va da 1,7× a 24×.

Il carico di lavoro su cui ho valutato tutto

Un mese, Token di input da 200 milioni e token di output da 40 milioni. Si tratta di circa 250.000 richieste con 800 token in entrata e 160 in uscita: un prodotto dalla forma reale che fa classificazione, riepiloghi e brevi risposte alle chat. Nessuna memorizzazione nella cache, nessuno sconto per lotto, quindi i numeri rimangono comparabili. Tutti i prezzi riportati di seguito provengono dal nostro registro monitorato (387 modelli, prezzi di riferimento per luglio-agosto 2026).

Quanto ti costa effettivamente un livello inferiore

FamigliaLivello$/1 milione di dollari$/1 milione in uscitaMese
OpenAIGPT-5.5$5.00$30.00$2,200
GPT-5$1.25$10.00$650
GPT-5mini$0.40$1.60$144
GPT-5nano più economico$0.10$0.40$36
AntropicoClaude Opus 4.8$5.00$25.00$2,000
Claude Sonetto 4.6$3.00$15.00$1,200
ClaudeHaiku4.5$1.00$5.00$400
GoogleGemelli 3.1 Pro$2.00$12.00$880
Gemelli 3.1Flash$0.10$0.40$36
Gemini 3.1 Flash Lite$0.05$0.20$18
xAIGrok 4$3.00$15.00$1,200
Grok 4 mini$0.50$2.50$200
DeepSeekDeepSeek V4$0.27$1.10$98
DeepSeek V4Flash$0.14$0.28$39
MaestraleMistral Grande$2.00$6.00$640
Mistral Piccolo$0.10$0.30$32
⚠️ Prezzi di riferimento, agosto 2026. Verifica sempre sulla pagina del fornitore prima di fissare il budget. Esegui il tuo mix di token attraverso il file Calcolatore dei costi dell'API AI. · Segnala prezzo obsoleto →

La tabella a un gradino è quella interessante

Elimina tutto tranne la mossa che la maggior parte delle squadre considera effettivamente: puntare al livello immediatamente inferiore:

MossaPrima → dopoSalvato
Opera 4.8 → Sonetto 4.6$ 2.000 → $ 1.20040%
DeepSeek V4 → V4 Flash$98 → $3960%
GPT-5.5 → GPT-5$ 2.200 → $ 65070%
Grok 4 → Grok 4 mini$ 1.200 → $ 20083%
Mistral Grande → Piccolo$ 640 → $ 3295%
Gemini 3.1 Pro→Flash$880 → $3696%

Quaranta per cento contro novantasei per cento. Entrambi sono "usa il modello più piccolo". Uno di questi vale uno sprint di lavoro di valutazione e un livello di routing; l'altro vale al massimo un pomeriggio, perché passerai più ore di ingegnere a dimostrare che Sonnet è abbastanza buono degli 800 dollari risparmiati.

Perché il divario di Anthropic è così ridotto

Questo non significa che Anthropic sia avaro di sconti. È il contrario: la loro ammiraglia è diventata notevolmente più economica. Claude Opus 4.1 si trova nel nostro registro all'indirizzo $15/$75. Opus 4.5, 4.6 e 4.8 si trovano tutti a $5/$25 - un taglio 3× in cima alla scaletta senza modifiche al prezzo del Sonetto o dell'Haiku. Nel mio mese di token da 240 milioni, Opus è passato da $ 6.000 a $ 2.000.

L'effetto collaterale: il divario tra Opus e Sonnet è crollato da 5× a 1,67×. La tassa di frontiera presso Anthropic ha quasi smesso di esistere. OpenAI ha fatto la stessa cosa su un asse diverso: o1 a $ 15/$ 60 è stato sostituito da GPT-5 a $ 1,25/$ 10, quindi l'elemento pubblicitario del modello di frontiera costoso che le persone avevano preventivato nel 2025 è ora un ordine di grandezza diverso.

Google è andato dall'altra parte. Hanno mantenuto il prezzo Pro ragionevole a $2/$12 e hanno spinto Flash-Lite a $0,05/$0,20, quindi il loro spread interno è ora il più ampio di qualsiasi grande famiglia. Niente di tutto ciò è casuale: è una presentazione di routing.

Il numero del fornitore incrociato che mi ha infastidito

Gemini 3.1 Costi Flash $36 su questo carico di lavoro. DeepSeek V4, che mentalmente avevo classificato come "l'opzione economica", costa $98 – quasi 3 volte di più. E GPT-5.5 a $ 2.200 lo è 122 volte il prezzo di Gemini 3.1 Flash-Lite a $ 18 per spostare lo stesso volume di token.

Avevo con me una classifica mentale dei prezzi vecchia di due anni. Era sbagliato in entrambe le direzioni. La reputazione dei venditori a buon mercato è in ritardo di circa un anno rispetto ai prezzi effettivi e i numeri si muovono più velocemente del folklore.

Cosa faccio con questo

1. Controllo il divario di livello prima di costruire il router. Se da flagship a mini è inferiore a 2×, una cascata non vale la complessità o il budget di valutazione: prendo invece l'ammiraglia e dedico gli sforzi al caching immediato, che riduce di più.

2. Se il divario è 20×, sposto in modo aggressivo. Il livello economico gestisce la classificazione, l'estrazione, il tagging e il routing. L'ammiraglia vede solo ciò che non supera un controllo di affidabilità. Sullo spread di Google che trasforma 880 dollari in qualcosa di vicino a 60 dollari con un tasso di incremento del 10% – l’aritmetica è nel Calcolatore del risparmio in cascata LLM e il calcolatore del risparmio di routing del modello.

3. Rivaluto l'intera gamma ogni trimestre. La rivalutazione di Opus ha cambiato le ottimizzazioni che valeva la pena fare e l'ho scoperto con settimane di ritardo. Questo è ciò che tracker del cambiamento di prezzo è per ora.

4. Non faccio mai confronti solo in base al prezzo dei fattori produttivi. L'output esegue un input 4× in media sui 97 modelli di chat proprietari che ho controllato e 6× su GPT-5.5 e Gemini 3.1 Pro. Un modello loquace con un tasso di input basso perde contro uno conciso con un tasso costoso più spesso di quanto le persone si aspettino. Se la tua app cambia modello, anche il costo di migrazione è importante: consulta il calcolatore dei costi di migrazione del modello.

Metti il ​​tuo token diviso nel Calcolatore dei costi API AI →o modellare un prodotto completo in Stima dei costi delle app AI e il calcolatore dei costi del chatbot. Nuovo ai prezzi dei token? Inizia alle Scopri: come funzionano i prezzi API.

Stime di riferimento, agosto 2026, tratte dal nostro registro dei modelli tracciati. I prezzi cambiano senza preavviso ed escludono la memorizzazione nella cache, sconti batch e volume: verifica con il fornitore prima di impegnare un budget. Non affiliato con OpenAI, Anthropic, Google, xAI, DeepSeek o Mistral.