−97%
Prezzo di input della classe GPT-4 da marzo 2023
~10×
più economico all'anno a capacità costante
100×
Divario nel prezzo di lancio di DeepSeek V2 e GPT-4
2
notevoli aumenti dei prezzi in tre anni

Il crollo dei prezzi di frontiera, visualizzato

Prezzo di input per 1 milione di token per il miglior modello di "classe di frontiera" generalmente disponibile in ogni data. Stesso livello di capacità, a tre anni di distanza.

Mar 2023 · GPT-4
$30.00
Novembre 2023 · GPT-4 Turbo
$10.00
Maggio 2024 · GPT-4o
$5.00
Agosto 2024 · GPT-4o (tagliato)
$2.50
2025 · GPT-4.1 / Claude 4 livello
$2.00
2026 · padroni di casa a peso aperto
<$ 1,00

Non lo stesso modello, lo stesso classe di capacità. Questa distinzione è l’intera storia: i modelli non diventano più economici, lo fanno i livelli di capacità, poiché i modelli più recenti trasformano la frontiera di ieri in una merce.

Cronologia di ogni evento importante relativo ai prezzi

Marzo 2023
GPT-4 viene lanciato a $ 30 / $ 60 per 1 milione

Il prezzo che definisce "AI costosa". Una singola sessione di chat pesante potrebbe costare dollari. GPT-3.5 Turbo, a $2/$2, era il cavallo di battaglia in termini di volume.

Luglio 2023
Claude 2 arriva a $ 8 / $ 24 per 1 milione

Anthropic riduce GPT-4 di circa il 60% con una finestra di contesto di 100.000: la prima reale pressione sui prezzi a livello di frontiera.

Novembre 2023
GPT-4 Turbo: $ 10 / $ 30 −67% di ingresso

Il primo grande taglio di OpenAI. Più veloce, contesto da 128k e un terzo del prezzo. Lo schema è stabilito: ogni generazione spedisce meglio E più economico.

Marzo 2024
Famiglia Claude 3: Opus $15/$75 · Sonetto $3/$15 · Haiku $0,25/$1,25

Il menu a tre livelli diventa il modello del settore. Haiku a $ 0,25 rende casuali i carichi di lavoro da milioni di token; L'Opus fissa il massimale dei premi.

Maggio 2024
Lo shock di DeepSeek: V2 a $ 0,14 / $ 0,28 ~100 volte inferiore al lancio di GPT-4

Qualità quasi frontiera a due ordini di grandezza inferiore al prezzo di lancio di GPT-4. Scatena un'immediata guerra dei prezzi tra i fornitori cinesi (Alibaba, ByteDance tagliati in pochi giorni) e ripristina permanentemente il significato di "economico".

Maggio 2024
GPT-4o: $5 / $15 −50%

Half of Turbo's price, multimodal included. Frontier input is now 6× cheaper than 14 months earlier.

Luglio 2024
GPT-4o mini: $ 0,15 / $ 0,60 – elimina GPT-3.5 −70% vs 3.5T

Meglio del GPT-3.5 Turbo a meno di un terzo del suo prezzo. Il “livello di budget” ora supera la frontiera del 2023 nella maggior parte dei compiti.

Aug 2024
GPT-4o tagliato di nuovo: $ 2,50 / $ 10 −50%

Secondo halving in quattro mesi. L’input di frontiera è diminuito di 12 volte dal lancio di GPT-4 – 17 mesi.

Aug–Oct 2024
Repricing aggressivo di Gemini: Flash −78%, Pro −64%

Gemini 1.5 Flash drops from $0.35 to $0.075 input; 1.5 Pro from $3.50 to $1.25. Google buys market share with the steepest sustained cuts of any major provider.

Novembre 2024
Claude 3.5 Haiku: $ 0,80 / $ 4 +220% contro 3 Haiku

Il contro-esempio vale la pena ricordare: Anthropic ha valutato il nuovo Haiku 3,2 volte rispetto al suo predecessore, sostenendo che le capacità lo giustificavano. La deflazione è una tendenza, non una legge: i livelli di budget possono rivalutarsi e lo fanno al rialzo quando un modello supera le consegne.

dicembre 2024
o1 lancia il ragionamento sui prezzi: $ 15 / $ 60

I modelli di ragionamento ripristinano il tetto e introducono costi invisibili di "gettone del pensiero", in cui si paga per una catena di pensiero che non si vede mai. Nasce una nuova fascia premium a prezzi 2023.

Jan 2025
DeepSeek R1: ragionamento a 0,55$ / 2,19$ ~25× sotto o1

The second DeepSeek shock: o1-class reasoning at a fraction of the price, weights open. Briefly wipes ~$600B off Nvidia's market cap — the moment markets priced in that inference was becoming cheap.

Giugno 2025
o3 taglio dell’80%: $ 10 → $ 2 input −80%

Il più grande taglio percentuale singolo su un modello di ragionamento di punta: o3 scende a $ 2/$ 8 da un giorno all'altro, sottoquotando il suo fratello minore e confermando che il livello di ragionamento segue la stessa curva di deflazione, solo più velocemente.

2025–2026
Il livello base delle materie prime si forma: host a peso aperto inferiori a $ 1

I modelli di classe Llama-4, Qwen e DeepSeek serviti da Together, Fireworks, Groq e DeepInfra mettono la capacità di livello GPT-4 al di sotto di $ 1 per milione di token. I modelli chiusi di frontiera (GPT-5.5 a $ 5, livello Claude Opus) mantengono prezzi premium, ma il divario che devono giustificare continua ad ampliarsi.

Cosa dicono effettivamente tre anni di dati

1. I livelli di capacità si riducono di circa 10 volte all’anno; i singoli modelli raramente diventano più economici. Il prezzo di listino di GPT-4o è stato ridotto due volte, ma il meccanismo più grande è la sostituzione: il nuovo modello viene spedito al livello inferiore del vecchio modello. Budget per il livello, non per il nome del modello.

2. I prezzi dell’output scendono più lentamente di quelli dell’input. L’output di lancio di GPT-4 era 2× input ($ 60 contro $ 30); oggi i rapporti 4–5× sono standard (GPT-4o: $ 10 contro $ 2,50). I fornitori proteggono il margine sulla generazione. Se il tuo carico di lavoro è pesante (risposte lunghe, generazione di codice), la tua deflazione effettiva è significativamente più lenta di quanto suggeriscano i titoli.

3. Gli aumenti dei prezzi si verificano. Claude 3.5 Haiku (+220%) è quello famoso. Quando un modello "piccolo" si confronta come un modello di livello medio, il suo prezzo segue la capacità, non il lignaggio. Non codificare mai il presupposto che il livello economico rimanga economico.

4. Gli shock vengono dall'esterno. Entrambi i rilasci discontinui (maggio 2024, gennaio 2025) provenivano da DeepSeek, non dalla concorrenza storica. Probabilmente anche la prossima revisione dei prezzi arriverà da qualche parte inaspettata, il che depone a favore di un approccio indipendente dal fornitore rispetto alla profonda integrazione del singolo fornitore.

Cosa significa questo per il tuo budget

Sconto proiezioni a lungo termine. Una funzionalità che oggi costa 10.000 $ al mese nelle chiamate API costerà probabilmente 1-3.000 $ al mese con la stessa qualità tra 18 mesi. Gli aspetti economici delle unità di intelligenza artificiale che ora sembrano marginali spesso funzionano bene sulla curva di deflazione – e i contratti annuali impegnati ai tassi odierni combattono quella curva.

Riacquistare trimestralmente. IL Tabella comparativa di oltre 300 modelli riclassifica ogni modello in base al tuo attuale mix di token. Quindici minuti al trimestre consentono abitualmente un risparmio del 30-60% passando a un livello di carico di lavoro inferiore. IL calcolatore del risparmio in termini di riduzione dei prezzi prezzi esattamente quanto vale una migrazione.

Itinerario per difficoltà. Lo spread 100× tra i prezzi delle materie prime e quelli di frontiera è un'opportunità: la maggior parte delle query di produzione non necessitano di frontiera. IL calcolatore di routing del modello mostra i calcoli del costo misto.

⚠️ Tutti i prezzi sono prezzi di listino storici per 1 milione di token, compilati in base agli annunci dei fornitori e alle pagine dei prezzi archiviate. Dati di riferimento, verificati l'ultima volta nel luglio 2026. Segnala un errore →

Controllo del mercato in tempo reale: proprio adesso, da OpenRouter

Recupero dei prezzi dei modelli in tempo reale…

Dati in tempo reale dall'elenco pubblico dei modelli OpenRouter, recuperati dal tuo browser al caricamento della pagina: conferma indipendente che la curva di deflazione su questa pagina è ancora in esecuzione.

🔔 Ricevi un'e-mail quando cambiano i prezzi dei modelli

Differenziamo il nostro database dei prezzi di 387 modelli a ogni aggiornamento. Quando un fornitore modifica un prezzo (riduce o aumenta) gli abbonati ricevono un'e-mail in testo semplice che elenca esattamente ciò che è cambiato. Nessun marketing, nessun programma, solo eventi sui prezzi effettivi.