Il crollo dei prezzi di frontiera, visualizzato
Prezzo di input per 1 milione di token per il miglior modello di "classe di frontiera" generalmente disponibile in ogni data. Stesso livello di capacità, a tre anni di distanza.
Non lo stesso modello, lo stesso classe di capacità. Questa distinzione è l’intera storia: i modelli non diventano più economici, lo fanno i livelli di capacità, poiché i modelli più recenti trasformano la frontiera di ieri in una merce.
Cronologia di ogni evento importante relativo ai prezzi
Il prezzo che definisce "AI costosa". Una singola sessione di chat pesante potrebbe costare dollari. GPT-3.5 Turbo, a $2/$2, era il cavallo di battaglia in termini di volume.
Anthropic riduce GPT-4 di circa il 60% con una finestra di contesto di 100.000: la prima reale pressione sui prezzi a livello di frontiera.
Il primo grande taglio di OpenAI. Più veloce, contesto da 128k e un terzo del prezzo. Lo schema è stabilito: ogni generazione spedisce meglio E più economico.
Il menu a tre livelli diventa il modello del settore. Haiku a $ 0,25 rende casuali i carichi di lavoro da milioni di token; L'Opus fissa il massimale dei premi.
Qualità quasi frontiera a due ordini di grandezza inferiore al prezzo di lancio di GPT-4. Scatena un'immediata guerra dei prezzi tra i fornitori cinesi (Alibaba, ByteDance tagliati in pochi giorni) e ripristina permanentemente il significato di "economico".
Half of Turbo's price, multimodal included. Frontier input is now 6× cheaper than 14 months earlier.
Meglio del GPT-3.5 Turbo a meno di un terzo del suo prezzo. Il “livello di budget” ora supera la frontiera del 2023 nella maggior parte dei compiti.
Secondo halving in quattro mesi. L’input di frontiera è diminuito di 12 volte dal lancio di GPT-4 – 17 mesi.
Gemini 1.5 Flash drops from $0.35 to $0.075 input; 1.5 Pro from $3.50 to $1.25. Google buys market share with the steepest sustained cuts of any major provider.
Il contro-esempio vale la pena ricordare: Anthropic ha valutato il nuovo Haiku 3,2 volte rispetto al suo predecessore, sostenendo che le capacità lo giustificavano. La deflazione è una tendenza, non una legge: i livelli di budget possono rivalutarsi e lo fanno al rialzo quando un modello supera le consegne.
I modelli di ragionamento ripristinano il tetto e introducono costi invisibili di "gettone del pensiero", in cui si paga per una catena di pensiero che non si vede mai. Nasce una nuova fascia premium a prezzi 2023.
The second DeepSeek shock: o1-class reasoning at a fraction of the price, weights open. Briefly wipes ~$600B off Nvidia's market cap — the moment markets priced in that inference was becoming cheap.
Il più grande taglio percentuale singolo su un modello di ragionamento di punta: o3 scende a $ 2/$ 8 da un giorno all'altro, sottoquotando il suo fratello minore e confermando che il livello di ragionamento segue la stessa curva di deflazione, solo più velocemente.
I modelli di classe Llama-4, Qwen e DeepSeek serviti da Together, Fireworks, Groq e DeepInfra mettono la capacità di livello GPT-4 al di sotto di $ 1 per milione di token. I modelli chiusi di frontiera (GPT-5.5 a $ 5, livello Claude Opus) mantengono prezzi premium, ma il divario che devono giustificare continua ad ampliarsi.
Cosa dicono effettivamente tre anni di dati
1. I livelli di capacità si riducono di circa 10 volte all’anno; i singoli modelli raramente diventano più economici. Il prezzo di listino di GPT-4o è stato ridotto due volte, ma il meccanismo più grande è la sostituzione: il nuovo modello viene spedito al livello inferiore del vecchio modello. Budget per il livello, non per il nome del modello.
2. I prezzi dell’output scendono più lentamente di quelli dell’input. L’output di lancio di GPT-4 era 2× input ($ 60 contro $ 30); oggi i rapporti 4–5× sono standard (GPT-4o: $ 10 contro $ 2,50). I fornitori proteggono il margine sulla generazione. Se il tuo carico di lavoro è pesante (risposte lunghe, generazione di codice), la tua deflazione effettiva è significativamente più lenta di quanto suggeriscano i titoli.
3. Gli aumenti dei prezzi si verificano. Claude 3.5 Haiku (+220%) è quello famoso. Quando un modello "piccolo" si confronta come un modello di livello medio, il suo prezzo segue la capacità, non il lignaggio. Non codificare mai il presupposto che il livello economico rimanga economico.
4. Gli shock vengono dall'esterno. Entrambi i rilasci discontinui (maggio 2024, gennaio 2025) provenivano da DeepSeek, non dalla concorrenza storica. Probabilmente anche la prossima revisione dei prezzi arriverà da qualche parte inaspettata, il che depone a favore di un approccio indipendente dal fornitore rispetto alla profonda integrazione del singolo fornitore.
Cosa significa questo per il tuo budget
Sconto proiezioni a lungo termine. Una funzionalità che oggi costa 10.000 $ al mese nelle chiamate API costerà probabilmente 1-3.000 $ al mese con la stessa qualità tra 18 mesi. Gli aspetti economici delle unità di intelligenza artificiale che ora sembrano marginali spesso funzionano bene sulla curva di deflazione – e i contratti annuali impegnati ai tassi odierni combattono quella curva.
Riacquistare trimestralmente. IL Tabella comparativa di oltre 300 modelli riclassifica ogni modello in base al tuo attuale mix di token. Quindici minuti al trimestre consentono abitualmente un risparmio del 30-60% passando a un livello di carico di lavoro inferiore. IL calcolatore del risparmio in termini di riduzione dei prezzi prezzi esattamente quanto vale una migrazione.
Itinerario per difficoltà. Lo spread 100× tra i prezzi delle materie prime e quelli di frontiera è un'opportunità: la maggior parte delle query di produzione non necessitano di frontiera. IL calcolatore di routing del modello mostra i calcoli del costo misto.
Controllo del mercato in tempo reale: proprio adesso, da OpenRouter
Recupero dei prezzi dei modelli in tempo reale…
Dati in tempo reale dall'elenco pubblico dei modelli OpenRouter, recuperati dal tuo browser al caricamento della pagina: conferma indipendente che la curva di deflazione su questa pagina è ancora in esecuzione.
🔔 Ricevi un'e-mail quando cambiano i prezzi dei modelli
Differenziamo il nostro database dei prezzi di 387 modelli a ogni aggiornamento. Quando un fornitore modifica un prezzo (riduce o aumenta) gli abbonati ricevono un'e-mail in testo semplice che elenca esattamente ciò che è cambiato. Nessun marketing, nessun programma, solo eventi sui prezzi effettivi.